Chunlin 的论文科普

AI 家教到底会不会教?从3项新研究看智能辅导的「教学能力」边界

你可能见过这样的场景:家长给孩子买了AI数学辅导工具,以为能针对性补短板,结果孩子用了两周,分数没涨,兴趣也没提;另一边,有人用AI练英语口语,说它比线下老师还懂「什么时候该纠正、什么时候该鼓励」。同样是AI家教,为什么差距这么大?

决定AI辅导效果的核心因素,究竟是模型能力,还是对「教学专业逻辑」的嵌入程度?

一个反直觉的发现:AI 补数学,未必比传统上课好

很多人对AI家教的第一印象是「精准、高效、个性化」,但真实课堂里的效果,可能和想象的不太一样。

2026年的一篇博士论文做了一项很实在的研究:他们找了22名小学4-5年级的学生,分成两组学分数——一组用叫Mathbot的AI个性化学习工具,另一组照常上常规数学课。实验一共5天,每天40分钟,内容都是分数比较这个知识点。研究者既测了学生的分数理解能力,也测了他们对数学的情境兴趣 [1]。

结果有点反直觉:两组学生的分数理解都有进步,但用AI的那组,提升幅度并没有比常规上课更好,甚至后测得分还低于常规教学组。更有意思的是,两组学生对数学的兴趣都没出现明显变化——也就是说,AI既没让孩子更爱数学,也没让他们更讨厌数学 [1]。

你可能会想:是不是这个AI太笨了?其实不是。Mathbot已经做了很多「个性化」设计:它会把题目改成学生喜欢的主题,比如喜欢篮球的孩子会遇到「3/8个篮球和5/8个篮球哪个大」的问题,还会用学生的名字打招呼,每次回答不超过60个字,尽量贴合小学生的认知节奏 [1]。

那为什么效果还是一般?这篇研究的系统综述部分给出了一条线索:他们梳理了2020到2024年的14项AI数学教育课堂研究,发现干预时间越长,效果通常越好;而短期(比如只有几天)的AI干预,效应量普遍很小 [1]。换句话说,AI不是「神药」,指望用几天就看到明显效果,本身就不现实。

当然,这个实验本身也有局限:样本量很小,只有22个孩子,而且两组的年级、性别分布不太均衡,AI组的前测分数本来就比对照组低,所以结果不能直接推广到更多学校、更多知识点 [1]。但它至少戳破了一个刻板印象:AI不是用了就一定能提升学习效果

那问题来了:为什么有的AI辅导工具让人觉得「特别会教」,有的却像个会答题的机器人?

为什么有的 AI 更会教?答案在「教学决策」里

我们先来看一个反直觉的研究结果:一个只有40亿参数的开源小模型,在英语一对一辅导的「教学适配性」上,居然超过了GPT-5.5、Claude Opus这些商用大模型 [2]。

它的秘密不在于更聪明,而在于专门学了一门课——教学决策(pedagogical decision-making)。这个词听起来有点专业,你可以把它理解成「老师在每一个瞬间,决定下一步该说什么的能力」:学生答对了,是直接夸一句就过,还是顺着这个知识点拓展一下?学生说错了,是马上纠正,还是先给个提示让他自己想?学生只是在闲聊,要不要打断他纠正语法?

这些选择,就是教学的专业含量所在。普通大模型英语说得再流利,也未必懂这些门道。

这项研究提出的框架叫TACT(Taxonomy-Aligned Conversational Tutor,分类对齐式对话导师),他们做的第一件事,就是把人类英语辅导老师的行为拆成了一套清晰的「教学策略分类」:一共13种策略,覆盖互动管理、教学支持、语言反馈三大类,比如「情感支持」「引导修正」「直接纠正」「澄清检查」等等。同时他们也把学生的话轮分成了不同类型和状态——比如学生是在提问、作答还是闲聊?作答是答对了、需要修正还是没法评估 [2]?

你可以把这套分类想象成给AI老师准备的「教学工具箱」和「学生状态说明书」。有了这套框架,他们再把260节真实的一对一英语辅导课逐句标注,做成了有3万多条标注的训练数据,然后用「监督微调+分类对齐的强化学习」两阶段方法训练模型 [2]。

训练出来的模型效果怎么样?在专门测教学决策的基准测试里,这个4B小模型的得分超过了所有参评的商用大模型,可接受率从原来的60%升到了87%,「直接泄露答案」这种错误从34.6%降到了2.6%。50个学习者参与的盲测里,大家也觉得这个AI老师在鼓励、引导、支架式教学这些维度上明显更好 [2]。

当然,实际情况比这个比喻更复杂:真实的老师会同时融合教学节奏、情感连接、师生关系等很多维度,不是13种策略能完全拆分开的。而且这个研究只测了单轮回复的质量,还没验证长期下来学生的英语水平到底有没有真的提高 [2]。

类似的思路也出现在运动教练领域。另一项研究叫AIDE(Automated Instruction via Distilled Expertise,专家知识蒸馏式自动指导),它要解决的问题是:AI运动教练如果想给学员反馈,通常需要同时看学员的动作和专家的示范动作做对比,但现实里不可能每次都有专家动作当参考 [3]。

他们的做法是「专家知识蒸馏」——训练的时候,让AI老师(教师模型)同时看学员和专家的动作,学会怎么找差异、怎么给反馈;然后再训练一个学生模型,只继承教师模型里「看学员动作」的部分,用一个辅助模块偷偷学会「怎么从学员动作里脑补出差异」。整个过程没有硬逼学生模型模仿教师的差异计算方式,只是靠共享编码器和权重初始化这种「软方式」传递知识,效果反而比显式蒸馏更好 [3]。

结果也很有意思:在篮球跳投的反馈上,这个推理时完全不用看专家动作的AI教练,反馈质量已经接近那些需要实时参考专家动作的方法。比如同样看一个学员的跳投,基线模型只看出手姿势不对,AIDE却能准确指出「腿没跳起来」这个根本问题 [3]。

当然,它的局限也很明显:足球项目因为训练数据少,效果就不太稳定;而且现在只测了文本反馈的质量,还没有真实人类教练来评估这些反馈到底能不能帮人真的提高运动水平 [3]。

把这两个领域的研究放在一起看,答案就很清楚了:AI会不会教,关键不在于模型有多大,而在于它有没有把「教学决策」这种专业能力内化进去。只会答题、只会说流利英语的AI,不是好老师;懂什么时候该说什么、怎么说最有利于学习的AI,才真正具备「辅导能力」。

智能辅导走了多远:从工具到「懂教学」的伙伴

看到这里你可能会问:智能辅导系统(Intelligent Tutoring System,ITS,就是能提供个性化自适应学习支持的AI系统)到底发展到哪一步了?我们离真正的AI家教还有多远?

其实这个领域已经发展了数十年。早期的智能辅导系统更像「自适应题库」——根据你答对答错来调整下一题的难度,核心是知识点的追踪。后来大模型出来了,AI能自然对话了,大家又开始往「对话式辅导」走,能讲题、能互动了 [4][5]。

但走得越深,大家越发现一个问题:技术能力强不等于教学能力强。就像我们前面看到的,数学AI工具做了很多个性化设计,效果却未必比常规上课好 [1];而一个小模型只要专门学了教学策略,就能在辅导体验上超过大模型 [2]。

现在这个领域正在经历一个转向:从「追求AI有多聪明」,转向「追求AI有多懂教学」。比如马耳他的DAVE系统,就是把大模型和专门的自动提示引擎结合,嵌入到当地小学已有的学习应用里,给学生提供数学辅导。结果发现,它比普通商用聊天机器人的效果好很多,尤其是对数学基础弱的学生帮助更大 [6]。还有面向资源不足地区的「无屏智能辅导系统」MathAIde,不用每个学生都有电脑,也能提供个性化学习支持,老师觉得它帮了不少忙,但也存在技术不稳定、内容不够灵活的问题 [4]。

这些研究都指向同一个结论:AI辅导的效果,从来不是AI单方面决定的,而是AI和教学场景、教师角色、使用方式共同作用的结果。一篇2025年的系统综述梳理了近年的AI数学教育研究,发现凡是效果好的AI干预,通常都有两个特点:一是持续时间比较长,二是有教师的深度参与 [5]。

这也回到了我们最开始那个数学实验的结论:自动化的个性化,替代不了老师的教学角色。AI解简单数学题很厉害,但遇到几何等复杂问题时经常出错,还得老师来纠正;AI能帮着做练习、给反馈,但激发兴趣、建立关系、应对课堂里各种复杂的生成性问题,还是得靠人 [1]。

那当前的研究还有哪些没解决的问题?首先是长期效果存疑——大部分研究只测了短期的成绩变化或者单轮的回复质量,AI辅导能不能帮学生真正掌握知识、保持兴趣,还需要更长时间的跟踪 [1][2]。其次是泛化性的问题:在英语辅导里好用的教学策略分类,放到数学、物理里还能用吗?在篮球上好用的运动教练方法,放到康复训练里行不行?这些都还不确定 [2][3]。还有伦理和公平的问题:AI会不会有算法偏见?在资源不足的地区能不能真正落地?这些也都是摆在眼前的挑战 [1][4]。

如果你只记住一件事

AI家教的能力边界,从来不是由模型大小画的,而是由它对「教学专业逻辑」的理解深度画的。


参考文献

  1. Exploring Fraction Comprehension and Interest in Elementary Education Through AI-Powered Personalized Learning(arXiv、2026、全文精读)
  2. TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring(arXiv、2026、全文精读)
  3. AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching(arXiv、2026、全文精读)
  4. MathAIde in the Classroom: A Qualitative Analysis of Teachers Perspectives of Intelligent Tutoring Systems Unplugged(2024、仅摘要)
  5. Artificial Intelligence Interventions in Mathematics Education: A Systematic Literature Review(Insights into Learning Disabilities、2025、仅摘要)
  6. DAVE: Integrating Personalized AI Tutoring FOR ENGAGED LEARNING(OAR@UM (University of Malta)、2025、仅摘要)