Chunlin 的论文科普

AI 辅导为什么撑不过一周?从「三分钟热度」到长期教学的距离有多远

你可能见过这样的场景:学生刚开始用AI辅导时兴致很高,错题有人讲、疑问有人答,头几天进步明显;但一周过后,要么AI的回复越来越敷衍,要么学生成绩再也上不去——就像办了健身卡只坚持头一周。这到底是个别产品的问题,还是当前AI辅导的普遍瓶颈?

一、「头几天管用,之后就不行了」是普遍现象吗?

如果只看单次对话或单题辅导,现在的AI辅导工具表现其实都不差:讲题清晰、反应迅速,还能举一反三。但一旦把时间拉长到几周,情况就不一样了。

最近一项长达30天的模拟评估给出了一个有点扎心的结论:几乎所有当前的AI辅导组合,都撑不过一周的高质量教学。这项研究提出了首个面向教学型大语言模型(Large Language Model, LLM,也就是我们常说的大模型)智能体的长周期基准测试 EduClaw-Bench,在55个不同学习场景下连续观测AI老师和模拟学生的互动,结果发现所有智能体在5-10天内就进入了学习平台期,学生的解题正确率不再提升,30天下来整体学习增益微乎其微 [1]。

这不是某一款产品的问题,而是整个领域的普遍瓶颈。过去我们评价AI辅导,大多看的是「这道题讲得对不对」「这次对话满不满意」,但教学本质上是个长周期的事——真正的学习发生在几天、几周的持续互动里,而不是一次答疑中。当我们把评价尺度从「单次对话」拉到「30天教学」,之前被掩盖的问题就全都暴露出来了。

当然,实际情况比这个比喻更复杂:平台期的出现不一定是AI变「敷衍」了,更可能是它的教学能力本来就只够支撑短期效果,长期就后继乏力了。

二、怎么科学测量「AI老师能不能教满一个月」?

要衡量AI的长期教学能力,最大的难题是:你总不能真的找几百个学生,陪每个AI老师上一个月的课吧?成本高、周期长,还很难控制变量。

EduClaw-Bench的解决思路是:用模拟学习者(simulated learner)来替代真实学生,构建一个30天的虚拟教学环境 [1]。这个模拟学生可不是随便编的,它的核心是知识追踪(Knowledge Tracing, KT)技术——简单说就是用机器学习模型,基于真实学生的答题数据,来追踪学生对每个知识点的掌握程度。研究团队在一个包含5000多名小学生数学学习记录的数据集上训练了知识追踪模型,维护着831个知识点的掌握度信念,再让大模型基于这个信念来模拟学生的作答和提问 [1]。

打个比方,这就像给AI老师找了个「数字孪生」学生:它的知识水平、易错点、学习节奏,都是从真实学生数据里长出来的,不是凭空设定的。研究团队还做了校准验证,这个模拟学生的答题正确率和真实学生的匹配误差(ECE)只有0.049,几乎贴合理想对角线 [1]。后来他们又在真实课堂里做了实地测试,约500名K-12学生参与,结果显示模拟环境下的帮助性评分和真实课堂几乎没有显著差异 [1]。

整个基准测试包含11种学习者人格乘以5种学习计划,一共55个场景 [1]。AI老师不是只能聊天,它可以通过学习管理系统(Learning Management System, LMS,就是学校常用的那种教学管理平台)的接口,做5件事:发消息、保持沉默、布置习题、调整难度、提供学习内容 [1]。

最后评估维度也不止「成绩提升」这一项,而是3个主维度加2个课程设计维度:学习增益(解题正确率提升多少)、响应性(回消息及不及时)、帮助性(对学习有没有真帮助),再加上基于加涅九事件和罗森海因十原则这两套经典教学理论的课程设计评分 [1]。其中帮助性和课程维度,是由3个不同家族的大模型评委共同打分,避免单一模型的偏见 [1]。

三、两个反直觉发现:不是模型越大越好,也不是回复越快越好

用这套基准测试了10个智能体适配器、3个不同层级的基础模型之后,研究得出了两个挺反直觉的结论 [1]。

第一个反直觉:辅导质量不是光看基础模型强不强,而是基础模型和智能体架构共同决定的。没有哪一个适配器能在所有模型层级上都拿第一——在前沿闭源模型上表现最好的组合,换到小模型上可能就不灵了,甚至排名会反转 [1]。这和我们平时的认知不太一样:我们总觉得「更强的模型 = 更好的老师」,但教学这件事,模型的通用能力只是基础,怎么把它组织成一个会教学的智能体,同样重要。

这一点也得到了更早研究的佐证。2025年提出的EducationQ评估框架,在13个学科、10个难度层级上测试了14个大模型,就发现教学效果和模型规模之间没有线性关系——一些较小的开源模型,在教学场景下甚至能打败更大的商业模型 [4]。因为教学需要的不是知识最多,而是会不会提问、会不会引导、能不能把握节奏。

第二个反直觉更有意思:秒回的AI,反而可能不是好老师。研究发现,那些总是立刻回复学生问题、响应率接近100%的AI,在帮助性评分上反而比「慢半拍」的老师低1.5到2分 [1]。

为什么会这样?另一篇专门研究AI「过度协助」的论文给出了解释。这项研究构建了一个叫Int-Bench的测试框架,模拟老师观察学生解题、决定何时干预的过程,结果发现当前的大模型老师是出了名的「急性子」:在标准场景下,AI平均只看了学生18%的解题思路就忍不住插嘴,而人类老师会等到74%的位置才介入 [2]。相当于学生刚写了个开头,AI就把答案递过去了。

而且AI还特别爱直接给答案:LLM直接给出完整答案的比例是人类的约2倍,将近一半的AI干预提供了近乎完整的解题框架,而人类老师只有约五分之一会这么做 [2]。这样做的后果是——学生当下这道题可能做对了,但遇到同类型的新题时,正确率几乎没有提升 [2]。说白了就是「给了鱼,没教会钓鱼」。

有趣的是,当AI能看到完整解题过程和最终答案时(也就是所谓的「全知条件」),它的干预率反而从90%骤降到54%,而且几乎不会在学生本来能做对的题上瞎帮忙 [2]。这说明AI的「过度热心」,很大程度上是因为信息不全就急于行动——它没耐心等学生自己想,也判断不准学生是不是真的需要帮助。

四、为什么AI辅导撑不过一周?从单次互动到长期教学的三道坎

知道了「是什么」,接下来要问「为什么」。为什么AI辅导短期看起来都挺好用,一拉长到几周就不行了?结合这几项研究,我们可以梳理出三道主要的坎。

第一道坎:干预时机错配——帮得太早、太勤,反而扼杀了长期学习。

刚才说的「过度协助」就是最典型的表现。短期来看,AI秒回、直接给答案,学生体验特别好,错题马上就能搞懂,家长也觉得「值」。但从长期看,学生缺少了独立思考、试错、挣扎的过程,而这些恰恰是真正掌握知识的必经之路 [2]。

这就像学骑自行车,你扶着他骑的时候他走得特别稳,但你一松手他就倒。AI干预提升了即时的解题成功率,却没有提升学生的泛化能力——遇到新题还是不会 [2]。头几天因为有AI「扶着」,正确率提升很快,但一旦需要学生自己解决问题,就卡在那儿了,平台期自然就来了。

第二道坎:缺乏课程结构——只会答题,不会教学。

EduClaw-Bench的失败模式分析里,有一个数据特别值得注意:48.5%的运行中,AI辅导完全没有课程结构 [1]。什么意思呢?就是AI只会学生问什么答什么,头疼医头脚疼医脚,但从来不会主动规划学习路径,不会循序渐进地安排内容,也不会系统地查漏补缺。

你可以把它理解成一个特别会讲题的家教,但从来不会备课。学生今天问这道题,他讲得很清楚;明天问另一道,他也讲得明白。但这两道题之间有什么联系?学生的知识漏洞到底在哪?接下来应该重点补什么?他一概不知,也不关心。

好的教学不是被动应答,而是主动设计。加涅的九事件、罗森海因的十原则,这些经典教学理论讲的都是一件事:学习是需要结构的,从回顾旧知、呈现新知、练习反馈到迁移应用,一步都不能少 [1]。而现在大多数AI辅导,本质上还是个「更聪明的答题器」,不是真正的老师。

第三道坎:学习者建模不稳定——AI根本记不住学生学会了什么。

要做长期教学,最基础的一件事就是:你得知道学生到底掌握了什么、没掌握什么。这就是学习者建模(learner modeling)——给学生画一张动态的「知识地图」。

但2025年一项针对K-12教育的研究发现,只用大模型来做学习者建模,效果并不好。研究者对比了专门的深度知识追踪(Deep Knowledge Tracing, DKT)模型和大模型的表现,结果DKT在预测学生下一步答题正确率上的AUC达到了0.83,显著优于零样本和微调后的大模型 [6]。更严重的是,大模型的时间连贯性很差——它对学生掌握程度的判断经常忽上忽下,甚至出现方向错误的更新,比如学生明明做对了题,它反而觉得学生掌握得更差了 [6]。

你想想,如果一个老师连学生昨天学会了什么都记不准,今天的判断和昨天还矛盾,那他怎么可能设计出有效的长期教学方案?一个合理的猜测是,EduClaw-Bench里学习增益整体幅度极小(最优也只有+0.64%),很大程度上也和学习者建模的不稳定有关。AI连学生现在在哪都搞不清,自然也就不知道该往哪带。

五、从「单次答题辅导」到「长期教学闭环」:这条路怎么走?

既然问题出在「短期思维」,那解法自然就是往「长期闭环」走。我们可以看看研究界正在探索的方向。

先看评估范式的演进。其实就在一两年前,我们对AI教学能力的评估还停留在「单题反馈」阶段——给AI一份学生的答题情况,让它分析问题、给出建议,然后比谁的反馈写得好 [5]。后来慢慢发展到多轮对话评估,用多智能体模拟师生动态互动 [4]。而现在,我们已经开始做30天的长周期评估,开始关注学习增益、课程设计这些真正和长期效果挂钩的指标 [1]。评估标尺的变化,本身就反映了领域认知的升级:从「会不会讲题」到「会不会教学」。

再看技术路线的探索。一个很有潜力的方向,是把经典教育学理论和多智能体架构结合起来。比如2026年的一项研究,就以掌握学习理论(Mastery Learning,就是布鲁姆提出的那个——每个学生都要掌握了当前知识点,才能进入下一个知识点的学习)为框架,设计了一套多智能体个性化学习系统 [3]。

这个系统的思路和现在的AI辅导很不一样:它不是让一个大模型包打天下,而是拆成了6类专业智能体——有专门做诊断的,有专门生成学习资源的,有专门出题的,有专门做任务匹配的,还有负责质量安全的,最后由一个协调智能体来调度 [3]。整个流程是个闭环:先从形成性评估里收集学习证据,诊断哪些知识点没掌握,然后生成个性化的矫正或拓展支持,老师审核之后发给学生,学生学完再做一套平行测验验证,确认真的掌握了再往下走 [3]。

这个设计有几个很关键的特点:第一,所有决策都要有证据支撑,每一条诊断都能追溯到具体的题目表现,不能瞎猜 [3];第二,老师不是摆设,AI生成的所有内容都是草稿,最终拍板的还是老师,而且系统会记录AI草稿和老师修改的区别,出了问题能追溯 [3];第三,不搞「做完就过」,必须用平行测验验证掌握程度,避免背答案式的假掌握 [3]。

当然,实际情况比这个理想框架更复杂。这项研究目前还只停留在设计和原型阶段,没有真实课堂的效果数据,到底能不能提升成绩、会不会增加老师负担,都还需要验证 [3]。但它至少指出了一个方向:好的AI辅导,不是把一个大模型包装成「AI老师」,而是用智能体技术把教学流程结构化,让AI做它擅长的事(比如批量生成、个性化匹配),让人来做教育决策。

目前这条路还有很多没解决的开放问题。比如,怎么设计出能真正维持30天以上高质量辅导的智能体架构 [1]?怎么让模拟学习者更贴近真实学生的认知和情感过程 [1][2]?怎么把专门的知识追踪模型和大模型更好地融合起来,取长补短 [6]?这些都还没有标准答案。

六、结语:好的AI辅导,不是「更聪明的答题器」

聊到这你可能也发现了,AI辅导的「一周魔咒」,本质上不是模型不够聪明,而是我们对「AI教学」的理解太浅了。

我们总觉得,只要模型足够大、知识足够多、回复足够快,就能当好老师。但30天的长周期测试告诉我们:教学不是比谁知道得多,也不是比谁反应快。教学是关于节奏的艺术——什么时候该讲,什么时候该等;什么时候该扶一把,什么时候该放手;怎么把零散的知识点串成结构,怎么从学生的每一次表现里调整对他的判断 [1][2]。

这些事,单次对话看不出来,单题辅导也体现不出来。只有把时间拉长,你才能看到一个AI老师到底是在「教学生」,还是只是在「答题」。

从掌握学习理论提出到现在已经半个多世纪了,我们知道好的教育应该是什么样的:个性化的、循序渐进的、以掌握为目标的。但受制于成本和人力,我们很难大规模实现。AI本来最有希望把这件事落地,但前提是,我们得先跳出「答题器思维」,真正从教学的规律出发去设计它 [3]。

如果你只记住一件事

当前AI辅导的「一周平台期」不是某款产品的问题,而是整个领域的普遍瓶颈——我们擅长做「单次答疑」,但还不会做「长期教学」。好的AI辅导需要的不是更大的模型,而是对学习过程的理解、对节奏的把握,以及结构化的教学设计。


参考文献

  1. EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners(arXiv (Cornell University)、2026、全文精读)
  2. AI Assistants Overassist(arXiv、2026、全文精读)
  3. Designing a Multi-Agent Personalized Learning Support System Grounded in Mastery Learning Theory(Journal of Contemporary Educational Research、2026、全文精读)
  4. EducationQ: Evaluating LLMs Teaching Capabilities Through Multi-Agent Dialogue Framework(Underline Science Inc.、2025、仅摘要)
  5. Benchmarking Large Language Models for Personalized Guidance in AI-Enhanced Learning(ArXiv.org、2025、仅摘要)
  6. Problems With Large Language Models for Learner Modelling: Why LLMs Alone Fall Short for Responsible Tutoring in K—12 Education(ArXiv.org、2025、仅摘要)