Chunlin 的论文科普

AI 辅导为什么总留不住学生?这篇新研究把「别劝退」写进了算法目标

你有没有过「兴致勃勃报了线上课,学了三天就再也没打开」的经历?全球在线教育的平均完成率不到 15%——是学生不够自律,还是学习系统的设计本身就在把人推走?

为什么你总是学不完一门线上课?

过去十几年,在线教育把课堂搬到了屏幕上,让任何人都能随时接触全球的学习资源 [5]。但随之而来的一个老问题始终没解决:绝大多数人根本坚持不到最后。

很多传统学习系统的设计逻辑其实很简单:追进度。你今天学了 10 个单词,明天就推 10 个新的;你做完了第一章,马上跳到第二章。它默认学习者是永远不会累、不会烦、不会忘的「机器人」——只要内容按顺序喂下去,就能全部吸收。

但真实的学习者不是这样。我们会忘,所以需要复习;我们会累,所以太难了会放弃;我们会觉得无聊,所以太简单了也会跑开。这里藏着三个永远在打架的目标:学新内容、巩固旧知识、让学生愿意回来

传统系统要么只管往前冲(学新最多,但忘得也快,还容易劝退),要么只做间隔重复(复习很科学,但新内容推进慢,也没解决「不想学」的问题)。能不能让一个系统同时把这三件事都做好?

把「别让学生跑了」算进每一次推荐里

最近一项研究提出了一个叫 AI-Tutor 的强化学习系统,核心思路就是:把「学生会不会留下来」直接写进算法的目标里 [1]。

你可以把它的设计拆成三个好理解的比喻。

第一个比喻是知识地图。系统不是把知识点当成一堆孤立的卡片,而是先建了一张「知识图谱」——哪些词是另一些的基础,学会 A 更容易学会 B,都清清楚楚标在图上。给你推新内容的时候,它只从你已经掌握的知识的「邻居」里挑,就像打游戏开地图,从已探索的区域慢慢往外扩,不会突然把你扔到完全陌生的高级区。这样既符合学习规律,也缩小了算法的搜索范围 [1]。

当然,实际情况比这个比喻更复杂:这张知识图谱不是人工画的,而是结合课程结构和真实学习数据里的关联规则一起构建的,还用到了图神经网络来表示每个知识点和学习者的知识状态 [1]。

第二个比喻是增肌+巩固。学新内容像增肌,复习旧内容像巩固训练效果——只增肌不巩固,掉得快;只巩固不增肌,没进步。AI-Tutor 把每一次学习的收益拆成了两笔账:一笔是「以前不会现在会了」的知识获取增益,另一笔是「复习之后忘得更慢了」的知识保持增益,后者基于认知心理学的遗忘曲线半衰期模型,把「忘得慢」直接量化成奖励 [1]。

第三个比喻可能有点反直觉:AI 老师会主动「放水」防止你弃坑。传统系统总想着让你一次学最多,但这个 AI 每推一道题,都会算一算「给你推这道题,你下次还来的概率有多大」。如果内容太难会把人劝退,它宁愿选稍微简单一点的——因为「能坚持学下去」比「一次学很多」更重要。

具体到算法里,它没有用强化学习里常见的固定折扣因子,而是用动态估计的「学习者继续参与的概率」来计算未来价值。换句话说,算法的每一步决策都在权衡:这次学得多一点,会不会把人吓跑,导致后面再也没有「下次」了 [1]?

为了不在真实学生身上反复试错,研究者还先用 Transformer 训练了一个「学习者模拟器」,让 AI 先在模拟器里练熟了再用。整个系统用的是带熵正则化的 Soft Actor-Critic 框架,鼓励算法多探索不同的策略 [1]。

2300 万条学习记录验证了什么?

这套方法到底有没有用?研究者用了一个规模相当大的真实数据集来验证:来自在线语言学习平台 MaiMemo 的 33700 名学习者,总共 2300 多万条学习记录,知识图谱里包含 6180 个词汇节点 [1]。

评估的指标有三个核心维度:学习者的参与度(也就是会不会坚持来)、知识保持率(学了会不会忘)、最终的学习结果(测试分数和课程完成率)。AI-Tutor 在这三个维度上都全面优于现有的主流方法 [1]。

对比的基线包括几种常见的思路:比如只看眼前收益的短视贪心策略,比如现在很多背单词软件在用的间隔重复系统 FSRS,还有之前的深度强化学习基线。AI-Tutor 比这些方法表现都好 [1]。

研究者还做了消融实验——就是把系统的三个核心组件一个个拆掉,看看哪个影响最大。结果是:参与度建模、知识图谱引导、保持奖励这三样东西,每一个都对最终效果有贡献,缺了哪个都不行 [1]。

另一项关于数字教材中自动生成习题的大规模研究也从侧面印证了:对学生学习行为、坚持度和元认知反应的大规模数据分析,是理解和改进在线学习的重要基础 [2]。

不过这里要说明,因为公开的论文文本有截断,具体提升了多少百分比的数字没有完整呈现。我们能确定的是「全面优于基线」的结论方向,但精确的效果幅度还需要看完整论文 [1]。

自适应 AI 不是一个答案,是一类方法

AI-Tutor 属于一个更大的领域——自适应教育 AI。很多人以为「自适应」是一种统一的技术,但其实不同的系统,「适应」的逻辑完全不一样。

最近一篇对比研究梳理了三种完全不同的自适应 AI 架构 [3]。第一种是多智能体系统,让多个专门的 AI 代理分工合作、交叉检查来完成任务——它适应的是推理的结构,但很少直接测量对学习者的实际效果。第二种是脑机接口(BCI),直接通过生理信号测量学习者的认知负荷,然后调整内容——它测生理信号测的很准,但目前最强的对照研究显示,这种精度还没能可靠地转化成更好的学习结果。第三种是对话代理,通过不断积累的交互历史来自我改进——它的适应质量很大程度上取决于人工设计的选择,不是完全自动的 [3]。

这篇研究的核心结论是:「自适应 AI 系统」不是一个单一的设计模式,而是一大家族不同的方法,它们对「适应」的定义不同,衡量效果的证据标准也不一样 [3]。

放在这个脉络里看,AI-Tutor 属于「基于行为数据的强化学习自适应」这一路——它不靠生理传感器,也不靠多智能体分工,而是从学习者的历史行为里建模,用强化学习优化长期目标。

光有好算法还不够:用对方式才提分

算法做得再好,就一定能让学生学得更好吗?不一定。最近一项在智利某顶尖大学做的随机对照实验,给我们提了个醒 [4]。

研究者在 7 个班级里做了两组实验:一组只是鼓励学生用 AI 工具(提高使用率),另一组则引导学生怎么用——比如把 AI 当成辅导老师来互动,而不是直接抄答案。结果很有意思:只是鼓励使用的那组,学生确实用得更多了,但期中成绩没有任何提升;而有使用引导的那组,学生觉得 AI 更有用了(感知有用性提升了 0.38 个标准差),期末考试成绩也提高了 0.21 个标准差 [4]。

这个发现很重要:成绩提升的关键不是学生用不用 AI,而是怎么用。算法是工具,工具的效果取决于使用方式。如果学生只是拿 AI 来抄作业,再聪明的算法也帮不了学习;但如果引导他们用对话式的、辅导式的方式互动,效果就会显现出来 [4]。

这也给高校和教育平台提了个醒:光买个 AI 系统扔给学生没用,配套的使用引导和教学设计,可能比算法本身更重要。

还有哪些问题没解决?

说了这么多,我们得诚实地划一下当前研究的边界。

首先,AI-Tutor 目前只在英语词汇学习这个场景下验证过效果。词汇是典型的离散知识项,有清晰的结构,有明确的「会/不会」判断。但如果换成数学推理、编程技能、论文写作这类需要深度理解和练习的场景,这套方法还能不能用?目前还不知道 [1]。

其次,这项研究的评估是基于历史数据的离线仿真——也就是用训练好的学习者模拟器来测试算法,而不是在真实平台上做 A/B 测试。仿真的问题在于,它假设学习者的行为模式和历史数据里一样,但如果算法真的变了,学习者的行为可能也会跟着变,真实效果可能和仿真结果有出入 [1]。

第三,知识保持的测量依赖学习者自我报告「是否认识单词」,而不是客观的延迟测试。人对自己的记忆判断不一定准,可能存在报告偏差 [1]。

第四,关于内在动机的长期影响还是个问号。AI 现在靠调整难度让学生留下来,但长期来看,这种「被设计出来的坚持」会不会反而削弱学生的内在学习动力?研究者自己也把这个问题列在了未来方向里 [1]。

第五,从更广泛的自适应教育领域来看,不同技术路径之间还没有统一的证据标准,很难公平比较谁好谁坏 [3]。而在高校场景里,AI 辅助学习的长期效果、跨学科的可扩展性、和其他教学方法比的成本效益,也都还在探索中 [4]。

如果你只记住一件事

在线学习的高辍学率,不全是学生的问题——很多时候是系统设计只追进度、不管人的结果。AI-Tutor 这项研究最有价值的地方,不是它用了多么花哨的技术,而是它把「别把学生劝退」这件事,从一个运营问题、一个德育问题,变成了一个可以写进算法目标的工程问题。


参考文献

  1. Towards Sustainable Learning in Online Education: A Reinforcement Learning Approach(arXiv、2026、全文精读)
  2. Advancing Intelligent Textbooks with Automatically Generated Practice: A Large-Scale Analysis of Student Data(OSF Preprints (OSF Preprints)、2026、仅摘要)
  3. Architectures for Adaptive and Assistive AI Systems: Multi-Agent Reasoning, Brain-Computer Interfaces, and Conversational Agents in Education and Healthcare(SSRN、2026、仅摘要)
  4. Guidance Over Adoption: Experimental Evidence on AI-Assisted Learning in HigherEducation(SSRN、2026、仅摘要)
  5. A Foundation For Educational Research at Scale: Evolution and Application(Digital WPI、2018、仅摘要)