Chunlin 的论文科普

AI 辅导越像真人越好?随机实验告诉你:真正提分的是这一点

很多老师和学校都在纠结:给学生配AI辅导,选语音还是文字?用消费级聊天机器人还是买定制系统?有人说语音更像真人、互动感强,效果肯定好;有人说文字能反复看、适合理科。但一项在线MBA的随机实验给出了反直觉的答案:真正决定提分的,既不是模态,也不是拟人程度,而是另一个常被忽略的维度。

一个普遍的困惑:AI 辅导到底有没有用?

过去两年关于AI辅导的研究,结论几乎是分裂的。

2024年一项针对金融入门课的随机对照实验发现,使用ChatGPT-4辅导的学生,成绩反而比不用辅导、用真人金融辅导甚至用非金融辅导的都更差 [7]。研究者提出了一个很形象的说法:AI可能成了”认知假肢”——用的时候能帮你走路,一旦拿走,你还是不会走 [7]。

到了2025年,另一项覆盖约450名本科生、长达一学期的田野实验,测试了当时很火的检索增强生成(Retrieval-Augmented Generation,RAG)型AI导师——也就是把课程资料喂给大模型、让它基于课程内容回答问题。结果更让人泄气:这种AI导师对学生的学习兴趣、自我效能感、参与度乃至最终成绩,都没有统计上显著的影响 [8]。

当然也有正面的声音。同样在2024年的一项用户试验发现,学生觉得AI导师在非建构主义活动(比如直接讲解、练习反馈)中用处更大,而且性价比很高——学生感知到的价值远超过算力成本 [6]。

但这些研究凑在一起,反而让问题更乱了:为什么有的AI辅导拖分,有的没用,有的又有用?差别到底在哪?是模型不够好?是交互方式不对?还是别的什么东西在起作用?

实验发现:提分的不是”语音”,是”结构”

2026年的一篇核心论文 When AI Tutors Speak: Evidence from a Randomized Field Experiment,第一次把这个问题拆干净了 [1]。

研究者做了一个很聪明的双层随机设计。他们在一个在线MBA的公司金融课程里,招募了86名学生,先按预测试成绩分层,再随机分成两组:一组用结构化AI导师,另一组是对照组,可以自由使用消费级AI [1]。这是第一层,比的是”教学结构”。

关键在第二层:结构化AI导师组的学生,每周交替使用语音和文字两种模态,而且是硬隔离——语音周禁用输入框,文字周禁用麦克风,确保对比是纯净的 [1]。这样模态效应是在同一个学生身上测出来的,完全排除了”爱用语音的学生本来就更积极”这种选择偏差。

结果非常清晰:

结构才是硬道理。 结构化AI导师组的学生,比能力匹配的对照组多拿了6.63分(满分55,p=0.007),效应量达到了1.05,属于很大的效应 [1]。而且增益集中在深度推理上:用SOLO分类法(Structure of the Observed Learning Outcome,一种评估回答质量的框架,从低到高分为前结构、单点、多点、关系、抽象拓展五个层次)评分,达到”关系级”(能把多个知识点串联起来解释)的答案占比,AI组从8%涨到了49%,而对照组只从8%涨到27% [1]。

模态则几乎无关。 语音模态下,学生的对话互动量几乎翻倍,提问数是文字的2.4倍,学生也越来越偏好语音——但每周的学习掌握度,语音和文字在统计上是等价的 [1]。更有意思的是,语音的交付成本是文字的2.8倍 [1]。换句话说,花了近三倍的钱让AI更像真人,学习效果一分没多。

打个比方:消费级AI像一副”AI外骨骼”,你穿上它能举很重的东西,但脱下之后你还是你;而结构化AI导师像一个真正的教练,他不会替你举,而是逼你自己先试、先想,不对再给提示,过程慢,但练的是你自己的肌肉 [1]。实验里后者比前者多拿了6分多,尤其是把知识点串起来讲清楚的能力,从8%的人能做到涨到了近一半人能做到 [1]。

当然,实际情况比这个比喻更复杂——结构化AI不是不给答案,而是有节奏地给,这个节奏才是学问。

好的 AI 导师怎么”搭脚手架”?

说到结构化,很多人第一反应是”AI不直接给答案”。但第二篇论文 Adaptive Scaffolding Needs Contingency: An AI Tutor That Escalates and Fades on What the Learner Does 告诉我们:事情没这么简单 [2]。

这篇论文提出了一个很重要的区分:认知负荷(cognitive load,系统帮你承担了多少工作量)和元认知需求(metacognitive demand,在得到帮助之前,你自己必须做多少决策和思考)是两回事 [2]。很多人以为”少给答案=好”,其实是把这两者混为一谈了。好的结构化设计,应该是保留元认知需求恒定,而让认知负荷动态调整——该帮的时候要帮,但思考的主动权始终在学生手里 [2]。

他们做了一个叫CoMeT的AI编程导师,核心是”动态自适应支架”(adaptive scaffolding,根据学习者的实时表现调整支持力度的教学策略,就像搭脚手架,楼建得越高,脚手架越往上挪) [2]。

具体怎么操作呢?它把一个编程任务拆成好几个决策点,每个决策点有三级支持:第一级只指出”这里你需要做个决定”,第二级给具体提示,第三级给一个平行案例演示。如果三轮还没进展,才让步给出这个点的答案,然后立刻进入下一个决策点 [2]。但只要学生表现出”承接”——也就是他的回应对准了当前这个决策点,不管他答得深不深,哪怕只是贴了一段代码,系统立刻退回最轻的支持级别 [2]。

研究者找了131个成人学习者,每人用三种导师做三个Python任务:无限制助手(直接给答案)、纯提问导师(只问不给答案)、CoMeT [2]。结果发现:

打个比方:无限制助手像直接替你写作业的学霸,纯提问导师像只会反问”你觉得呢”的哲学家,而CoMeT像真正的好家教——先看你会不会,不会就给点提示,还不会就举个例子,你一旦有点想通的苗头,立刻退回去让你自己来 [2]。

当然,实际情况比这个比喻更复杂——“承接”的判断是个技术活,而且这篇论文测的是单次会话的体验和任务表现,并没有测量长期学习增益,这是它的局限 [2]。

让 AI 更”懂”学生:个性化追踪能走多远?

结构化的更高阶形态,是AI不仅懂教学法,还懂”你”。

第三篇论文 CoLearn: An Agentic Tutor that Learns its Learner in a Human—AI Co-Learning Loop 做了一个叫CoLearn的系统,核心是持久化学习者记忆(persistent learner memory,系统持续记录并更新对学生知识掌握情况和常见错误的认知,而不是每次对话都从零开始) [4]。

传统的智能辅导系统,通常用固定题库,答错了就记一个”错”的信号。CoLearn不一样,它用一种叫”软证据贝叶斯知识追踪”(Soft-Evidence Bayesian Knowledge Tracing,一种用连续证据而非二元对错来更新学生掌握概率的算法)的方法,让大模型从学生的自由作答里,不仅判断对错,还给出一个0到1的掌握证据值和置信度,再据此更新每个主题的掌握概率 [4]。

然后系统会根据这个记忆,专门挑你最弱的主题、最常犯的迷思概念来生成下一道题 [4]。它甚至有个”证据视图”,直接告诉你”这道题为什么出给你”——比如”这道题是针对你上次混淆的’生物因素’和’非生物因素’出的”,把个性化过程完全摊在桌面上 [4]。

效果怎么样呢?在盲测A/B对比中,人类评分者认为个性化题目比非个性化题目更合适的比例,生物是68%,化学是69% [4]。用模拟学生测试时,系统对学生掌握度的估计误差(MAE)是0.12,比随机出题的0.16和固定记忆的0.20都要好 [4]。

但这里必须诚实:这篇论文没有宣称学习增益。它证明了个性化题目更受偏好、掌握度估计更准,但这些能不能转化成实际的分数提升,还没有被验证 [4]。而且它对低表现学习者的掌握度估计可靠性明显更差(组内相关系数只有约0.15),也就是说,最需要精准辅导的学生,反而可能是系统最”看不准”的 [4]。

从”没用”到”有用”:AI 辅导研究走了哪三步?

把这几篇论文串起来,你会看到2024到2026年AI辅导研究的一条清晰脉络,大概走了三步:

第一步:消费级AI反而拖分。 2024年的研究发现,直接让学生用ChatGPT-4当辅导,成绩反而下降,因为AI成了”认知假肢”,学生把思考都卸载给了机器 [7]。这时候大家的反应是”AI辅导没用,甚至有害”。

第二步:RAG型导师也没用。 2025年,人们以为问题出在AI不懂课程内容,于是把课程资料喂进去,做了RAG型导师。结果一学期的大规模实验发现,还是没效果——对兴趣、自我效能、成绩都没显著影响 [8]。这时候大家开始意识到,光有正确内容还不够。

第三步:结构化设计显著提分。 到了2026年,核心论文 When AI Tutors Speak 第一次用严谨的随机实验证明:只要把教学结构设计对了——锚定课程材料、尝试优先、阶梯式提问、分级脚手架——AI辅导就能带来显著的学习增益,尤其是深度推理能力 [1]。而之前大家很关心的模态(语音还是文字)、模型本身这些因素,反而不是核心 [1]。

这三步合起来,其实回答了一个根本问题:AI辅导的本质,到底是”更像人的聊天机器人”,还是”用AI实现的教学法”?目前的证据指向后者。

还有三个没解决的问题

说到这里,必须给这些结论划几道边界。目前的研究还有不少没解决的问题,远没到”定论”的地步。

第一,样本太单一,能推广到什么程度? 核心实验是在一个在线MBA的定量金融课程里做的,只有86个学生,分析样本更是只有46个 [1]。这个结论能不能推广到本科、K12?能不能推广到人文、语言类学科?都不知道。尤其是模态等价的结论——在金融课上,文字可以反复查看公式和图表,可能抵消了语音的优势;但如果是英语口语课,语音还会和文字等价吗?很难说 [1]。

第二,长期效果未知。 核心实验的干预期只有5周 [1],CoMeT的实验是单次会话 [2],CoLearn甚至没测学习增益 [4]。结构化AI辅导的效果能维持多久?会不会产生依赖?长期来看,学生的自主学习能力是提升了还是下降了?这些都还没有答案。

第三,“结构”的边界在哪? 我们知道结构化比没结构好,但什么样的结构最好?“尝试优先”是唯一的原则吗?不同学科、不同水平的学生,最优结构是不是不一样?CoMeT证明了动态支架比纯提问好,但它的决策点需要人工预编写,泛化成本有多高?这些都是开放问题 [2]。

如果你只记住一件事

AI辅导的提分关键,不在于让它更像真人(语音、拟人化),也不在于让它更懂内容(RAG),而在于让它遵循好的教学法——给学生搭脚手架、保留思考的主动权、根据表现动态调整。


参考文献

  1. When AI Tutors Speak: Evidence from a Randomized Field Experiment(arXiv、2026、全文精读)
  2. Adaptive Scaffolding Needs Contingency: An AI Tutor That Escalates and Fades on What the Learner Does(arXiv、2026、全文精读)
  3. Prompting Against Persona Drift: Comparing Intervention Timing and Content in LLM-Simulated Conversations(arXiv、2026、全文精读)
  4. CoLearn: An Agentic Tutor that Learns its Learner in a Human—AI Co-Learning Loop(arXiv、2026、全文精读)
  5. When Does Reasoning Help in Machine Translation? A Hierarchical Analysis of LRM Reasoning Traces(arXiv、2026、全文精读)
  6. GenAI Teachers(ASCILITE Publications、2024、仅摘要)
  7. AI in higher education: Does not help, might hurt(Journal of Education for Business、2024、仅摘要)
  8. AI Tutors in Higher Education: Comparing Expectations to Evidence(OSF Preprints (OSF Preprints)、2025、仅摘要)