Chunlin 的论文科普

AI导师的「隐形考场」:为什么只看排名会漏掉最关键的能力?

你可能见过各种AI辅导员排行榜——GPT-4o第一、Claude第二,仿佛高下立判。但如果学生不是「认真听讲的模范生」,而是故意蒙答案、卡壳十多遍、半天不回消息的「问题学生」,这些排名还靠谱吗?

当AI导师从实验室走进真实课堂,我们该用什么方法,才能测出它应对复杂学生状态的真实能力?

一、为什么「好学生测试」测不出真本事?

过去我们评估AI导师,往往默认学生是全情投入的:认真读题、仔细思考、不会就问、错了就改。但真实的课堂远不是这样。澳大利亚一项针对医学院学生的民族志研究发现,学生并不会因为AI导师被嵌入课程就乖乖使用——他们会在课程材料、同学、通用AI工具和内置AI导师之间来回切换,怎么方便怎么来,完全不是实验室里那种「按设计使用」的状态 [3]。

这就引出了一个核心问题:如果我们只用「认真听讲的好学生」来测AI导师,测出来的其实只是它应对理想场景的能力。可一旦学生开始钻空子、走神、卡在一个知识点上死活过不去,这些AI导师还能不能hold住?没人知道。

更麻烦的是,那些「问题行为」本身就多种多样:有的学生是故意投机取巧,快速蒙答案骗提示;有的学生是真的学不会,练了十多遍还在原地踏步;还有的学生干脆走神了,半小时没动静。这三种情况,需要的辅导策略完全不同——对投机取巧的要引导思考,对学不会的要拆解知识点,对走神的要拉回注意力。如果AI导师分不清这几种状态,或者应对得不好,哪怕它在「好学生测试」里拿满分,到了真实课堂也可能没用。

二、DAS²:给AI导师出一套「偏题怪题」

为了补上这个评估盲区,2026年的一篇论文提出了一套叫 DAS²(Disengagement-Aware Student Simulators,脱离行为感知学生模拟器) 的评估协议。简单说,就是专门模拟出各种「问题学生」,来给AI导师做压力测试 [1]。

DAS²把学生的投入状态分成了五种:

你可能会问:这些状态的定义靠谱吗?研究者是基于既有教育文献里的规则来标注的,还找了两个人类标注员独立给100段真实辅导会话打标签,两人的一致率是84%(Cohen’s κ=0.78);在两人意见一致的样本里,人工标签和DAS²规则的匹配率达到了81%(κ=0.75)[1]。当然,实际情况比这个比喻更复杂——比如「钻空子」和「原地打转」就经常被搞混,后面我们还会说到。

有了状态定义,接下来就是用大模型来模拟这五种学生。研究者做了好几个版本的模拟器:有纯靠提示词引导的GPT-4o,有加上真实会话作为少样本示例的版本,还有用LoRA(Low-Rank Adaptation,低秩适配,一种高效微调大模型的方法)在三万八千多条真实辅导记录上微调过的Qwen2.5-7B [1]。

怎么证明这些模拟器模拟得像呢?研究者拿真实数据做了对比:如果不设定学生状态,模拟出来的「钻空子」学生正确率和真实学生差0.54,「原地打转」的差0.51;而一旦给模拟器加上状态设定,这两个差距分别缩小到了0.20和0.18 [1]。也就是说,状态人设确实能让模拟器的行为更贴近真实的「问题学生」。

三、反直觉发现:越像真人,反而越难「分类」?

DAS²的实验结果里,有两个特别反直觉的发现。

第一个是:模拟器越像真实学生,反而越难区分不同的状态。纯靠提示词的GPT-4o版本,五种状态的分类准确率有76.2%;而那个用真实数据微调过、响应时间分布最像真人的Qwen2.5-7B版本,分类准确率居然只有30.4%,跟20%的随机水平差不了多少 [1]。

这其实很好理解——真实学生的行为本来就不是泾渭分明的。一个学生到底是故意蒙答案钻空子,还是真的学不会在原地打转,有时候连老师都分不清,更别说机器了。那些状态边界清晰的模拟器,反而可能是「假得很标准」——它模拟的是我们想象中的「钻空子学生」,不是真实的学生。

第二个反直觉发现是:AI导师的排名在各种学生状态下居然完全稳定,但绝对分差极小。研究者测了五个主流大模型(Claude-3.5-Haiku、Llama-3.1-70B、Gemini-2.0-Flash、Qwen2.5-72B、GPT-4o),不管面对的是投入的学生、钻空子的学生还是走神的学生,它们的排名顺序一点没变,10轮和20轮交互下的斯皮尔曼相关系数居然是1.00 [1]。

但这并不意味着它们的表现真的没差别——只是名次没变而已。不同模型在不同状态下的绝对分数是有波动的,只是整体分差只有0.01到0.03,小到几乎可以忽略 [1]。这就像一场考试,五个人的名次每次都一样,但每个人在不同题型上的得分其实有高有低,只是总分差太小,名次拉不开。如果你只看排名,就会漏掉这些具体的能力差异。

四、AI评估AI:靠谱吗?怎么校准?

说到这里你可能会问:那这些AI导师的分数又是谁打的呢?答案是——另一个AI(GPT-4o-mini)。它从三个维度给导师打分:回答是不是相关、有没有给学生搭好思考的「脚手架」、能不能把走神的学生拉回来,每个维度1到5分,最后合成一个0到1分的总分 [1]。

那AI打的分,和人类老师的判断一致吗?答案是:一开始不太一致,后来调整了评分标准才好一些。初始状态下,自动评分和人类评分的相关性只有0.33;修订了评分标准之后,相关性升到了0.61,整体是0.82,但还是没达到研究者预设的0.85的阈值 [1]。尤其是在「相关性」这个维度上,AI和人类的判断偏差比较大。

这个问题其实不只出现在AI导师评估里。2026年另一项关于大规模写作评估的研究,也遇到了类似的「AI打分和人类不一致」的问题。那项研究用GPT-5给乌拉圭全国初中毕业考试的西班牙语短作文打分,条目级的准确率大多在60%到80%之间,比人类评分员之间的一致性低5%到15% [2]。

但那项研究找到了一个很聪明的解决办法:人在回路(Human-in-the-Loop),也就是AI打分,人类把关。而且他们还利用了AI的一个系统性偏差——AI打分偏严,几乎从不把不及格的卷子判成及格,但经常把及格的打成不及格。于是他们反过来设计流程:AI说通过的就直接通过,AI说不通过的全部送人工复核 [2]。

这样一来,既利用了AI的效率,又把公平风险最高的「被冤判」的情况都交给了人类。结果是,至少能减少50%的人工阅卷量,同时保证了考试的公平性 [2]。

一个合理的猜测是,这个思路也可以用到AI导师的评估上:不用追求让AI评判器完全和人类一致,而是先让AI做初筛,把那些明显好的和明显差的挑出来,中间模糊的地带再交给人类专家来判断。这样既高效,又靠谱。

五、从「评导师」到「练导师」:这条路走了多远?

用大模型来评估导师,其实不是什么新鲜事。早在2024年,就有研究开始用GPT-4来评估人类导师的表现了——比如看看导师有没有给学生有效的表扬,会不会正确应对学生的错误。那时候的研究发现,GPT-4在识别这些辅导行为上已经做得不错了,能帮着做规模化的评估 [4][5]。

到了2025年,这类研究更进了一步。研究者测试了好几个大模型(GPT-4、GPT-4o、Gemini-1.5-pro等)在真实数学辅导对话里识别教师行为的能力,发现它们检测「导师表扬学生」的准确率有94%到98%,检测「学生犯数学错误」的准确率有82%到88%;评估导师是否符合最佳实践的话,和人类判断的一致性能到73%到89% [6]。

这些研究都是在「评估人类导师」,而DAS²把这个思路反过来了——用模拟学生来「评估AI导师」[1]。这是一个很重要的转向:以前我们关心的是「AI能不能当评委」,现在我们开始关心「AI当导师够不够格」,而且要用更接近真实场景的方式来测。

当然,这条路还很长。现在的模拟评估,测的还只是短对话里的即时反应,比如10轮、20轮交互 [1]。但真实的辅导是长期的,学生的状态是动态变化的,今天走神,明天可能就投入了;这个知识点学不会,换个知识点可能就开窍了。现在的DAS²用的还是会话级的静态标签,还没法模拟这种动态变化 [1]。

而且更根本的问题是:我们现在测的都是AI导师的「行为表现」,比如回答相关不相关、有没有给提示,但这些行为到底能不能转化成学生真实的学习收益?现在还不知道 [1]。

六、接下来的三个开放问题

DAS²给AI导师的评估打开了一扇新的门,但门后面还有很多没解决的问题。其中有三个特别值得关注:

第一个问题是,怎么区分相似的脱离行为。前面提到过,「钻空子」和「原地打转」经常被搞混——在人工标注里,「钻空子」的精度只有0.43,很多时候被误判成了「原地打转」[1]。这两种行为看起来都是「答错很多题」,但背后的动机完全不同,应对策略也不一样。如果连状态都分不清,就谈不上针对性辅导了。

第二个问题是,模拟评估的结果能不能预测真实的学习收益。现在我们用模拟学生测出来的分数,说到底还是「AI觉得这个导师好」。但真实的学生用了之后,成绩真的会提高吗?学习兴趣真的会增强吗?这些都还需要验证 [1]。如果模拟评估和真实学习效果挂不上钩,那它的价值就会大打折扣。

第三个问题是,怎么跨场景泛化。DAS²现在主要是基于数学答题的数据集做的,换到别的学科、别的场景,还能不能用?研究者自己也发现,跨数据集的时候会有明显的领域不匹配 [1]。毕竟不同学科的学习行为不一样,数学里的「钻空子」和写作里的「钻空子」,表现形式可能完全不同。

如果你只记住一件事

评估AI教育产品,不能只看它在理想「好学生」场景下的表现,更要看它能不能应对真实学生五花八门的状态——毕竟,教育本来就不是给标准答案的。


参考文献

  1. Simulating Disengaged Students to Evaluate LLM-based Tutors(arXiv、2026、全文精读)
  2. A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment(arXiv (Cornell University)、2026、全文精读)
  3. Medical Students Perception and Use of Artificial Intelligence Tutors Embedded in Curriculum(SSRN、2026、仅摘要)
  4. Using Generative AI to Provide Feedback to Adult Tutors in Training and Assess Real-life Performance(EdArXiv (OSF Preprints)、2024、仅摘要)
  5. Generative AI Evaluation of Human Tutors: Demonstrations and Considerations for Prompt Engineering(2024、仅摘要)
  6. Leveraging LLMs to Assess Tutor Moves in Real-Life Dialogues: A Feasibility Study(ArXiv.org、2025、仅摘要)