AI导师的「隐形考场」:为什么只看排名会漏掉最关键的能力?
你可能见过各种AI辅导员排行榜——GPT-4o第一、Claude第二,仿佛高下立判。但如果学生不是「认真听讲的模范生」,而是故意蒙答案、卡壳十多遍、半天不回消息的「问题学生」,这些排名还靠谱吗?
当AI导师从实验室走进真实课堂,我们该用什么方法,才能测出它应对复杂学生状态的真实能力?
一、为什么「好学生测试」测不出真本事?
过去我们评估AI导师,往往默认学生是全情投入的:认真读题、仔细思考、不会就问、错了就改。但真实的课堂远不是这样。澳大利亚一项针对医学院学生的民族志研究发现,学生并不会因为AI导师被嵌入课程就乖乖使用——他们会在课程材料、同学、通用AI工具和内置AI导师之间来回切换,怎么方便怎么来,完全不是实验室里那种「按设计使用」的状态 [3]。
这就引出了一个核心问题:如果我们只用「认真听讲的好学生」来测AI导师,测出来的其实只是它应对理想场景的能力。可一旦学生开始钻空子、走神、卡在一个知识点上死活过不去,这些AI导师还能不能hold住?没人知道。
更麻烦的是,那些「问题行为」本身就多种多样:有的学生是故意投机取巧,快速蒙答案骗提示;有的学生是真的学不会,练了十多遍还在原地踏步;还有的学生干脆走神了,半小时没动静。这三种情况,需要的辅导策略完全不同——对投机取巧的要引导思考,对学不会的要拆解知识点,对走神的要拉回注意力。如果AI导师分不清这几种状态,或者应对得不好,哪怕它在「好学生测试」里拿满分,到了真实课堂也可能没用。
二、DAS²:给AI导师出一套「偏题怪题」
为了补上这个评估盲区,2026年的一篇论文提出了一套叫 DAS²(Disengagement-Aware Student Simulators,脱离行为感知学生模拟器) 的评估协议。简单说,就是专门模拟出各种「问题学生」,来给AI导师做压力测试 [1]。
DAS²把学生的投入状态分成了五种:
- 投入(engaged):正常学习,没有异常行为;
- 钻空子(gaming):故意投机取巧,比如2秒内随便蒙一个错答案,或者一上来就要最终答案提示;
- 原地打转(wheel-spinning):同一个知识点练了十多遍还没掌握,正确率极低;
- 走神(off-task):同一次对话里有5到30分钟没操作;
- 混合(mixed):几种行为混在一起,没法归到单一类别。
你可能会问:这些状态的定义靠谱吗?研究者是基于既有教育文献里的规则来标注的,还找了两个人类标注员独立给100段真实辅导会话打标签,两人的一致率是84%(Cohen’s κ=0.78);在两人意见一致的样本里,人工标签和DAS²规则的匹配率达到了81%(κ=0.75)[1]。当然,实际情况比这个比喻更复杂——比如「钻空子」和「原地打转」就经常被搞混,后面我们还会说到。
有了状态定义,接下来就是用大模型来模拟这五种学生。研究者做了好几个版本的模拟器:有纯靠提示词引导的GPT-4o,有加上真实会话作为少样本示例的版本,还有用LoRA(Low-Rank Adaptation,低秩适配,一种高效微调大模型的方法)在三万八千多条真实辅导记录上微调过的Qwen2.5-7B [1]。
怎么证明这些模拟器模拟得像呢?研究者拿真实数据做了对比:如果不设定学生状态,模拟出来的「钻空子」学生正确率和真实学生差0.54,「原地打转」的差0.51;而一旦给模拟器加上状态设定,这两个差距分别缩小到了0.20和0.18 [1]。也就是说,状态人设确实能让模拟器的行为更贴近真实的「问题学生」。
三、反直觉发现:越像真人,反而越难「分类」?
DAS²的实验结果里,有两个特别反直觉的发现。
第一个是:模拟器越像真实学生,反而越难区分不同的状态。纯靠提示词的GPT-4o版本,五种状态的分类准确率有76.2%;而那个用真实数据微调过、响应时间分布最像真人的Qwen2.5-7B版本,分类准确率居然只有30.4%,跟20%的随机水平差不了多少 [1]。
这其实很好理解——真实学生的行为本来就不是泾渭分明的。一个学生到底是故意蒙答案钻空子,还是真的学不会在原地打转,有时候连老师都分不清,更别说机器了。那些状态边界清晰的模拟器,反而可能是「假得很标准」——它模拟的是我们想象中的「钻空子学生」,不是真实的学生。
第二个反直觉发现是:AI导师的排名在各种学生状态下居然完全稳定,但绝对分差极小。研究者测了五个主流大模型(Claude-3.5-Haiku、Llama-3.1-70B、Gemini-2.0-Flash、Qwen2.5-72B、GPT-4o),不管面对的是投入的学生、钻空子的学生还是走神的学生,它们的排名顺序一点没变,10轮和20轮交互下的斯皮尔曼相关系数居然是1.00 [1]。
但这并不意味着它们的表现真的没差别——只是名次没变而已。不同模型在不同状态下的绝对分数是有波动的,只是整体分差只有0.01到0.03,小到几乎可以忽略 [1]。这就像一场考试,五个人的名次每次都一样,但每个人在不同题型上的得分其实有高有低,只是总分差太小,名次拉不开。如果你只看排名,就会漏掉这些具体的能力差异。
四、AI评估AI:靠谱吗?怎么校准?
说到这里你可能会问:那这些AI导师的分数又是谁打的呢?答案是——另一个AI(GPT-4o-mini)。它从三个维度给导师打分:回答是不是相关、有没有给学生搭好思考的「脚手架」、能不能把走神的学生拉回来,每个维度1到5分,最后合成一个0到1分的总分 [1]。
那AI打的分,和人类老师的判断一致吗?答案是:一开始不太一致,后来调整了评分标准才好一些。初始状态下,自动评分和人类评分的相关性只有0.33;修订了评分标准之后,相关性升到了0.61,整体是0.82,但还是没达到研究者预设的0.85的阈值 [1]。尤其是在「相关性」这个维度上,AI和人类的判断偏差比较大。
这个问题其实不只出现在AI导师评估里。2026年另一项关于大规模写作评估的研究,也遇到了类似的「AI打分和人类不一致」的问题。那项研究用GPT-5给乌拉圭全国初中毕业考试的西班牙语短作文打分,条目级的准确率大多在60%到80%之间,比人类评分员之间的一致性低5%到15% [2]。
但那项研究找到了一个很聪明的解决办法:人在回路(Human-in-the-Loop),也就是AI打分,人类把关。而且他们还利用了AI的一个系统性偏差——AI打分偏严,几乎从不把不及格的卷子判成及格,但经常把及格的打成不及格。于是他们反过来设计流程:AI说通过的就直接通过,AI说不通过的全部送人工复核 [2]。
这样一来,既利用了AI的效率,又把公平风险最高的「被冤判」的情况都交给了人类。结果是,至少能减少50%的人工阅卷量,同时保证了考试的公平性 [2]。
一个合理的猜测是,这个思路也可以用到AI导师的评估上:不用追求让AI评判器完全和人类一致,而是先让AI做初筛,把那些明显好的和明显差的挑出来,中间模糊的地带再交给人类专家来判断。这样既高效,又靠谱。
五、从「评导师」到「练导师」:这条路走了多远?
用大模型来评估导师,其实不是什么新鲜事。早在2024年,就有研究开始用GPT-4来评估人类导师的表现了——比如看看导师有没有给学生有效的表扬,会不会正确应对学生的错误。那时候的研究发现,GPT-4在识别这些辅导行为上已经做得不错了,能帮着做规模化的评估 [4][5]。
到了2025年,这类研究更进了一步。研究者测试了好几个大模型(GPT-4、GPT-4o、Gemini-1.5-pro等)在真实数学辅导对话里识别教师行为的能力,发现它们检测「导师表扬学生」的准确率有94%到98%,检测「学生犯数学错误」的准确率有82%到88%;评估导师是否符合最佳实践的话,和人类判断的一致性能到73%到89% [6]。
这些研究都是在「评估人类导师」,而DAS²把这个思路反过来了——用模拟学生来「评估AI导师」[1]。这是一个很重要的转向:以前我们关心的是「AI能不能当评委」,现在我们开始关心「AI当导师够不够格」,而且要用更接近真实场景的方式来测。
当然,这条路还很长。现在的模拟评估,测的还只是短对话里的即时反应,比如10轮、20轮交互 [1]。但真实的辅导是长期的,学生的状态是动态变化的,今天走神,明天可能就投入了;这个知识点学不会,换个知识点可能就开窍了。现在的DAS²用的还是会话级的静态标签,还没法模拟这种动态变化 [1]。
而且更根本的问题是:我们现在测的都是AI导师的「行为表现」,比如回答相关不相关、有没有给提示,但这些行为到底能不能转化成学生真实的学习收益?现在还不知道 [1]。
六、接下来的三个开放问题
DAS²给AI导师的评估打开了一扇新的门,但门后面还有很多没解决的问题。其中有三个特别值得关注:
第一个问题是,怎么区分相似的脱离行为。前面提到过,「钻空子」和「原地打转」经常被搞混——在人工标注里,「钻空子」的精度只有0.43,很多时候被误判成了「原地打转」[1]。这两种行为看起来都是「答错很多题」,但背后的动机完全不同,应对策略也不一样。如果连状态都分不清,就谈不上针对性辅导了。
第二个问题是,模拟评估的结果能不能预测真实的学习收益。现在我们用模拟学生测出来的分数,说到底还是「AI觉得这个导师好」。但真实的学生用了之后,成绩真的会提高吗?学习兴趣真的会增强吗?这些都还需要验证 [1]。如果模拟评估和真实学习效果挂不上钩,那它的价值就会大打折扣。
第三个问题是,怎么跨场景泛化。DAS²现在主要是基于数学答题的数据集做的,换到别的学科、别的场景,还能不能用?研究者自己也发现,跨数据集的时候会有明显的领域不匹配 [1]。毕竟不同学科的学习行为不一样,数学里的「钻空子」和写作里的「钻空子」,表现形式可能完全不同。
如果你只记住一件事
评估AI教育产品,不能只看它在理想「好学生」场景下的表现,更要看它能不能应对真实学生五花八门的状态——毕竟,教育本来就不是给标准答案的。
参考文献
- Simulating Disengaged Students to Evaluate LLM-based Tutors(arXiv、2026、全文精读)
- A Human-in-the-Loop Framework for AI-Assisted Scoring in Large-Scale Writing Assessment(arXiv (Cornell University)、2026、全文精读)
- Medical Students Perception and Use of Artificial Intelligence Tutors Embedded in Curriculum(SSRN、2026、仅摘要)
- Using Generative AI to Provide Feedback to Adult Tutors in Training and Assess Real-life Performance(EdArXiv (OSF Preprints)、2024、仅摘要)
- Generative AI Evaluation of Human Tutors: Demonstrations and Considerations for Prompt Engineering(2024、仅摘要)
- Leveraging LLMs to Assess Tutor Moves in Real-Life Dialogues: A Feasibility Study(ArXiv.org、2025、仅摘要)