AI家教答得对就够了吗?一个新指标在衡量「会不会教」
学生问Python程序为什么报错,AI直接给出完美修复代码——答案全对,却可能是个「坏回答」:它跳过了学生本该自己推导的过程。我们该怎么判断AI是在「教」还是在「喂答案」?
这个问题正在困扰越来越多把大语言模型(Large Language Model,LLM,即能理解和生成自然语言的AI系统)当家教用的师生。过去我们评价AI家教,习惯看「答得对不对」,但教学这件事,正确只是底线,合适才是关键。最新一项研究提出了PSI教学适宜性指数,第一次系统地跳出正确率维度,给AI家教的「会不会教」做了一次量化体检 [1]。
一、为什么「答对」不等于「教好」?
想象一个刚学循环的大一学生,问AI「为什么我的for循环只跑了一次」。如果AI直接甩给他一段修正后的完整代码,附带列表推导式、生成器等进阶写法,从代码正确性上说满分,但从教学上说几乎是灾难:学生既不知道自己错在哪,也没建立排查思路,还被一堆没学过的概念砸晕。
好的教学回答,得踩在学生的「最近发展区」上——就是那种「跳一跳够得着」的难度,既不能太简单没挑战,也不能太难直接劝退。它还要遵守先修顺序:没讲过变量作用域,就别上来解释闭包;它得有「脚手架」:一步步提示、小例子、引导性问题,帮学生自己爬到答案那里;它还得控制认知负荷,别扯一堆无关的背景知识凑字数。
这些维度,传统的「正确率」指标一概不看。现有对AI家教的评价,大多聚焦在答案本身的质量,却很少衡量它和学习者当前基础、课程进度的匹配度 [1]。这就像评价一个老师只看他做题对不对,完全不考虑他会不会上课。
而当AI越来越多地进入课堂,和教师形成协同关系时,这个评价缺口就更突出了。有研究指出,成人教育领域对AI融入教学普遍乐观,但准备程度参差不齐,伦理争议也持续存在;教师不该只是技术的被动使用者,而应该成为塑造AI如何服务学习的关键角色 [2]。要做到这一点,首先得有一把尺子,能量出AI的回答到底「合不合适教」。
二、PSI:给AI家教做一次「教学体检」
这把新尺子,就是PSI(Pedagogical Suitability Index,教学适宜性指数)。你可以把它想象成AI家教的「教学体检表」,一共6项指标,每项等权重打分,最后合成一个0到1之间的总分——分数越高,说明回答越贴合学生当前的学习状态和课程进度 [1]。
我们一项项说,你很快就能明白它为什么比「正确率」更懂教学。
第一项叫知识距离(Knowledge Distance),衡量回答里用到的概念,和学生已经掌握的概念重叠度是不是刚好落在最优值附近。研究里取的最优值是0.65——也就是说,回答里大概65%是学生已知的,35%是新东西,这个比例最符合「跳一跳够得着」的最近发展区理论。太高了太简单,太低了听不懂。
第二项是时间违规(Temporal Violation),检查回答里有没有「抢跑」:比如课程还没讲到函数,回答就先用上了,这就违反了先修顺序,学生肯定懵。
第三项是脚手架密度(Scaffolding Density),统计回答里有多少教学支持元素——比如分步提示、小例子、引导性问题、类比、即时小练习这些。这是最直观体现「会不会教」的一项:有的AI只会甩结论,有的AI会一步步把你扶到答案面前。
第四项是艾宾浩斯遗忘(Ebbinghaus Forgetting),根据概念上次出现的时间,估算学生的保持程度,提醒回答要不要适当复习。
第五项是认知负荷(Cognitive Load),惩罚那些塞了一堆无关内容、让学生大脑过载的回答。
第六项是布鲁姆对齐(Bloom’s Alignment),看回答的认知层次和问题目标对不对得上——比如学生只是要「理解」一个概念,你别直接给「创造」级别的复杂任务。
当然,实际情况比这个比喻更复杂。目前PSI的实现方式还比较朴素:主要靠关键词匹配和正则表达式这些「代理方法」来计算,还做不到深度语义理解 [1]。比如它判断脚手架密度,是统计「例如」「第一步」「你可以试试」这类典型表述的出现比例,而不是真的理解这段回答的教学逻辑。但哪怕是这样一个「粗粒度」的体检表,已经能看出不少门道了。
更有意思的是,PSI不只是用来打分的——它还能当「整改通知书」用。把6项得分和具体问题列成结构化反馈,再发给AI让它重新生成回答,相当于告诉AI「你这次脚手架太少了,先修顺序也有问题,改改」。后面我们会看到,这种反馈的效果相当惊人。
三、4款大模型实测:差距不在「聪明」,在「会不会搭梯子」
研究人员选了4款我们熟悉的大模型——ChatGPT、Gemini、Gemma 4和Qwen 3,基于一门美国大学Python入门课的30个教学场景,每个场景配标准提问和有缺陷的提问(模拟学生常见的提问偏差),一共做了240次评估 [1]。
第一个发现可能有点反直觉:4款模型的PSI总分差距其实很小,从最低的0.557(Gemini)到最高的0.638(ChatGPT),只差了0.081分 [1]。而且开源模型和闭源模型之间,并没有出现教学适宜性上的明显分化——不是说模型越「聪明」、参数越大,就越会教书。
但拆开看子项,差距就拉开了,而且拉得最开的恰恰是「脚手架密度」:ChatGPT的脚手架密度是0.492,Gemini只有0.087,差了5倍还多 [1]。翻译成大白话就是:有的AI会一步步引导、给例子、出小问题,有的AI只会干巴巴讲知识点、直接给答案。你要是选AI家教,光看总分可能觉得差不多,真用起来体验天差地别。
另一个有趣的发现是,学生提问有没有缺陷,对整体PSI几乎没影响(只降了0.002),但子项会有消长:提问有缺陷时,先修顺序违规反而少了(+0.059),但知识距离和脚手架密度都下降了 [1]。这有点像学生问得越模糊,老师越不敢讲深,但也越容易敷衍。
那PSI反馈到底能不能帮AI「学会教书」?研究人员挑了62个PSI低分的「差生案例」,把诊断结果反馈给模型让它重答,结果82.3%的案例都有改进,平均PSI提升了0.049 [1]。提升最猛的还是脚手架密度:从0.073直接升到0.345,涨了将近4倍 [1]。人工验证也显示,82.3%的案例中PSI指出的弱点被解决了,74.2%被认为有教学意义上的明显改进 [1]。
这就像给老师看教学评估表,只要告诉他具体哪块不行、怎么改,大部分老师都能调整过来——AI也是一样。之前我们总觉得AI教得不好是因为不够聪明,现在看来,很多时候只是没人告诉它「你得搭梯子」。
四、从评人类导师到评AI导师:评价逻辑走了多远?
PSI不是第一个用AI做教学评价的研究,但它往前迈了关键的一步。我们可以简单捋一下这条线。
最早是2024年的一批工作,把大模型用来评人类导师。比如有研究用GPT-4给培训中的成人导师做实时反馈,在模拟教学场景里自动评价导师的表扬是否有效、对学生错误的反应是否得当 [5]。后续研究进一步验证了,只要提示工程做得好,GPT-4在评估真实数学辅导对话里的导师表现时,已经能达到不错的水平,解决了人工评估费时费力的问题 [6]。这一阶段的核心是「AI当评委,评人」。
然后到了2025年左右,评价对象开始转向AI导师自己,但评价的重点还是反馈质量——比如AI有没有指出学生的错误、错在哪、给的指导有没有可操作性。BEA 2025的共享任务就是做这个,有团队用参数高效微调(Parameter-Efficient Fine-Tuning,PEFT,一种只微调模型少量参数就能达到不错效果的技术)的小模型,就能在这些维度上取得不错的评估成绩 [7]。这一阶段的核心是「AI当评委,评AI的回答质量」。
而PSI的不同之处在于,它评价的不是「回答好不好」,而是「回答合不合适」——它把课程进度、学生知识状态、先修关系这些教学语境拉进了评价体系 [1]。之前的评价更像看作业改得对不对,PSI是看这道题出得是不是符合学生当前水平、是不是在正确的时间出现。换句话说,评价逻辑从「答案质量」走向了「教学适配性」,从静态的内容评价,走向了动态的、和学习者状态绑定的过程评价。
这一步为什么重要?因为AI家教真正的潜力,从来不是当一个「会说话的答案书」,而是当一个能跟着学生节奏调整的自适应老师。没有适配性的评价,就不可能有真正的自适应教学。
五、这个指标离走进课堂还有多远?
听上去很美,但PSI目前还只是个实验室里的原型,离真正走进日常课堂还有不少路要走。研究作者自己也坦诚地列出了好几个局限 [1]。
最根本的一条:PSI靠的是关键词匹配和正则表达式这种「代理方法」,不是深度语义分析,也不是经过验证的心理测量工具 [1]。它能数出回答里有几个「例如」,但判断不出这个例子举得到不到位;它能检测出超纲词汇,但分不清是必要的铺垫还是无关的炫技。真要用来做高利害的评价,这个精度还远远不够。
其次,两个子项的区分度很差:艾宾浩斯遗忘项完全依赖场景元数据,各模型得分都一样,等于没比;认知负荷项所有模型都接近满分(≥0.996),也起不到筛选作用 [1]。6个指标里有两个「打酱油」,说明指标体系本身还得打磨。
更重要的是,这项研究只基于一门Python入门课、30个场景、4款特定模型 [1]。它能不能推广到数学、文学、物理这些完全不同的学科?能不能用在K12或者职业教育里?现在谁也说不准。而且研究里用的都是预设的场景,不是真实课堂里学生和AI一来一回的多轮对话——真实教学可比单轮问答复杂多了。
最后也是最关键的:PSI衡量的是「教学适宜性」,但适宜性最终要落到学习结果上——用PSI优化过的回答,是不是真的能让学生学得更好、记得更牢?这项研究还没做这个验证 [1]。毕竟,指标再漂亮,学生成绩没提升也是白搭。
这些局限其实也指向了未来的方向。比如,已有研究在用带知识状态的生成式智能体模拟学生答题,来评估预测试题的质量 [3];还有研究在分析儿童和AI在科学活动中的真实对话模式,看什么样的支持最有效 [4]。这些方向如果和PSI这样的适配性指标结合起来,一个合理的猜测是:我们或许就能从「评价一次回答合不合适」,走到「预测一段教学能不能真的帮到学生」。
而回到教师的角色,PSI这类工具最大的价值,可能不是替代教师做评价,而是给教师提供一个抓手——让教师能快速诊断AI回答的问题,调整提示词,把AI的输出校准到符合自己课程节奏和学生水平的状态 [2]。说到底,AI家教的「会不会教」,最终还是要由懂教学的人来把关。
如果你只记住一件事
评价AI家教,别再只看「答得对不对」了——真正拉开差距的是「会不会搭梯子」,而只要给AI明确的结构化反馈,8成以上原本教得不好的案例都能明显改进。
参考文献
- Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index(arXiv、2026、全文精读)
- Towards Educator-AI Co-Intelligence Synergy(2026、仅摘要)
- Knowledge-State Generative Agents for Pre Assessment Question Evaluation(Journal of the Association for Information Systems、2026、仅摘要)
- Characterizing AI Support Patterns in Child-AI Dialogue During a Science-Themed Planet-Design Activity: A Computational Interaction Analysis(SSRN、2026、仅摘要)
- Using Generative AI to Provide Feedback to Adult Tutors in Training and Assess Real-life Performance(EdArXiv (OSF Preprints)、2024、仅摘要)
- Generative AI Evaluation of Human Tutors: Demonstrations and Considerations for Prompt Engineering(2024、仅摘要)
- Wonderland_EDU@HKU at BEA 2025 Shared Task: Fine-tuning Large Language Models to Evaluate the Pedagogical Ability of AI-powered Tutors(2025、仅摘要)