AI 辅导为什么总爱直接给答案?帮得多反而可能学不好?
你可能见过学生用AI做作业:一问就给完整代码,一讲就把步骤列全。我们默认AI是”更耐心的老师”,但它真的在”辅导”,还是在”代劳”?最新的真实课堂数据给出了反直觉的答案。
一个反直觉的发现:95%的情况下,AI都在直接给高帮助
如果让你猜,AI辅导时会有多少比例直接给答案?很多人可能以为一半一半,或者至少会先引导一下。但美国一所大学AI入门课的真实数据,把这个数字推到了一个夸张的程度。
研究人员分析了203名学生与AI的14637条辅导对话,发现超过95%的AI回复都属于”高帮助度”——要么直接把完整解题方案给出来(占55.2%),要么把思路和方法解释得明明白白(占40.3%)[1]。而像人类老师常做的”给个小提示""反问引导一下”这类低帮助度回复,加起来还不到5%。
你可能会说,那是学生问得直接啊。但研究发现,哪怕在不同类型的作业里,高帮助回复也始终占主导——比如pandas编程作业的平均帮助度更高,搜索算法作业稍低,但整体趋势没变[1]。换句话说,通用大语言模型的默认行为,就是”能帮多少帮多少”,而不是”让学生自己想多少”。
这就引出了一个核心问题:AI到底是在辅导,还是在替学生干活?要回答这个,我们得先有一把尺子,能量清楚”帮多帮少”。
怎么衡量”帮多帮少”:五级脚手架量表的由来
教育心理学里有个经典概念叫脚手架(scaffolding)——就像建房子搭的架子,给学习者提供临时支撑,等他能力够了再拆掉。好的辅导不是直接把房子建好给你,而是搭刚好够的架子,让你自己往上爬。
为了衡量AI辅导的”脚手架高度”,研究团队开发了一个五级量表,从L0到L4,核心区分标准是:学生还需要付出多少认知努力才能完成任务[1]。
- L0 最低帮助:比如”你再想想”,没有实质内容
- L1 引导:反问学生的思路,比如”你觉得第一步应该做什么?”
- L2 提示:给一个局部线索,比如”可以试试用循环”
- L3 解释:讲清楚完整思路和方法
- L4 解题:直接给出可直接使用的完整答案
选五级不是随便拍脑袋——它对应了教育理论里从”完全自主”到”完全代劳”的连续谱,也方便后续做量化分析[1]。
有了量表,怎么给一万多条对话打标签?纯人工太慢,也太贵。研究人员用了”AI自动分类+人工验证”的路子:让GPT-4o-mini根据量表定义,结合对话上下文给每条回复分级,再抽300条让两位研究者盲标,作为金标准检验[1]。
结果还不错:两位人工标注者的一致性非常高(κ=0.901),AI分类器的准确率约75%,主要误差是把”解题”误判成”解释”,反过来的错误很少[1]。也就是说,真实的”直接给答案”比例,可能比统计的55%还要略高一点,但”高帮助占绝对主导”这个结论站得住脚。
当然,实际情况比这个比喻更复杂——对话是动态的,上下文会影响判断,有些回复介于两级之间,量表也只能做到相对准确。
AI怎么答,决定了你怎么问——但不决定你考得好不好
有了这把尺子,研究人员发现了两个很有意思的规律。
第一个规律:AI的回复方式,会系统性地影响学生接下来怎么问[1]。
如果AI直接给了解题答案,接下来29.7%的学生会继续提”帮我再写个这个”之类的写作请求;如果AI是在解释思路,接下来40.5%的学生会问概念性问题;如果AI反过来引导学生思考,学生最可能贴出更多代码或错误信息,提供更多上下文[1]。
简单说就是:你给答案,我就继续要答案;你讲思路,我就跟着想思路。对话的走向,其实从AI第一句话开始就被塑造了。
但第二个规律更反直觉:AI帮多帮少,几乎不能预测学生之后的考试成绩[1]。
研究人员做了回归分析:先拿学生之前的成绩和平时提问习惯,预测三次闭卷考试的分数,再把”AI平均帮助度”这个因素加进去,看能多解释多少分数差异。结果是:三次考试分别多解释2.1%、1.1%、1.0%,而且统计上都不显著[1]。
换句话说,你以为”AI帮得少,学生练得多,考得就好”,或者”AI讲得细,学生理解深,考得就好”——在真实课堂数据里,这两种效应都几乎看不到。控制了基础水平之后,AI帮助度和考试成绩基本没关系。
等等,这和我们的直觉不一样啊。难道帮多帮少真的无所谓?
别着急下结论。这篇论文自己也说了:它是观察性研究,只能说”预测力有限”,不能说”没有因果关系”[1]。比如,可能基础差的学生更爱要答案,基础好的学生也爱要答案(反正自己会,要了省时间),两头一混,就看不出差异了。
要找因果,得做实验。
为什么帮得多反而学不好?——来自对照实验的证据
另一篇用逻辑拼图做的对照实验,给了我们更清晰的因果线索。
实验设计很巧妙:三阶段,124名被试。第一阶段无AI,测基线能力;第二阶段20分钟训练,随机分成三组——无AI组、低成本AI组(每次求助扣0.1分)、高成本AI组(每次扣0.18分);第三阶段再撤掉AI,测最终能力[2]。
逻辑拼图这种任务的好处是,几乎不需要先验知识,能纯粹测推理能力的提升,减少背景差异的干扰[2]。
结果很清楚:
- 成本越低,用AI越多:低成本组平均求助6.67次,高成本组3.33次,正好翻倍[2]。
- 用得越多,技能提升越少:无AI组的奖励率提升了1.95,高成本组1.66,低成本组只有1.32——便宜的AI反而让技能提升少了约20%[2]。
- AI还会制造”学会了”的错觉:用AI辅助时的表现,会系统性高估之后无辅助的真实能力,高估幅度约0.22个单位[2]。
但最关键的发现是:真正影响技能提升的,不是你用了多少次AI,而是你在求助前自己独立思考了多久[2]。
研究人员算了一个叫”solo share”的指标——训练阶段里,求助前独立解题的时间占总时间的比例。贝叶斯模型显示,solo share和技能提升显著正相关:独立思考占比越高,后续不用AI时表现越好。而AI使用次数本身,和技能提升几乎没关系(相关系数接近0)[2]。
这就对上了:AI帮得多本身不是问题,问题是它替代了你的独立思考。你一上来就要答案,脑子没动,自然学不到东西。你先自己琢磨半小时,实在不会再问,效果就不一样。
当然,这个实验是短期的(约1小时),用的是逻辑推理任务,AI100%正确,能不能直接套到大学编程课上还不好说[2]。但它给了我们一个很重要的视角:关键不是”用不用AI”,而是”AI有没有替你思考”。
这件事以前我们就知道:人类辅导也有同样的规律
其实这个规律一点都不新鲜——人类辅导里早就发现了。
2024年一项关于K-12数学同伴辅导的研究,把辅导对话分成了三类:最低帮助的、促进性的(引导思考)、建设性的(直接给答案讲方法)。结果你猜怎么着?促进性对话和更高的学习率相关,而建设性对话反而和更低的学习率相关[5]。
为什么”给答案”反而不好?内容分析发现,同伴辅导里的建设性对话,经常会强化错误解法,或者直接把答案说出来,让被辅导的人没机会自己想[5]。你看,和AI辅导的问题一模一样。
只不过AI把这个问题放大了。人类同伴辅导里,直接给答案的对话其实很少——只出现在8%的解题步骤之后[5]。毕竟人还会犹豫一下,还会想”我是不是应该让他自己先想想”。但AI不会犹豫,它的默认设置就是”有求必应,帮到极致”。
所以AI辅导的困境,本质上不是新问题,而是一个老问题的极端化版本:直接给答案的辅导,哪怕答案是对的,也不如引导思考来得有效。AI只是把”给答案”的成本降到了几乎为零,把这个老问题推到了我们面前。
更深层的问题:LLM的”会”,和人类的”会”不是一回事
说到这儿,你可能会问:那我们改改提示词,让AI别直接给答案,学着引导学生不就行了?
没那么简单。这里有个更深层的问题:LLM的”会解题”,和人类老师的”会解题”,可能根本不是一回事。
另一项研究做了个很有意思的实验:让人类学生和6个LLM做同一份化学试卷和定量推理试卷,然后分别对两组的答题数据做探索性因子分析(一种用来找出数据背后潜在能力结构的统计方法),再让学科专家盲评这些因子能不能被赋予教学意义[3]。
结果差异巨大:
- 定量推理:人类的5个因子里有3个能被专家解释(比如”读图题""代入排除法”),而LLM的5个因子,一个都解释不了[3]。
- 化学:人类的4个因子全部可解释,LLM的4个因子里只有2个能解释——而且解释还都是”这些题都是二选一""题目是连着的”这类表面格式,不是知识内容[3]。
打个比方:两个人都考了80分,一个人的得分规律是”代数好、几何弱、应用题一般”,清清楚楚;另一个人的得分规律你完全摸不着头脑,既不是按知识点分的,也不是按难度分的,甚至可能是看选项长相蒙的——你说第二个人”会”了吗?好像会了,但你又说不出他到底会了什么[3]。
这就是问题所在:人类老师能引导学生,是因为他知道学生卡在哪一步,知道该从哪个知识点入手提示。但LLM自己的”知识结构”都是人类看不懂的,你让它怎么精准地”搭脚手架”?一个合理的猜测是,它要么不会,要么就只能一股脑把答案全倒出来。
也难怪专门评测LLM教学能力的MathTutorBench发现:解题能力强不等于教学能力强,学科专业能力和教学能力之间甚至存在权衡关系——模型越专门做辅导,越能平衡这两者[6]。通用大模型解题再厉害,直接拿来当老师,天生就差点意思。
接下来怎么办:我们离”会教的AI”还有多远?
说了这么多问题,那路该怎么走?
首先得承认,我们现在知道的还很有限。比如最关键的一个问题:如果真的把AI的帮助度降下来,让它多引导少给答案,学生的学习效果真的会变好吗?现在的观察性研究回答不了,实验证据也还只在逻辑拼图这类简单任务上有[1][2]。跨学科、跨模型、长期效果的证据,都还缺。
其次是测量工具的进步。前面说的五级脚手架量表,就是一个很好的开始——有了量化的尺子,我们才能说清楚”AI到底帮了多少”,才能比较不同模型、不同提示策略的差异[1]。还有像MathTutorBench这样的教学能力评测基准,专门测”会不会教”而不是”会不会做”,也在补这块短板[6]。
第三是数据的开源。真实的辅导对话数据是稀缺资源。最近发布的Million Tutoring Moves(百万辅导动作)数据集,第一版就有4654条数学辅导文字记录,目标是建一个大规模、多模态的开放辅导数据仓库[7]。有了真实的人类优秀辅导数据,AI才能学明白”好的辅导到底长什么样”。
最后,可能我们得调整对AI辅导的期待。它不是一个”更耐心的人类老师”,而是一种全新的辅导工具——有它自己的优势(随时可用、知识量大),也有它天生的缺陷(默认给答案、认知结构和人类不同)。最好的用法,可能不是让AI替代老师,而是让AI帮老师搭好脚手架,再由人来把控节奏和深度。
如果你只记住一件事
学习这件事,从来都是”自己想明白的才是自己的”——AI越方便、越勤快,你越要记得先自己思考,再开口求助。
参考文献
- LLM Pedagogical Behavior in AI Tutoring Interactions(arXiv、2026、全文精读)
- How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles(arXiv、2026、全文精读)
- Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses(arXiv (Cornell University)、2026、全文精读)
- A systematic review of multimodal emotion and sentiment analysis based agentic AI frameworks in educational systems(Discover Computing、2026、仅摘要)
- Combining Dialog Acts and Skill Modeling: What Chat Interactions Enhance Learning Rates During AI-Supported Peer Tutoring?(2024、仅摘要)
- MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors(ArXiv.org、2025、仅摘要)
- Million Tutoring Moves (MTM): An Open Multimodal Dataset for the Science of Tutoring(arXiv (Cornell University)、2026、仅摘要)