AI辅导越好用,学生越学不会?我们能在不限制AI的前提下解决「技能退化」吗?
很多大学老师都有一个共同的担忧:学生越来越习惯用AI写作业、解题,长期下来会不会自己反而不会思考了?但直接禁用AI既不现实,也浪费了AI作为辅导工具的潜力。有没有办法既保留AI的便利,又不让学生变「懒」?
一个被普遍感知的隐忧:AI会不会让我们越用越笨?
你可能自己也有过这种体验:本来想自己算个账,手指已经点开了计算器;本来想自己写一段话,先打开AI看看它怎么说。不是我们真的不会,而是「让AI代劳」太方便了,大脑会本能地选择省力的路径。
在教育心理学里,这叫认知卸载(cognitive offloading)——把本该自己动脑完成的认知任务,交给外部工具去做。偶尔一次卸载当然没问题,但如果学习过程中本该用来练手、练脑的环节都被卸载了,就可能导致技能退化(deskilling):看似任务完成得又快又好,真到自己独立上阵的时候,反而不会了。
这种担心不是空穴来风。2026年的一项随机对照实验发现,仅仅10-15分钟的AI辅助,就会让人事后独立解题的表现显著下降,也更容易放弃——也就是「坚持性」降低了 [8]。更有意思的是,连AI的打字速度这种看似无关紧要的细节,都会影响人的依赖程度:AI响应越快,人们越倾向于把任务交给它;而数学能力越强的人,越不容易依赖AI [6]。
这就带来一个很现实的困境:AI越好用、响应越快,我们越容易偷懒;可如果为了防止依赖就把AI做慢、做难用,又违背了工具本身的价值。难道我们只能在「用AI变懒」和「不用AI低效」之间二选一吗?
为什么同样是用AI,有人越学越好、有人越学越差?
如果你观察过学生用AI的方式,会发现一个很有意思的现象:同样是用ChatGPT写作业,有人写完了啥也没记住,有人却借着AI的帮助把知识点吃透了。这不是AI本身有好坏,而是人和AI的互动方式完全不同。
2026年提出的一个理论框架——神经可塑性-AI交互模型(Neuroplasticity-AI Interaction Model, NAIM)——把人和LLM的学习互动分成了三条路径,正好能解释这种差异 [5]:
第一条叫直接绕过(direct bypass):AI直接把完整答案给你,你连想都不用想,生成性的脑力劳动完全被跳过了。这是最糟糕的一种,学习几乎不会发生,长期下来技能必然退化。
第二条叫认知卸载(cognitive offloading):你把任务中的某一部分交给AI,但核心的思考还保留着。比如写论文时,你自己想论点、搭框架,让AI帮你查资料、改语法。这时候卸载是好是坏,取决于被卸载的那部分是不是你本来要练的目标——如果你练的是逻辑,卸载语法没问题;如果你练的是写作,连句子都让AI写,那就有问题了。
第三条叫支架式挣扎(scaffolded struggle):AI不给你答案,而是给你提示、问你问题、帮你复盘,你自己始终握着思考的主动权。就像好的教练不会替你跑,但会在你跑不动的时候推你一把,在你动作错的时候指出来。这才是真正能促进学习的互动方式。
另一项关于AI辅助与推理的研究也印证了这一点:提示式的辅助比全自动的引导更能保留学习者主动的认知活动;除非AI支持能显著提升效率和准确率,否则它只会减少学习者自己的推理步骤,降低解释的深度 [7]。
所以问题的关键从来不是「能不能用AI」,而是「怎么用AI」。直接要答案,AI就是拐杖,用久了腿会软;被引导着自己动脑,AI就是健身教练,练得多了肌肉会变强。
实验验证:给用户「照镜子」,比「罚分」更能减少依赖
既然路径决定结果,那下一个问题就是:我们能不能通过设计AI工具,主动把用户往「支架式挣扎」的路径上推,而不是一上来就给答案?而且前提是——不限制AI的功能,不搞强制禁用,让用户自己选。
2026年的一篇核心论文 Designing Against Deskilling: Metacognitive Feedback Reduces Cognitive Offloading to LLM Assistants 专门研究了这个问题,答案是:可以,而且方法比你想的简单——给用户「照镜子」就行 [1]。
研究者设计了两种干预手段,在704人参与的预注册在线实验中测试效果,任务是分数算术练习 [1]:
第一种叫元认知反馈(metacognitive feedback)——每做完一道题,AI会给你看三段信息:第一段是「过程镜像」,告诉你刚才是怎么用AI的(是完全自己做的、只要了思路、要了中间结果,还是直接要了完整答案);第二段是「练习信息」,直白地告诉你这种使用方式对你的练习意味着什么(比如「你直接要了完整答案,这样你练习这道题的机会就少了」);第三段是「监控提示」,提醒你下一题注意自己的理解程度。旁边还配了一个四档条形图,把你的使用模式可视化出来 [1]。
注意,这个反馈完全是信息性的——它不评判你,也不禁止你做什么,只是把你刚才的行为和后果明明白白摆在你面前,让你自己决定下一题怎么做。打个比方,就像你跑步的时候戴了块运动手表,它不会逼你跑快一点,只会告诉你「你刚才走了10分钟,心率没上去,锻炼效果会打折扣」,然后你自己选要不要接着跑。当然,实际情况比这个比喻更复杂,因为学习中的认知过程是内在的,不像心率那样可以直接测量。
第二种干预是基于努力的奖励——用积分来奖惩:不用AI或者只要思路,得10分;要中间结果,得5分;直接要完整答案,只得1分。这是一种很常见的产品思路:用激励引导用户行为,相当于「你少依赖AI,我就给你好处」 [1]。
实验结果很反直觉:元认知反馈有效,奖励基本没用 [1]。
具体来说,元认知反馈让用户「直接要完整答案」的几率降低了53%(OR = 0.47),后续无AI辅助测试的正确率几率提升了51%(OR = 1.51)[1]。而努力奖励呢?无论是对卸载行为还是测试成绩,都没有统计上显著的影响 [1]。
更有意思的是两者作用方式的差别:奖励虽然在一定程度上减少了整体使用AI的频率,但不改变使用结构——一旦用户决定用AI,还是倾向于直接要答案;而元认知反馈不怎么减少AI的总使用量,但改变了使用方式——答案卸载的比例从58.2%降到了51.2%,更多人从「直接要答案」变成了「先要思路试试」 [1]。
研究者还发现了一个细节:元认知反馈主要减少的是重复卸载——也就是上一题已经直接要了答案,下一题接着要的惯性。没有反馈的时候,上一题卸载的人里有69.7%下一题继续卸载;有了反馈,这个比例降到了55.9% [1]。换句话说,很多人依赖AI不是故意偷懒,而是「用着用着就习惯了」,元认知反馈相当于在这个惯性路径上放了个小提醒,把人拉回来一点。
为什么「照镜子」比「罚分」管用?一个合理的猜测是:奖励是外部施压,容易引起抵触,而且用户会觉得「我是为了分才不用AI的」,一旦没有奖励,行为就反弹了;而元认知反馈是帮用户自己看见行为的后果,调动的是内在的学习动机——当人真的意识到「哦,我这么做其实学不到东西」,改变是自发的,也更持久。
当然,这个实验也有它的边界。比如它用的是分数算术这种答案客观、难度可控的任务,用的是「只有用户明确要求才给答案」的AI助手,样本是成人在线学习者 [1]。如果换成写作、编程这种更复杂的任务,换成AI主动推送答案的场景,换成真实课堂里的学生,效果会不会一样?现在还不知道。而且实验只测了练习结束后立刻进行的测试,长期效果如何也还不清楚 [1]。
好的AI辅导,不只是给答案,更是「诊断得准、反馈得对」
元认知反馈解决的是「避免伤害」的问题——不让AI把学习机会都抢走。但一个好的AI辅导工具,光「不添乱」还不够,还得能主动促进学习。这就要求AI得像个真正的好老师:首先得准确判断学生现在到底会什么、不会什么,然后才能给出适配的帮助。
这个「判断学生知识状态」的技术,在智能辅导系统里叫知识追踪(Knowledge Tracing, KT)——相当于给学生的知识水平做动态「体检」,根据答题历史实时更新对学生掌握程度的估计。
知识追踪说起来简单,做起来难,其中一个经典难题叫新题冷启动(question cold start):当系统里加了一道新题,还没有学生做过、没有历史交互数据的时候,模型就很难判断这道题的难度和知识点属性,诊断准确率会暴跌。2026年的一篇论文 Enhancing knowledge tracing robustness for new question cold start in Intelligent Tutoring Systems 专门研究了这个问题 [2]。
研究者设计了一个叫PICKT的知识追踪模型,融合了三类特征:题目难度、题目文本、知识图谱关系,然后通过消融实验(就是逐一去掉某类特征,看性能掉多少)来判断哪类特征在冷启动时最关键 [2]。
结果发现:在正常的「暖启动」场景(题目已经有很多学生做过)下,三类特征的贡献差别不大;但一到新题冷启动,性能差距立刻拉开——基线模型的AUC从约0.85跌到0.6左右,相当于从「良好诊断」退化成「不太靠谱的猜测」,而PICKT靠多特征融合能把AUC拉回0.83以上 [2]。
更有意思的是按难度拆分的结果:对于特别难的新题,「难度标签」比题目内容还重要——去掉难度标签后,模型的预测能力几乎崩溃(AUC仅0.39),而去掉文本和知识图谱还能勉强维持 [2]。原因也很好理解:极难题的正确率本来就极低,「难」本身就是最强的信号;反过来,中低难度的新题,模型可以靠文本和知识图谱「找亲戚」——如果新题和以前见过的题语义像、知识点近,就能迁移过去 [2]。
这也从侧面说明,AI辅导的「智能」不是凭空来的,它的诊断能力高度依赖它见过的数据和拥有的特征。为什么很多AI辅导工具用起来觉得「不准」?很可能不是模型不够大,而是它对你的学情、对你正在做的题,根本还没「摸透」。
那诊断准了、反馈设计对了,AI辅导到底能不能提分?2026年另一项针对英国GCSE科学课的研究给出了肯定的答案:研究者用教师主导的微型随机对照试验(micro-RCT),在4周时间里评估了AI辅导平台Medly的效果,发现和常规自主复习相比,用Medly的学生后测成绩平均高出0.33个标准差(Hedges’ g = 0.33),物理、化学、生物三科都有正向效果 [3]。
不过这个研究也提醒我们一件事:AI产品迭代太快了,等你花一两年做完大型评估,产品的模型、界面、反馈逻辑可能已经全换了——你测的那个版本早就不存在了。所以研究者提出,AI教育的评估不能再用传统的「一锤定音」式大实验,而要走「快速累积」的路子:用小而快的micro-RCT不断迭代验证,让证据系统本身也跟着AI一起「学习」 [3]。
另外要注意的是,研究里发现「用得越多成绩越好」只是相关关系,不是因果——愿意多做题的学生本身可能更努力、基础更好,不能简单得出「多用AI就能提分」的结论 [3]。
从「能不能用」到「怎么设计才对」:AI教育的研究走到了哪一步?
把这些研究串起来看,你会发现AI教育领域的研究重心正在发生一次转向:
早期的研究(也就是四五年前)主要在回答「AI会不会让学生变懒」「AI对学习是好是坏」这类问题,结论往往是矛盾的——有的说有害,有的说有益 [5]。现在我们慢慢明白,这种问题本身就问错了:AI不是一个非黑即白的东西,它的影响完全取决于人和它的交互方式。
于是研究的重心就转向了「怎么设计AI工具,才能让它更多地成为学习的支架,而不是绕过学习的捷径」。我们今天讲的元认知反馈就是这条路上的一个重要进展——它证明了不靠强制、不靠禁用,仅仅通过设计反馈方式,就能有效减少认知卸载,提升独立表现 [1]。
但这还远远不是终点。还有很多开放问题等着回答:
比如,元认知反馈的效果能持续多久?现在的实验只测了练习结束后的即时测试,过一周、一个月还会不会有效果?会不会时间长了用户就对反馈免疫了 [1]?
比如,这些发现在不同学科、不同人群里能不能复制?现在的实验大多用的是数学题、成人样本,换成写作、编程这种开放性更强的任务,换成中小学生或者大学生,效果会不会一样 [1]?
再比如,现在实验里的AI都是「用户不问就不给答案」的被动型助手,可现实中很多AI工具是主动推送答案的——你刚打个开头,它就把整段都给你补全了。这种场景下,元认知反馈还管不管用?毕竟很多时候卸载都不是用户主动选的,是AI硬塞过来的 [1]。
还有一个更高层的视角:AI不只能用来当辅导工具,还能用来重塑整个评估体系。2026年的一篇关于高等教育自适应评估的综述就提到,生成式AI可以实现动态出题、实时调整难度、个性化反馈,让评估从「一考定终身」变成伴随学习过程的、持续的诊断,这才是真正以学习者为中心的教育 [4]。当然,这背后也有学术诚信、算法偏见、伦理监管等一堆问题要解决 [4]。
对高校的启示:与其纠结禁不禁止,不如关注AI工具的设计逻辑
讲了这么多研究,最后落到高校教师和教育政策观察者最关心的实际问题:面对AI,我们到底该怎么办?
首先,别再纠结「禁不禁止」了。禁止既不现实——学生私下还是会用,也浪费了AI作为学习工具的巨大潜力。更重要的是,未来的职场本身就是人和AI协作的场景,大学如果完全不让学生接触AI,反而是在脱离现实。
那该关注什么?关注AI工具的设计逻辑。一个AI辅导工具是帮人学会,还是替人学了,从设计上就能看出来。如果你是老师,选AI工具的时候可以问自己三个问题:
第一,它是不是一上来就给完整答案?如果是,那它大概率是在走「直接绕过」的路径,对学习有害无益。好的工具应该默认先给提示、给思路,把完整答案藏在更深的地方,让学生至少先经过一番思考才能拿到 [5]。
第二,它有没有引导式反馈?也就是它会不会像教练一样,在你做的过程中给你搭支架,而不是直接把路给你铺好。提示式的辅助比全自动的引导更能保留学习者的主动思考 [7]。
第三,它有没有元认知层面的设计?比如会不会让你看见自己的使用模式,会不会提醒你哪些环节你自己动脑了、哪些交给AI了。「照镜子」比「罚分」管用,这个结论已经有实验证据支持了 [1]。
对于学校的政策制定者来说,思路也要从「管控使用」转向「引导设计」。与其花力气查学生有没有用AI,不如花力气去评估、推荐那些符合学习科学原理的AI工具,给教师和学生提供明确的使用指引。甚至可以更进一步,把AI融入评估体系,用自适应评估替代传统的标准化考试,让AI从「作弊工具」变成「学习伙伴」 [4]。
最后想说,AI从来不是教育的敌人,坏的设计才是。工具的形态,决定了我们和它互动的方式;而我们互动的方式,最终决定了我们会成为什么样的学习者。
如果你只记住一件事
AI会不会让学生变笨,不取决于AI本身,而取决于人和AI的互动方式——直接要答案有害,被引导着自己动脑有益。
参考文献
- Designing Against Deskilling: Metacognitive Feedback Reduces Cognitive Offloading to LLM Assistants(arXiv、2026、全文精读)
- Enhancing knowledge tracing robustness for new question cold start in Intelligent Tutoring Systems(arXiv、2026、全文精读)
- Evaluating AI Tutoring at the Speed of Innovation: Practitioner-Led Micro-Randomised Trials of an AI Tutoring Platform in GCSE Science(arXiv、2026、全文精读)
- Adaptive and Personalized Assessment Systems Using Generative Artificial Intelligence(Advances in computational intelligence and robotics book series、2026、仅摘要)
- Bypass, Offload, or Scaffold: A Conceptual Model of How Large Language Models Shape Learning(2026、仅摘要)
- Cognitive Offloading in the Age of AI: How Bot Typing Speed and Math Skill Shape the Choice to Offload(Psychology Archives、2025、仅摘要)
- Augmented Thinking: How AI Assistance Reshapes Human Reasoning in Problem-Solving(OSF Preprints (OSF Preprints)、2026、仅摘要)
- AI Assistance Reduces Persistence and Hurts Independent Performance(arXiv、2026、仅摘要)