Chunlin 的论文科普

AI辅导越好用,学生越学不会?我们能在不限制AI的前提下解决「技能退化」吗?

很多大学老师都有一个共同的担忧:学生越来越习惯用AI写作业、解题,长期下来会不会自己反而不会思考了?但直接禁用AI既不现实,也浪费了AI作为辅导工具的潜力。有没有办法既保留AI的便利,又不让学生变「懒」?

一个被普遍感知的隐忧:AI会不会让我们越用越笨?

你可能自己也有过这种体验:本来想自己算个账,手指已经点开了计算器;本来想自己写一段话,先打开AI看看它怎么说。不是我们真的不会,而是「让AI代劳」太方便了,大脑会本能地选择省力的路径。

在教育心理学里,这叫认知卸载(cognitive offloading)——把本该自己动脑完成的认知任务,交给外部工具去做。偶尔一次卸载当然没问题,但如果学习过程中本该用来练手、练脑的环节都被卸载了,就可能导致技能退化(deskilling):看似任务完成得又快又好,真到自己独立上阵的时候,反而不会了。

这种担心不是空穴来风。2026年的一项随机对照实验发现,仅仅10-15分钟的AI辅助,就会让人事后独立解题的表现显著下降,也更容易放弃——也就是「坚持性」降低了 [8]。更有意思的是,连AI的打字速度这种看似无关紧要的细节,都会影响人的依赖程度:AI响应越快,人们越倾向于把任务交给它;而数学能力越强的人,越不容易依赖AI [6]。

这就带来一个很现实的困境:AI越好用、响应越快,我们越容易偷懒;可如果为了防止依赖就把AI做慢、做难用,又违背了工具本身的价值。难道我们只能在「用AI变懒」和「不用AI低效」之间二选一吗?

为什么同样是用AI,有人越学越好、有人越学越差?

如果你观察过学生用AI的方式,会发现一个很有意思的现象:同样是用ChatGPT写作业,有人写完了啥也没记住,有人却借着AI的帮助把知识点吃透了。这不是AI本身有好坏,而是人和AI的互动方式完全不同。

2026年提出的一个理论框架——神经可塑性-AI交互模型(Neuroplasticity-AI Interaction Model, NAIM)——把人和LLM的学习互动分成了三条路径,正好能解释这种差异 [5]:

第一条叫直接绕过(direct bypass):AI直接把完整答案给你,你连想都不用想,生成性的脑力劳动完全被跳过了。这是最糟糕的一种,学习几乎不会发生,长期下来技能必然退化。

第二条叫认知卸载(cognitive offloading):你把任务中的某一部分交给AI,但核心的思考还保留着。比如写论文时,你自己想论点、搭框架,让AI帮你查资料、改语法。这时候卸载是好是坏,取决于被卸载的那部分是不是你本来要练的目标——如果你练的是逻辑,卸载语法没问题;如果你练的是写作,连句子都让AI写,那就有问题了。

第三条叫支架式挣扎(scaffolded struggle):AI不给你答案,而是给你提示、问你问题、帮你复盘,你自己始终握着思考的主动权。就像好的教练不会替你跑,但会在你跑不动的时候推你一把,在你动作错的时候指出来。这才是真正能促进学习的互动方式。

另一项关于AI辅助与推理的研究也印证了这一点:提示式的辅助比全自动的引导更能保留学习者主动的认知活动;除非AI支持能显著提升效率和准确率,否则它只会减少学习者自己的推理步骤,降低解释的深度 [7]。

所以问题的关键从来不是「能不能用AI」,而是「怎么用AI」。直接要答案,AI就是拐杖,用久了腿会软;被引导着自己动脑,AI就是健身教练,练得多了肌肉会变强。

实验验证:给用户「照镜子」,比「罚分」更能减少依赖

既然路径决定结果,那下一个问题就是:我们能不能通过设计AI工具,主动把用户往「支架式挣扎」的路径上推,而不是一上来就给答案?而且前提是——不限制AI的功能,不搞强制禁用,让用户自己选。

2026年的一篇核心论文 Designing Against Deskilling: Metacognitive Feedback Reduces Cognitive Offloading to LLM Assistants 专门研究了这个问题,答案是:可以,而且方法比你想的简单——给用户「照镜子」就行 [1]。

研究者设计了两种干预手段,在704人参与的预注册在线实验中测试效果,任务是分数算术练习 [1]:

第一种叫元认知反馈(metacognitive feedback)——每做完一道题,AI会给你看三段信息:第一段是「过程镜像」,告诉你刚才是怎么用AI的(是完全自己做的、只要了思路、要了中间结果,还是直接要了完整答案);第二段是「练习信息」,直白地告诉你这种使用方式对你的练习意味着什么(比如「你直接要了完整答案,这样你练习这道题的机会就少了」);第三段是「监控提示」,提醒你下一题注意自己的理解程度。旁边还配了一个四档条形图,把你的使用模式可视化出来 [1]。

注意,这个反馈完全是信息性的——它不评判你,也不禁止你做什么,只是把你刚才的行为和后果明明白白摆在你面前,让你自己决定下一题怎么做。打个比方,就像你跑步的时候戴了块运动手表,它不会逼你跑快一点,只会告诉你「你刚才走了10分钟,心率没上去,锻炼效果会打折扣」,然后你自己选要不要接着跑。当然,实际情况比这个比喻更复杂,因为学习中的认知过程是内在的,不像心率那样可以直接测量。

第二种干预是基于努力的奖励——用积分来奖惩:不用AI或者只要思路,得10分;要中间结果,得5分;直接要完整答案,只得1分。这是一种很常见的产品思路:用激励引导用户行为,相当于「你少依赖AI,我就给你好处」 [1]。

实验结果很反直觉:元认知反馈有效,奖励基本没用 [1]。

具体来说,元认知反馈让用户「直接要完整答案」的几率降低了53%(OR = 0.47),后续无AI辅助测试的正确率几率提升了51%(OR = 1.51)[1]。而努力奖励呢?无论是对卸载行为还是测试成绩,都没有统计上显著的影响 [1]。

更有意思的是两者作用方式的差别:奖励虽然在一定程度上减少了整体使用AI的频率,但不改变使用结构——一旦用户决定用AI,还是倾向于直接要答案;而元认知反馈不怎么减少AI的总使用量,但改变了使用方式——答案卸载的比例从58.2%降到了51.2%,更多人从「直接要答案」变成了「先要思路试试」 [1]。

研究者还发现了一个细节:元认知反馈主要减少的是重复卸载——也就是上一题已经直接要了答案,下一题接着要的惯性。没有反馈的时候,上一题卸载的人里有69.7%下一题继续卸载;有了反馈,这个比例降到了55.9% [1]。换句话说,很多人依赖AI不是故意偷懒,而是「用着用着就习惯了」,元认知反馈相当于在这个惯性路径上放了个小提醒,把人拉回来一点。

为什么「照镜子」比「罚分」管用?一个合理的猜测是:奖励是外部施压,容易引起抵触,而且用户会觉得「我是为了分才不用AI的」,一旦没有奖励,行为就反弹了;而元认知反馈是帮用户自己看见行为的后果,调动的是内在的学习动机——当人真的意识到「哦,我这么做其实学不到东西」,改变是自发的,也更持久。

当然,这个实验也有它的边界。比如它用的是分数算术这种答案客观、难度可控的任务,用的是「只有用户明确要求才给答案」的AI助手,样本是成人在线学习者 [1]。如果换成写作、编程这种更复杂的任务,换成AI主动推送答案的场景,换成真实课堂里的学生,效果会不会一样?现在还不知道。而且实验只测了练习结束后立刻进行的测试,长期效果如何也还不清楚 [1]。

好的AI辅导,不只是给答案,更是「诊断得准、反馈得对」

元认知反馈解决的是「避免伤害」的问题——不让AI把学习机会都抢走。但一个好的AI辅导工具,光「不添乱」还不够,还得能主动促进学习。这就要求AI得像个真正的好老师:首先得准确判断学生现在到底会什么、不会什么,然后才能给出适配的帮助。

这个「判断学生知识状态」的技术,在智能辅导系统里叫知识追踪(Knowledge Tracing, KT)——相当于给学生的知识水平做动态「体检」,根据答题历史实时更新对学生掌握程度的估计。

知识追踪说起来简单,做起来难,其中一个经典难题叫新题冷启动(question cold start):当系统里加了一道新题,还没有学生做过、没有历史交互数据的时候,模型就很难判断这道题的难度和知识点属性,诊断准确率会暴跌。2026年的一篇论文 Enhancing knowledge tracing robustness for new question cold start in Intelligent Tutoring Systems 专门研究了这个问题 [2]。

研究者设计了一个叫PICKT的知识追踪模型,融合了三类特征:题目难度、题目文本、知识图谱关系,然后通过消融实验(就是逐一去掉某类特征,看性能掉多少)来判断哪类特征在冷启动时最关键 [2]。

结果发现:在正常的「暖启动」场景(题目已经有很多学生做过)下,三类特征的贡献差别不大;但一到新题冷启动,性能差距立刻拉开——基线模型的AUC从约0.85跌到0.6左右,相当于从「良好诊断」退化成「不太靠谱的猜测」,而PICKT靠多特征融合能把AUC拉回0.83以上 [2]。

更有意思的是按难度拆分的结果:对于特别难的新题,「难度标签」比题目内容还重要——去掉难度标签后,模型的预测能力几乎崩溃(AUC仅0.39),而去掉文本和知识图谱还能勉强维持 [2]。原因也很好理解:极难题的正确率本来就极低,「难」本身就是最强的信号;反过来,中低难度的新题,模型可以靠文本和知识图谱「找亲戚」——如果新题和以前见过的题语义像、知识点近,就能迁移过去 [2]。

这也从侧面说明,AI辅导的「智能」不是凭空来的,它的诊断能力高度依赖它见过的数据和拥有的特征。为什么很多AI辅导工具用起来觉得「不准」?很可能不是模型不够大,而是它对你的学情、对你正在做的题,根本还没「摸透」。

那诊断准了、反馈设计对了,AI辅导到底能不能提分?2026年另一项针对英国GCSE科学课的研究给出了肯定的答案:研究者用教师主导的微型随机对照试验(micro-RCT),在4周时间里评估了AI辅导平台Medly的效果,发现和常规自主复习相比,用Medly的学生后测成绩平均高出0.33个标准差(Hedges’ g = 0.33),物理、化学、生物三科都有正向效果 [3]。

不过这个研究也提醒我们一件事:AI产品迭代太快了,等你花一两年做完大型评估,产品的模型、界面、反馈逻辑可能已经全换了——你测的那个版本早就不存在了。所以研究者提出,AI教育的评估不能再用传统的「一锤定音」式大实验,而要走「快速累积」的路子:用小而快的micro-RCT不断迭代验证,让证据系统本身也跟着AI一起「学习」 [3]。

另外要注意的是,研究里发现「用得越多成绩越好」只是相关关系,不是因果——愿意多做题的学生本身可能更努力、基础更好,不能简单得出「多用AI就能提分」的结论 [3]。

从「能不能用」到「怎么设计才对」:AI教育的研究走到了哪一步?

把这些研究串起来看,你会发现AI教育领域的研究重心正在发生一次转向:

早期的研究(也就是四五年前)主要在回答「AI会不会让学生变懒」「AI对学习是好是坏」这类问题,结论往往是矛盾的——有的说有害,有的说有益 [5]。现在我们慢慢明白,这种问题本身就问错了:AI不是一个非黑即白的东西,它的影响完全取决于人和它的交互方式。

于是研究的重心就转向了「怎么设计AI工具,才能让它更多地成为学习的支架,而不是绕过学习的捷径」。我们今天讲的元认知反馈就是这条路上的一个重要进展——它证明了不靠强制、不靠禁用,仅仅通过设计反馈方式,就能有效减少认知卸载,提升独立表现 [1]。

但这还远远不是终点。还有很多开放问题等着回答:

比如,元认知反馈的效果能持续多久?现在的实验只测了练习结束后的即时测试,过一周、一个月还会不会有效果?会不会时间长了用户就对反馈免疫了 [1]?

比如,这些发现在不同学科、不同人群里能不能复制?现在的实验大多用的是数学题、成人样本,换成写作、编程这种开放性更强的任务,换成中小学生或者大学生,效果会不会一样 [1]?

再比如,现在实验里的AI都是「用户不问就不给答案」的被动型助手,可现实中很多AI工具是主动推送答案的——你刚打个开头,它就把整段都给你补全了。这种场景下,元认知反馈还管不管用?毕竟很多时候卸载都不是用户主动选的,是AI硬塞过来的 [1]。

还有一个更高层的视角:AI不只能用来当辅导工具,还能用来重塑整个评估体系。2026年的一篇关于高等教育自适应评估的综述就提到,生成式AI可以实现动态出题、实时调整难度、个性化反馈,让评估从「一考定终身」变成伴随学习过程的、持续的诊断,这才是真正以学习者为中心的教育 [4]。当然,这背后也有学术诚信、算法偏见、伦理监管等一堆问题要解决 [4]。

对高校的启示:与其纠结禁不禁止,不如关注AI工具的设计逻辑

讲了这么多研究,最后落到高校教师和教育政策观察者最关心的实际问题:面对AI,我们到底该怎么办?

首先,别再纠结「禁不禁止」了。禁止既不现实——学生私下还是会用,也浪费了AI作为学习工具的巨大潜力。更重要的是,未来的职场本身就是人和AI协作的场景,大学如果完全不让学生接触AI,反而是在脱离现实。

那该关注什么?关注AI工具的设计逻辑。一个AI辅导工具是帮人学会,还是替人学了,从设计上就能看出来。如果你是老师,选AI工具的时候可以问自己三个问题:

第一,它是不是一上来就给完整答案?如果是,那它大概率是在走「直接绕过」的路径,对学习有害无益。好的工具应该默认先给提示、给思路,把完整答案藏在更深的地方,让学生至少先经过一番思考才能拿到 [5]。

第二,它有没有引导式反馈?也就是它会不会像教练一样,在你做的过程中给你搭支架,而不是直接把路给你铺好。提示式的辅助比全自动的引导更能保留学习者的主动思考 [7]。

第三,它有没有元认知层面的设计?比如会不会让你看见自己的使用模式,会不会提醒你哪些环节你自己动脑了、哪些交给AI了。「照镜子」比「罚分」管用,这个结论已经有实验证据支持了 [1]。

对于学校的政策制定者来说,思路也要从「管控使用」转向「引导设计」。与其花力气查学生有没有用AI,不如花力气去评估、推荐那些符合学习科学原理的AI工具,给教师和学生提供明确的使用指引。甚至可以更进一步,把AI融入评估体系,用自适应评估替代传统的标准化考试,让AI从「作弊工具」变成「学习伙伴」 [4]。

最后想说,AI从来不是教育的敌人,坏的设计才是。工具的形态,决定了我们和它互动的方式;而我们互动的方式,最终决定了我们会成为什么样的学习者。

如果你只记住一件事

AI会不会让学生变笨,不取决于AI本身,而取决于人和AI的互动方式——直接要答案有害,被引导着自己动脑有益。


参考文献

  1. Designing Against Deskilling: Metacognitive Feedback Reduces Cognitive Offloading to LLM Assistants(arXiv、2026、全文精读)
  2. Enhancing knowledge tracing robustness for new question cold start in Intelligent Tutoring Systems(arXiv、2026、全文精读)
  3. Evaluating AI Tutoring at the Speed of Innovation: Practitioner-Led Micro-Randomised Trials of an AI Tutoring Platform in GCSE Science(arXiv、2026、全文精读)
  4. Adaptive and Personalized Assessment Systems Using Generative Artificial Intelligence(Advances in computational intelligence and robotics book series、2026、仅摘要)
  5. Bypass, Offload, or Scaffold: A Conceptual Model of How Large Language Models Shape Learning(2026、仅摘要)
  6. Cognitive Offloading in the Age of AI: How Bot Typing Speed and Math Skill Shape the Choice to Offload(Psychology Archives、2025、仅摘要)
  7. Augmented Thinking: How AI Assistance Reshapes Human Reasoning in Problem-Solving(OSF Preprints (OSF Preprints)、2026、仅摘要)
  8. AI Assistance Reduces Persistence and Hurts Independent Performance(arXiv、2026、仅摘要)