Chunlin 的论文科普

AI辅导为什么总给“懒人”喂答案?——它看不见学生在提问前做了什么

两个学生问了一模一样的Python报错:一个调试了5分钟试了3种方法,一个看完上条回复直接复制再问。现在的AI编程助手几乎给同样的回答——它只看见了问题,没看见学生之前做了什么。

过去几年,AI教学聊天机器人凭借即时响应和规模化能力,已经成为很多课程的标配辅助工具 [6]。但师生们很快发现了一个共同的尴尬:这些AI辅导总像”没眼力见”——不管你是真的努力过了还是只想抄答案,它都一视同仁地喂答案。越来越多的研究也证实,通用聊天机器人和真正的上下文感知AI导师,在学习支持上存在明显差异 [8]。

AI辅导要实现真正的自适应,需要从”只理解学生说什么”走到”能看见学生做了什么”。这一步怎么走、走到了哪、又会遇到什么新问题?

一、为什么AI辅导总像”没眼力见”?

教过书的人都知道,学生提问的”含金量”差别极大。同样一句”这道题怎么做”,背后可能是完全不同的学习状态:有人啃了半小时走投无路,有人连题目都没读完就开问。有经验的老师会区别对待——前者给点拨,后者先反问”你怎么想的”。

但现在的AI辅导做不到这一点。绝大多数AI教学助手的工作逻辑很简单:你输入问题,它根据对话历史生成回答。它能看到你”说”了什么,却看不到你”做”了什么。这就像一个老师只听学生提问,从不看学生的草稿纸、练习册和解题过程——再聪明的老师也难教到点子上。

一项针对编程教育的对比研究发现,专为课程设计的上下文感知AI导师,和通用聊天机器人提供的支持模式有显著区别,但两者共同的局限是:都难以仅凭对话文本判断学生的真实努力程度和认知状态 [8]。另一项关于提示策略的研究也表明,能结合学习上下文的混合提示策略,学习效果比单纯的规则式或数据驱动提示都要好——这说明”看见上下文”本身就是辅导质量的关键 [7]。

问题的核心很清楚:AI缺一双”观察的眼睛”。它不知道学生在提问前敲了多少行代码、跑了几次、卡在哪一步,自然也就没法像人类老师那样因材施教。

二、给AI装一双”观察的眼睛”:TutorTrace做了什么?

如果把AI辅导比作医生看病,现在的情况是:病人只说”我肚子疼”,医生就直接开药。而人类老师会先做检查——看看舌苔、摸摸肚子、问问病史,再下诊断。TutorTrace这套系统,就是想给AI装上”检查设备”。

简单说,TutorTrace做的事情是:把编程IDE(集成开发环境,也就是学生写代码的地方)里每一个细粒度的操作都记录下来,再翻译成AI能理解的”行为语言” [1]。

你可以把它想象成一个精密的课堂观察员,坐在学生旁边记笔记:现在在敲代码(编辑了多少字符、改了哪些行),现在点了运行(跑通了还是报错了、报的什么错),现在盯着屏幕没动手(是在思考还是卡住了),现在切到了聊天窗口准备提问……这些细碎的操作,就是原始的”遥测数据” [1]。

当然,实际情况比这个比喻更复杂。原始操作是零散的,TutorTrace需要先把它们”翻译”成有意义的行为片段。研究团队让4名领域专家经过10轮迭代,制定出一套包含8类行为的”码本”——比如Implementing(实现功能)、Debugging(调试)、Thinking(思考)等,再把这套人工标注规则转化为自动分类算法 [1]。

最终,TutorTrace从原始数据里提取出27个可连续计算的指标,覆盖代码活动、终端操作、错误恢复、时间分布等维度 [1]。更重要的是,它按三个时间窗口对学生行为做了画像:

有了这些画像,AI就不再是”盲猜”学生状态了。两个问出一模一样问题的学生,在TutorTrace眼里可能是完全不同的两个人——一个是”挣扎了5分钟、试了3种方法的探索者”,一个是”看完回复立刻复制的依赖者” [1]。

三、“看见行为”之后:AI真的能更懂怎么教吗?

“看见”只是第一步,关键是:看见了之后,辅导效果真的会变好吗?

TutorTrace的研究者在两门Python入门课上做了初步的课堂验证。他们给一部分AI辅导加上了”行为感知提示”——也就是在学生提问时,把他之前的行为状态一起告诉AI,让AI据此调整回答方式。结果非常直观:学生”不动脑子就追问”的比例,从原来的50.0%降到了20.7% [1]。两次提问之间,学生的代码编辑量从11.7次涨到23.7次,终端运行次数从1.0次涨到2.1次,两次提问的间隔时间也从47秒拉长到74.9秒 [1]。

换句话说,当AI能”看见”学生没怎么努力就提问时,它会给出更具引导性的回答,而不是直接喂答案——学生因此不得不自己多动手、多思考。这和另一项关于提示策略的研究结论一致:结合上下文的混合提示策略,确实能带来更好的学习效果 [7]。

但有意思的是,研究里有一个反直觉的发现,值得所有教育者警惕。在”首次提问前”的三类学生里:

不是越努力越成功吗?为什么”上来就问”的学生反而完成率最高?一个可能的解释是:冷启动型学生可能是先仔细读了题、想清楚了思路才提问,他们的问题往往精准而高效;而挣扎型学生可能从一开始就走错了方向,越努力陷得越深。这也说明,“行为画像”不是简单给学生的”努力程度”打分,而是识别不同的学习状态——不同状态需要的是完全不同的辅导策略,而不是”越努力就越该帮” [1]。

不过研究者也坦诚,目前的评估只是初步的:实验用的是非随机的准实验设计,还不能确立严格的因果关系;而且只测量了行为变化,没有直接测量学习增益——也就是说,学生动手多了,不等于真的学得更好了 [1]。

四、不止编程课:AI辅导的”自适应”走到了哪一步?

从IDE遥测数据看学习者行为,只是AI自适应辅导这条路上的一个分支。如果把视野拉宽,你会发现”看见行为”这件事,在不同的教育场景里有完全不同的形态和挑战。

先看看在线论坛里的辅导。一项对美国K-12数学论坛Math Nation的8万多条帖子的分析发现,专家老师和学生同伴的辅导风格差异很大:同伴发帖频率几乎是老师的两倍,给的反馈和承认也更多,但更倾向于直接给答案;而老师的辅导更有方向性,目标更明确 [3]。更有意思的是,在老师和学生都参与的讨论里,老师的存在像一只”看不见的手”——学生给出反馈后,后续出现”直接给答案”的概率反而下降了,老师会悄悄规范同伴的帮忙方式 [3]。这对AI辅导的启发是:好的辅导不只是”回答问题”,还要懂得调节整个学习互动的节奏和方式。

再看代数辅导里的公平困境。一项基于ASSISTments代数数据集的研究发现了一个”奖励-公平鸿沟”:如果让AI辅导系统纯粹追求”总奖励最高”(比如学生答题正确率最高),反而会带来最不公平的学习结果——好的学生越来越好,差的学生越来越差 [4]。表现最好的纯奖励策略(DDQN),学生掌握程度的差异也最大;而把启发式规则和大模型结合的混合策略,虽然总奖励不是最高,但学生之间的掌握差异最小(方差只有0.003),最差学生的掌握水平也比纯奖励策略高出4.6倍 [4]。这说明,“自适应”不能只看整体效率,还要考虑公平——否则AI辅导可能会放大而不是缩小教育差距。

还有一个更隐蔽的陷阱:“假懂”。一项关于自适应学习系统的研究揭示了一种叫”欺骗性过度概括”的现象——学生可能凭着不完整的理解,碰巧做对了题,系统就以为他掌握了,早早停止了练习,结果留下了知识漏洞 [5]。研究者用日本麻将规则教学做了11项实验,发现这种”假懂”非常普遍,而常规的基于正确率的掌握判定根本检测不出来 [5]。怎么解决?他们的办法是专门设计”禁止行动”题——不是问”该做什么”,而是问”不该做什么”,再加上明确指出缺失约束的反馈,就能把错误应用降到接近零的水平 [5]。

你看,“看见行为”只是第一步。看见之后怎么回应、怎么平衡效率和公平、怎么避免被”表面正确”欺骗——这些才是自适应辅导真正难的地方。

五、小模型、本地化、隐私:AI辅导的另一条路?

说到AI辅导,很多人默认的路径是:更大的模型、更多的数据、更细的行为追踪。但有没有另一种可能——不用那么大的模型,不用收集那么多隐私数据,也能做出好用的AI助教?

希腊的一项研究给出了一个有意思的答案。研究者开发了一款叫S.T.A.R.T. BOT的双角色AI助教,面向希腊初中家政课(一门跨经济学、健康教育和社会责任的综合课) [2]。它的设计思路和我们前面说的都不一样:不靠追踪学生行为来做自适应,而是靠”双角色切换”和基于教材的RAG(检索增强生成,一种让模型基于指定知识库回答问题的技术)架构 [2]。

什么是双角色?同一个AI,学生用的时候,它是”学习向导”——用通俗的语言讲知识点,还标清楚教材出处;老师用的时候,它就变成”教学助手”——出试卷、写教案、设计课堂实验 [2]。相当于一个AI同时干家教和备课助理两份活。

更反直觉的是它的模型选择。研究者同时测试了两款大模型(Gemini、DeepSeek)和一款小模型(Gemma 3:4b),结果发现:在搭配了基于希腊官方教材的RAG之后,小模型Gemma的表现和大模型几乎打平——回答学生问题的语义相似度,Gemma是0.753,Gemini是0.773,差距非常小;在生成教师用的测试题时,Gemma甚至在某些主题上表现比Gemini还好 [2]。

这就像专科老师不一定比全科博士讲得差——只要知识范围限定得足够清楚,小模型也能把特定领域的事情做好。而且小模型还有一个大模型比不了的优势:可以直接装在学校本地服务器上用,不用把学生数据传到外网,更符合隐私法规,对预算有限的学校也更友好 [2]。

当然,这项研究的局限性也很明显:只在一门课、一个学段、一种语言里做了测试,样本量也很小,还没有真实课堂的长期使用数据 [2]。但它至少提醒我们:AI辅导的未来不一定是”更大、更多、更全”,也可能有”小而美、本地、隐私友好”的另一条路。

六、还没解决的问题:看见之后,然后呢?

聊到这里,你可能已经发现了:AI辅导从”只看问题”到”看见行为”,解决了一些老问题,但也引出了更多新问题。

第一个问题:检测到被动学习之后,AI该怎么干预才有效?TutorTrace的研究证明了行为感知提示能减少”躺平提问”,但研究者自己也承认,他们还不知道最优的干预方式是什么 [1]。是直接拒绝回答?还是给更有引导性的提示?还是先让学生做个小自测?不同的学生、不同的学习状态,可能需要完全不同的干预策略——这些都还没有定论。

第二个问题:行为数据的边界在哪?现在TutorTrace只能看到IDE里的操作,学生如果在别的窗口查资料、在纸上打草稿,AI是看不见的 [1]。那未来要不要扩展到浏览器、甚至屏幕录像?收集的数据越细,对学生的了解越深,但隐私风险也越大。这中间的平衡点在哪里?

第三个问题:怎么避免”行为画像”变成新的监控和偏见?当AI能判断学生是”真挣扎”还是”装努力”,会不会反过来诱导学生表演”努力的样子”?就像现在的在线学习系统里,有些学生会故意拖动视频进度条、反复点击页面来刷”学习时长”。而且,行为模式的判定标准本身可能就有偏见——比如思考时间长到底是”认真”还是”走神”?不同学习风格的学生会不会被同一套标准误判?

这些问题,其实在更早的自适应学习研究里已经露出了端倪。代数辅导里的”奖励-公平鸿沟”提醒我们:优化单一指标往往会牺牲公平 [4];“欺骗性过度概括”提醒我们:系统能观察到的行为,和学生真正的知识掌握之间,永远存在差距 [5]。

回到开头那个场景:两个学生问了一模一样的问题,一个努力过,一个没有。让AI”看见”这份差异,只是第一步。看见之后,怎么回应才既有效又公平,既帮到学生又不剥夺他思考的机会,既利用数据又不侵犯隐私——这些,才是AI辅导真正要回答的难题。

如果你只记住一件事

AI辅导的核心差距,从来不是”够不够聪明”,而是”够不够了解学生”。


参考文献

  1. TutorTrace: A Dataset and Taxonomy for Classifying Learner Behavioral States during AI-Assisted Programming Education(arXiv、2026、全文精读)
  2. Beyond the Chatbot: Co-Learning and Co-Teaching through a Dual-Persona Generative-AI Assistant(arXiv、2026、全文精读)
  3. Investigating Expert and Peer Tutoring Behaviors in a Large Online Discussion Forum Using Temporal Dynamic Analytics(Journal of Learning Analytics、2026、全文精读)
  4. Adaptive Reinforcement Learning for Skill-Level Intelligent TutoringSystem in Algebra Education(SSRN、2026、仅摘要)
  5. Deceptive Overgeneralization: When Adaptive Learning Enables Systematic Misapplication(Journal of Computer Assisted Learning、2026、仅摘要)
  6. AI-Teaching Chatbot: Personalized Learning Platform with an AI Teaching Bot(INTERANTIONAL JOURNAL OF SCIENTIFIC RESEARCH IN ENGINEERING AND MANAGEMENT、2025、仅摘要)
  7. Performance Evaluation of Prompt Generation Strategies for AI Agents in Online Programming Education(Journal of Advanced Computing Systems、2025、仅摘要)
  8. Towards Understanding the Impact of Context-Aware AI Tutors and General-Purpose AI Chatbots on Student Learning(2025、仅摘要)