Chunlin 的论文科普

AI助教的「因材施教」,真的不用重训模型吗?

同一个「羊狼过河问题」,AI助教对初学者说「拆成步骤慢慢试」,对高阶学生说「定义状态空间找转移规律」——内容都对,画风完全不同。这种切换不需要改模型,只靠一段提示词就能实现?

同一个问题,两种讲法:AI助教的「风格切换」是什么

你可能见过不少AI助教,但大多是「千人一面」:不管你是刚入门的新生还是已经摸爬滚打半年的老生,问同一个问题,得到的回答差不多都是一个模子刻出来的。理想中的「因材施教」好像离我们还很远——毕竟要让AI适配每个学生的风格,难道不得重新训练模型?

最新的研究给出了一个有点反直觉的答案:不用重训,只靠提示工程(prompt engineering,也就是给AI一段精心设计的指令文字)就能让同一个AI助教变出好几种讲课风格 [1]。

举个具体的例子。同样是问「狼羊过河问题怎么解」,如果系统判断你是初学者、喜欢具象例子、习惯一步步来,它的回答可能是这样的:「我们把它拆成简单步骤:先想象一下河两岸的场景,找出游戏规则,然后计划第一步怎么走,再试试不同的策略,看看哪种能成功。」

但如果系统知道你是高阶学生、喜欢抽象思考、习惯从全局看问题,回答就会变成:「首先定义问题的状态空间与约束条件,找出基本动作集合,映射状态转移规律,应用解释式学习方法,最后从全局角度评估解法的优劣。」

你看,核心内容都是对的,解题思路也一致,但说话的方式、抽象程度、结构安排,完全像两个不同的老师 [1]。

这种「内容不变,形式适配」的调整,研究里叫「微个性化」(micro-level personalization)——它不改变AI教什么,只改变怎么教。打个比方,就像同一道菜,主料和营养都一样,但根据食客的口味,换了摆盘、调味和上菜顺序。当然,实际情况比这个比喻更复杂:教学里的「形式」本身就会影响学习效果,不是单纯的包装。

96种「教学人设」怎么来的:六个维度+布鲁姆分类的混合框架

能调出差异是一回事,能系统性地、可复现地调出差异是另一回事。这篇核心论文的贡献,就是搭了一个完整的框架,把「凭感觉调提示词」变成了一套可扩展的方法 [1]。

整个框架的基础是六个学习者偏好维度,组合起来一共能生成96种不同的学习者画像。这六个维度分别是:

你可以把这六个维度想象成六个调节旋钮——就像调奶茶的糖度、冰度、茶底一样,每个旋钮有2-3档,转一转就能调出不同的「回答配方」。96种不是拍脑袋编的,是这几个维度数学上的组合数。

但光有学生自己选的偏好还不够。同一个学生,问的问题难度不一样,回答方式也该不一样。比如一个高级学生问了个很基础的记忆类问题,没必要一上来就讲状态空间。

所以框架里还有第二部分:用布鲁姆分类法(Bloom’s Taxonomy,教育心理学里经典的认知目标分类框架,从记忆、理解、应用到分析、评价、创造共六个层级)自动判断学生问题的认知复杂度。研究里用了一个微调的BERT(Bidirectional Encoder Representations from Transformers,一种基于Transformer的预训练语言模型,常用于文本分类任务)分类器来做这件事,测试准确率达到0.92 [1]。

学生偏好是「适应性」(adaptability,学生主动选的),问题复杂度是「自适应」(adaptivity,系统自动判的),二者加起来编码进一段结构化提示词,再接入已有的检索增强生成(Retrieval-Augmented Generation,RAG,把外部知识库检索和大模型生成结合起来,让回答锚定课程内容而不是瞎编)管线——整个过程完全不改模型、不重训,实时生效 [1]。

那这些差异真的存在吗?研究做了两组验证。一组是NLP(自然语言处理,Natural Language Processing)自动分析:30道真实学生问题 × 97种提示配置(96种个性化+1种基线),一共生成2910条回答。结果发现,同一问题的不同回答语义相似度很高(说明核心知识点没跑偏),但词汇和结构差异很大(说明表达形式确实变了) [1]。

另一组是人类评估:5名修过这门课的学生当评估者,对不同画像的回答打分。结果显示,抽象偏好显著影响人们感知到的回答复杂度和抽象水平,加工风格偏好也会影响人们感知到的思考引导方式——也就是说,人确实能感受到这些风格差异,而且差异方向和设计预期是一致的 [1]。

不止答题风格:个性化还能覆盖情绪和课程路径

如果你以为提示工程驱动的个性化只能改改说话风格,那就小看它了。最新的研究已经把个性化的边界从「认知风格」推到了「情绪支持」,甚至「课程结构」层面。

先说情绪支持。传统的智能辅导系统(Intelligent Tutoring Systems,ITS,能根据学生表现自适应调整内容的计算机辅导系统)大多只关注认知层面——你哪道题错了,就给你补哪个知识点。但学习从来不是纯理性的事,焦虑、挫败、厌烦这些情绪都会实打实影响学习效果。

有研究开发了一款叫「Math with Matt」的代数辅导系统,在普通认知辅导的基础上,加了LLM驱动的正念(mindfulness,一种有意识地、不加评判地关注当下的心理训练方法)式情绪支持 [2]。

具体怎么做的呢?每个数学单元学完,学生会跟一个叫Matt的狐狸代理聊一会儿天——不是随便聊,而是用融入了正念原则的提示词引导LLM,比如非评判、耐心、初心这些。每次聊天后还可以选做60秒呼吸练习。就连错题反馈都改了:把冷冰冰的「不对,请点击提示」换成了「还没完全对,但完全没关系!学习需要时间和耐心」 [2]。

效果怎么样?在日本初中课堂的实验里,加了正念干预的组虽然没有在「降低数学焦虑」和「提高成绩」上比纯认知组高出显著差异,但出现了一个很有意思的结果:正念组的学生做题步数只有认知组的六成左右,用的提示也少了四成,但最后测验成绩差不多——相当于用更短的时间、更少的帮助,达到了同样的学习效果,学习效率更高了。而且学生明显觉得Matt更支持、更关心自己 [2]。

你看,只是改改说话的语气和节奏,加一点情绪关照,就能带来可测量的行为变化。这也是提示工程个性化的厉害之处:它能低成本地把「软支持」加进去。

再往大了说,个性化还能从「单次回答」延伸到「整门课的结构」。传统的课程是固定大纲,第一章讲完讲第二章,不管你是早就会了还是根本跟不上。而有研究提出了一种叫Mentrast的平台架构,思路是把课程本身当成「活的对象」——AI导师一边跟学生对话,一边用贝叶斯知识追踪(Bayesian Knowledge Tracing,一种用概率模型估算学生对各个知识点掌握程度的经典方法)实时更新对学生水平的判断,然后课程引擎根据这个判断动态重排、插入或者删掉内容 [3]。

举个例子,如果你在对话里已经表现出对某个前置知识点的熟练掌握,系统可能直接跳过那部分,把时间花在你真正卡壳的地方。这个框架的核心挑战也很实在:如果没法把学生对话里的证据可靠地对应到具体知识点上,结构层面的自适应就不靠谱 [3]。

从「能调出差异」到「真能提分」:AI个性化还有三道坎

讲了这么多可能性,得泼点冷水。把这些研究放回整个AI教育的脉络里看,我们其实才刚走了第一步——从「AI助教能回答问题」到「AI助教能调出不同风格」,但离「AI助教真的能因材施教、提升学习效果」还有不小的距离。

回顾一下这几年的进展:早期的AI助教主要解决「能不能用」的问题,比如基于RAG的系统让回答更准确、不跑题 [6];后来有了多智能体框架的设想,把学生画像、路径规划、内容推荐这些拆成不同模块分工协作 [5];再到最近的研究,开始聚焦更细粒度的个性化——不用改架构,纯靠提示工程就能实现风格层面的微调整 [1]。

每一步都往前走了,但每一步也都有自己的边界。就目前的研究来看,至少还有三道坎要跨。

第一道坎:风格有差异,不代表学习有增益。 核心论文自己也明确说了,整个研究只验证了「回答风格有可测量、可感知的差异」,完全没有测这些差异对学习成绩、长期参与度的影响 [1]。学生喜欢某种风格是一回事,用这种风格学能不能学得更好是另一回事。教育技术里这种「感觉很好但没用」的例子太多了。正念辅导的研究也类似——学习效率有提升,但最终成绩没显出差异,而且实验时间很短,长期效果未知 [2]。

第二道坎:样本太小,普适性存疑。 核心论文的人类评估只有5个参与者,作者自己都说是探索性结果,不能推广到总体 [1]。正念研究的完整样本也只有42个学生,还因为语言障碍、课堂环境这些因素打了折扣 [2]。更大的问题是,这些研究基本都在单一课程、单一学科、单一模型上做的——换一门文科课程行不行?换一个小一点的模型行不行?换一群文化背景不同的学生行不行?现在都不知道。

第三道坎:维度之间的关系还是黑箱。 96种画像是理论上的组合,但真实学习者是不是真的能分成96种?哪些维度的效应强,哪些弱?多个维度凑在一起会不会有交互效应——比如「高自我评估+宏观偏好」的效果,是不是两个维度单独效果的简单相加?这些问题目前都答不上来,因为研究的统计功效还不足以检验交互效应 [1]。往深了说,学生自己报的偏好准不准?会不会今天喜欢详细的,明天就喜欢简洁的?偏好和实际学习收益是不是真的匹配?这些也都没验证。

说穿了,现在的研究更像是「证明了提示工程能做个性化这件事」,但还没证明「做了个性化之后学习真的会变好」。从「能调出差异」到「真能提分」,中间还有很长的验证路要走。

如果你只记住一件事

能调出可感知的个性化差异,和能真正提升学习效果,是完全不同的两件事——前者已经靠提示工程低成本实现了初步验证,后者还是AI教育个性化领域待跨的核心门槛。


参考文献

  1. A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant(arXiv、2026、全文精读)
  2. Beyond Problem Solving: Large Language Models for Emotional and Reflective Support in Mathematics Learning(arXiv、2026、全文精读)
  3. Continuously Adaptive Curricula: Using Learner Models to Restructure Instruction in Real Time(2026、仅摘要)
  4. A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant(arXiv (Cornell University)、2026、全文精读)
  5. Agentic AI Framework for Personalized Learning in Higher Education: A Multi-Agent Approach for Adaptive Student Support(International Research Journal of Education and Technology (IRJET).、2024、仅摘要)
  6. Transforming student support with AI : a retrieval-based generation framework for personalized support and faculty customization(Open Collections、2025、仅摘要)
  7. INSIGHT: Bridging the Student-Teacher Gap in Times of Large Language Models(ArXiv.org、2025、仅摘要)