AI 家教能像调音量一样控制教学风格吗?
课堂上,学生卡壳时你需要给点提示,学生没信心时你需要多鼓励,学生想偷懒时你得把他拉回正题——好的教学,本来就是随时切换风格的艺术。但用过 AI 家教的老师多半有个感觉:这东西要么太”直给”,直接把答案甩你脸上;要么太”啰嗦”,绕半天说不到重点;你想让它温柔一点,它可能就开始跑题;你想让它严格一点,它又像个只会念标准答案的机器人。
为什么 AI 家教总是”不对味”?核心问题不是它懂不懂知识,而是教师没法精准控制它的教学行为。你只能在提示词里写”请做一个有耐心的老师”,但”有耐心”到底是多给提示、多鼓励,还是多反问?AI 理解的和你想要的,常常不是一回事。更麻烦的是,一旦学生状态变了,你没法像调音量一样,随手把教学风格从”提示模式”拧到”鼓励模式”。
这种可控性的缺失,也让不少教育者开始反思:如果 AI 家教总是按自己的”脾气”来,传统的学业评价方式是不是已经没法准确衡量学生的真实能力 [4]?
给 AI 装七个教学档位:PIVOT 是怎么做到的
最近一篇名为 PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering 的论文,就给 AI 家教装上了一个真正的”教学风格旋钮”——不是靠改提示词,而是直接在模型内部”调整声道”,让教师能在 7 种明确的教学行为之间实时切换 [1]。
你可以把它想象成音响的均衡器:以前你只能对着麦克风说”请把低音调高点”,音响可能理解成把音量整体调大;现在你有 7 个独立的推子,每个推子对应一种具体的教学动作,推上去多少,效果就有多强。
这 7 个档位不是研究者拍脑袋想的,而是从智能辅导和课堂话语研究的文献里提炼出来的、可区分的典型教学行为(tutor move),大致可以分成三类 [1]:
- 脚手架类:帮学生搭建思考台阶,比如 Pump(追问,让学生多说一点)、Focusing(聚焦,把跑偏的话题拉回来);
- 答案揭示类:不同程度地给出信息,比如 Hint/Funnelling(提示,一步步引导)、Prompt(直接要求做什么)、Assertion(直接给出知识点或答案)、Feedback(反馈对错和原因);
- 反思类:引导学生自我觉察,比如 Metacognition(元认知提问,比如”你对自己的理解有多大信心?”)。
同一个问题,比如学生问”什么是逆温、为什么影响空气质量”,在 PIVOT 的控制下,AI 家教可以给出 7 种完全不同风格的回应:从”逆温就是暖空气层盖在冷空气上面,污染物散不出去”的直接讲解,到”暖空气在上、冷空气在下,污染物还能往上飘吗?“的提示引导,再到”你觉得自己现在对这个概念理解到哪一步了?“的反思追问 [1]。
当然,实际情况比这个比喻更复杂——它不是简单地给每种风格写个模板,而是通过**激活转向(activation steering)**技术实现的:简单说就是在不修改模型权重、也不改动提示词的前提下,在推理时往模型的残差流(residual stream,你可以理解为模型内部传递信息的”主干道”)里注入”转向向量”,直接改变模型的输出倾向。
PIVOT 的核心是一套”生成-判断-优化”的在线学习循环 [1]:
- 先让冻结的大模型生成一批候选回答;
- 用经过人类验证的 LLM 裁判(分别负责判断教学行为类型、内容相关性、语言流畅度)给这些回答打标签;
- 把目标教学行为作为正例,把容易和它混淆的其他行为作为”硬负样本”,构造偏好对,用加权的偏好优化损失,在模型的多层残差流上联合训练出每个档位对应的转向向量。
这里有个反直觉的发现:很多人以为 AI 越靠后的层越负责高级行为,但实验显示,控制教学风格时,去掉最后几层几乎不影响效果,反而是早期和中间层最关键——这说明”怎么说话”的风格表征,在模型的前半段就已经形成了 [1]。
而且这些向量不是”一次性”的。推理的时候,你可以:选单个向量、调强度(α 参数)、注入指定层,甚至把多个向量加减组合。比如”反馈”档位原本命中率是 48%,把”提示""直接讲解""聚焦""追问”这几个容易混淆的向量减掉一点,命中率就能升到 73% [1]。
效果到底怎么样?在数学和地球科学的辅导数据上,当强度 α=1.5 时,7 种教学行为的平均目标命中率都在 88% 左右;哪怕拿到完全没见过的大学 AI 课程对话数据上,命中率也有 80.6% [1]。
更有说服力的是教师的真实反馈。30 名数学教师参与了用户研究,对比使用相同提示词的中性基线版本和 PIVOT 可控版本,结果 73.3% 的教师更喜欢可控版本的对话,认为控制方式清晰、好用、符合教学实际;在 1-5 分的 Likert 量表上,“支持性好但不过度揭示答案”得分 4.23,“内容连贯相关”得分 3.83,“控制效果清晰”得分 3.77 [1]。老师们还会根据学生状态自己搭组合:学生卡住时用”聚焦+提示+追问”三件套,学生没信心时加上直接讲解和反思提问 [1]。
从「能用」到「好用」:AI 家教可控性的三步进化
PIVOT 不是凭空出现的,它其实是 AI 家教可控性这条路上的第三步。
第一步,是传统的智能辅导系统(Intelligent Tutoring Systems, ITS)。这条路走了几十年,核心是把学生知识和教学策略都显式地建模出来——学生哪里没掌握、下一步该练什么、该给什么反馈,都是规则或专门模型算好的 [5]。它的优点是精准、适应性强,缺点是成本极高,只能针对特定学科和知识点,很难规模化。有基准测试显示,哪怕是今天最好的大语言模型,在教学适应性上也只是勉强模仿 ITS 的皮毛 [6]。
第二步,是大模型时代的提示工程和微调。大模型一来,大家发现不用从零建系统了,只要写好提示词,或者用教学数据微调一下,就能得到一个像模像样的 AI 家教。比如用强化学习把模型往”有帮助、个性化、有创造力”的方向对齐 [7],或者用行为引导微调让模型更会苏格拉底式提问 [8]。但这条路的问题是,控制是”粗粒度”的——你能让模型整体更像个好老师,但没法在课堂上实时、精准地切换具体策略。提示词写得再细,模型也可能跑偏;微调完了,风格就固定了,想改就得重新训。
而 PIVOT 代表的第三步,是激活转向(activation steering)。简单说就是:模型我不训了,权重全冻住;我只在推理的时候,往模型内部的”信息流”里加一点点方向,就能改变输出行为。它的好处显而易见:不用重训模型、切换几乎零成本、控制粒度细到具体的教学动作、还能组合使用。用”调音旋钮”来类比的话,ITS 是定制好的固定音效 CD,提示工程和微调是出厂预设的几种音效模式,而激活转向是你手上那个能实时拧的均衡器。
不过,现在就说”AI 家教可控性问题解决了”还为时过早。PIVOT 自己也承认好几个关键局限 [1]:
第一,它只验证了教师偏好和回答质量,没测真实的学生学习效果。老师觉得好用是一回事,学生用了之后是不是真的学得更好、记得更牢,还没有数据。这也是所有 AI 教育技术最核心的考验。
第二,控制是静态的,得老师手动调。现在的旋钮是给老师用的,老师得自己判断学生状态、自己切档位。但真正理想的 AI 家教,应该能自动感知学生卡壳了、走神了、没信心了,然后自动切换策略——这一步还没做到。
第三,效果边界还很窄。目前的实验主要在 Qwen3.5-9B 系列模型上、数学和科学类辅导场景、强度 α 在 1.0 到 2.0 之间时效果最好;强度太高的话,内容相关性和流畅度会急剧下降。换到更小的模型,反思类的行为质量就会明显下降;换到其他模型家族、其他学科、非英语场景,效果怎么样还不知道。跨模型迁移时,“提示”这类行为的命中率掉得最厉害 [1]。
第四,复杂策略的组合还缺乏系统验证。现在我们知道两个向量加减大概有用,但如果是更复杂的多步教学策略(比如先聚焦、再提示、再追问、最后反馈),向量组合起来会不会互相干扰、效果还纯不纯,还说不清楚 [1]。
如果你只记住一件事
AI 家教的核心矛盾,正在从”能不能答对题”变成”能不能按老师想要的方式教”,而 PIVOT 代表的激活转向技术,第一次让”像调音量一样实时切换教学风格”从比喻变成了实验室里可验证的现实。
参考文献
- PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering(arXiv、2026、全文精读)
- Exploring Large Language Models for Evaluating Automatically Generated Questions(OSF Preprints (OSF Preprints)、2026、仅摘要)
- Transformers in Education: Personalized Learning Systems with AI-Driven Recommendations(2026、仅摘要)
- From courseroom to competency: Are AI-reliant graduates truly prepared?(NSUWorks (Nova Southeastern University)、2026、仅摘要)
- Proceedings of the Second Work shop on Artificial Intelligence for Artificial Intelligence Education(OAPEN (The OAPEN Foundation)、2026、仅摘要)
- Can Large Language Models Match Tutoring System Adaptivity? A Benchmarking Study(ArXiv.org、2025、仅摘要)
- Cultivating Helpful, Personalized, and Creative AI Tutors: A Framework for Pedagogical Alignment using Reinforcement Learning(ArXiv.org、2025、仅摘要)
- Discerning minds or generic tutors? Evaluating instructional guidance capabilities in Socratic LLMs(ArXiv.org、2025、仅摘要)