Chunlin 的论文科普

AI助教该听谁的?当教学逻辑从大模型里被「拆」出来

很多老师都试过用大模型做课程答疑助手:把课件丢进去,学生问什么,AI搜一下就答。刚上线时挺惊艳,但用着用着问题就来了——学生问”比较A和B”,AI只翻出A的定义,答非所问还振振有词;问”这个概念和之前学的有什么关系”,AI扯了一堆不相关的细节,就是不碰核心联系。问题到底出在哪?

答案可能比你想的更根本:我们让大模型干了它不该干的事——教学决策。2026年最新的一项研究提出了一个反直觉的思路:把教学逻辑从大模型里彻底拆出来,让确定性规则管”讲什么、怎么讲”,大模型只当一个”润色员”,负责把话讲通顺 [1]。这套方案不仅更可靠,甚至连商业GPU和付费API都不用。

一个普遍的困惑:为什么AI助教总答不到点子上?

先回到一线老师最熟悉的场景:你把一整门课的课件、讲义、习题解答喂给一个基于检索增强生成(Retrieval-Augmented Generation,RAG,也就是”先搜再答”的大模型架构)的助教,以为学生问什么都能从课件里找答案。

刚开始效果确实不错——学生问”什么是维度建模”,AI能准确给出定义;问”第三范式是什么”,也能答得八九不离十。早期2024年的研究也证实,配置得当的RAG助教在高中物理和大学数学课程里,回答准确率能超过64% [6]。

但很快你就会发现不对劲:学生问”星型模型和雪花模型有什么区别”,AI可能只讲了星型模型的定义,完全没提雪花模型;问”为什么这个例子里要用缓慢变化维”,AI扯了半天缓慢变化维的分类,就是不回答”为什么”。

为什么会这样?因为RAG的核心逻辑是语义相似度——把学生的问题变成一个向量,去课件库里找向量最接近的段落。但教学里的很多问题,根本不是”找一段意思相近的话”就能解决的。“比较A和B”需要的是同时找到A和B两个概念的内容,再按对比的结构组织起来;“解释为什么X”需要的是找到因果关系的论证段落,而不是X的定义。

换句话说,语义检索不等于教学匹配。学生的问题里藏着两层信息:一是”问的是哪个/哪些概念”,二是”用什么教学方式来回答”——是下定义、举例子、做比较,还是解释原理?RAG把这两层混在一起,用一个相似度分数去碰,自然经常碰错。

把教学逻辑从LLM里拆出来:一套「确定性编排」的新架构

那怎么解决这个问题?2026年发表的 A didactical-driven teacher assistant for a dimensional modeling course 给出了一个干脆的方案:教学决策和文本生成彻底分家 [1]。

你可以把这套系统想象成一个报社的工作流程:编辑(确定性规则模块)决定今天报道什么选题、用什么体裁、采访哪些信源、文章结构怎么排;记者(大语言模型,Large Language Model,LLM,即基于海量文本训练的生成式人工智能模型)只负责把编辑定好的素材和结构写成通顺的文章,不能自己加料,也不能改选题。

换个更贴近教学的比方:以前的AI助教是一个”全能代课老师”,既懂教学又会说话,但经常乱讲;现在的系统是”资深教研主任+实习老师”的组合——教研主任(确定性规则)经验丰富,说一不二,决定讲什么、怎么讲,但不直接开口;实习老师(LLM)口才好,按主任给的稿子念,偶尔帮着润色一下措辞,但不能改内容。

当然,实际情况比这个比喻更复杂——系统里LLM还会在规则拿不准的时候帮忙做有限的消歧,但核心教学决策权完全在规则手里。

这套系统的具体工作流程分六步:

  1. 意图检测:判断学生是要定义、解释、举例、比较还是识别概念,共5类教学意图;
  2. 概念检测:从问题里找出涉及的课程概念,对应到一个43个概念的轻量知识图谱;
  3. 受限检索:根据检测到的意图和概念,按元数据(概念ID+内容块类型)去课件库找对应的内容,而不是用语义相似度;
  4. 教学法解析:每种意图对应一套固定的教学路径,比如”比较”类意图就要同时调出两个概念的定义、异同点,按对比结构组织;
  5. 提示构建:把选好的内容块、教学结构指令、系统模板组装成给LLM的提示词;
  6. LLM生成:大模型只负责按结构重写内容,不得新增任何信息 [1]。

这么做真的比纯语义检索好吗?研究人员用195道真实学生问题做了测试,结果非常说明问题:

标准语义检索(也就是现在大多数RAG助教的做法)在真实语料的188个可评估”意图-概念对”中,前15个结果里能命中教学所需内容的比例只有62.6%。分意图看更夸张:定义类问题表现最好,有89.1%;但比较类问题只有可怜的14.3%——也就是说,学生问10次”比较A和B”,有8次半检索出来的内容根本不对 [1]。

这不是模型不够大,也不是嵌入算法不够好,而是结构性的失败:比较类问题涉及两个概念之间的关系,单个查询向量根本抓不住这种结构。你用”星型模型和雪花模型的区别”去搜,向量更接近”星型模型”还是”雪花模型”?都不是,它最接近的可能是某段恰好同时提到两个词的段落,但那段话未必是讲区别的 [1]。

那确定性编排的表现又如何?研究人员把它和几款免费大模型做了对比,结果很有意思:

一句话总结:确定性规则”宁可不答也不答错”,免费LLM”什么都敢答但经常错”。在教学场景下,错误的答案比不答危害大得多——学生被误导了可能还不知道。而且这套系统不需要商业GPU,也不需要付费API,成本几乎可以忽略 [1]。

不止是「谁来答」:AI助教的组织方式也在影响学习效果

说到这里,你可能已经意识到:AI助教的设计,核心从来不是”用不用大模型”,而是教学逻辑由谁掌控、怎么组织。这个判断不只适用于单助手的架构,连”用几个AI助手”这种看似无关紧要的选择,都会深刻影响学习效果。

2026年另一项研究 Human Thinking under Plural LLM Assistance 做了两个很有启发性的实验,证明了LLM辅助的组织方式本身就是一个关键的设计变量 [2]。

第一个实验是数学解题:研究人员把参与者分成四组——不用AI、只用一个导师型AI、只用一个会犯错的同伴型AI、同时用导师+两个同伴型AI。关键设计是,先让大家用AI学解题,然后做1分钟分心任务,最后不用AI做同类型的新题,测的是真正学会了多少,而不是即时抄答案的表现。

结果你猜怎么着?导师+同伴的组合效果最好,无辅助测试正确率达到65%,比只用导师的59%还高,比不用AI的42%高出一大截 [2]。

为什么会这样?因为两个会犯错的AI同伴——一个常算错数,一个常理解错概念——会逼你去分辨谁对谁错、错在哪。这个”找错”的过程,反而比直接听正确答案更能加深理解。就像班里有个同学总在课堂上提错问题,你跟着一起思考为什么错,反而比光听老师讲记得更牢。

第二个实验是开放写作:三组人分别不用AI、用一个通用AI助手、用两个分工不同的专业AI助手(比如一个管逻辑,一个管反例)。结果发现,两种AI辅助都能提升作文质量,但用单个通用助手的组,大家写出来的观点明显更趋同——不同人的作文要点相似度比不用AI的组显著更高;而用双角色助手的组,观点多样性和不用AI的组几乎没差别 [2]。

也就是说,一个AI帮你写,大家写得都一样;两个AI帮你写,想法又多元了。因为单个通用助手容易把大家往”标准答案”的方向带,而两个有不同视角的AI,反而会激发更多不同的想法。

这两个实验和前面的”确定性编排”研究,说的其实是同一件事:AI助教的灵魂是教学逻辑,不是生成能力。你用一个AI还是两个,用大模型还是规则,核心都是”教学怎么安排”,而不是”话怎么说”。

从RAG到教学驱动:智能助教这两年走了哪几步?

把视野拉远一点,你会发现智能助教这两年的发展,其实就是一条”逐渐把教学逻辑从LLM里往外拆”的路径。

2024年是RAG助教元年。大家最兴奋的是”终于能让AI讲我的课了”——把课件喂给RAG,AI就能基于课程内容回答问题,不再胡说八道。当时的研究显示,配置好的RAG助教在高中物理和大学数学课里准确率能到64%以上,大家觉得这已经很不错了 [6]。

2025年,大家开始不满足于”能答”,而是追求”答得好、会推理、能评估”。一方面,有人用参数高效微调(Low-Rank Adaptation,LoRA,一种只训练模型少量参数的微调技术)和引导奖励偏好优化(Guided Reward Preference Optimization,GRPO,一种用于增强链式思维推理的优化方法),把开源大模型改造成更懂教育的专用助手,提升回答的推理透明度和解释质量 [7];另一方面,也有人开始研究怎么评估AI助教的教学技能——比如能不能识别学生的错误、会不会给出有效引导——而不只是看答案对不对 [8]。

但不管是RAG还是微调,本质上还是把教学能力”炼”进大模型里——你要么给它更多上下文,要么给它更多训练数据,希望它能”学会”教学。

到了2026年,思路开始反转:既然教学逻辑这么重要,为什么不直接把它拿出来,明明白白写成规则? 这就是我们前面讲的”教学驱动”架构——教学决策和文本生成彻底解耦,LLM只当语言执行者 [1]。

这个转向也和领域内的综述判断一致。2026年一篇涵盖131项研究的数学教育综述明确提出:LLM最合理的定位,是作为智能辅导系统(Intelligent Tutoring System,ITS,即由领域模型、学生模型、教学模型等组成的结构化教学系统)里的”经过验证的生成组件”,而不是”自主的教学权威” [3]。另一篇关于自适应学习平台的综述也指出,经典的智能辅导系统架构本来就包含领域、学生、教学、界面四个独立模型,生成式AI只是增强了这些系统的动态内容生成和对话能力,并没有取代它们的核心结构 [5]。

换句话说,我们绕了一圈,又回到了智能辅导系统几十年前就确立的基本框架——只是现在有了LLM,“说话”这件事不用再手写模板了。

走得通但还没走远:这套方案的边界与待解问题

讲到这里,你可能已经在心里盘算:“这套方案能不能用到我的课上?“先别急,我们得诚实地说说它的边界。

首先,适用范围非常有限。这项研究是在法语的大学维度建模课程上做的,知识图谱只有43个概念,课程材料是单一教师编写的结构化Markdown [1]。如果你的课是英语的、是理工科的(比如有大量定理推导、算法、代码)、知识体系更庞杂,能不能直接搬过去?目前还不知道。

其次,覆盖率是个大问题。确定性规则只能回答32%的真实学生问题,剩下的怎么办?总不能让学生问三句,有两句都得到”抱歉,这个问题我回答不了”吧?研究人员自己也承认,尤其是占比最高的”解释”类问题,召回率特别低 [1]。怎么在不牺牲精度的前提下提高覆盖率,是这套方案最核心的开放问题。

第三,迁移成本不低。要把这套系统用到另一门课上,你得重新构建领域知识图谱、结构化课程材料、校准意图检测的词典规则——这些都得靠教学专家来做,没法自动化 [1]。如果每门课都要花这么大功夫,性价比就值得商榷了。

第四,还没验证真正的学习效果。目前的评估只到”意图+概念对”的检测正确率,也就是教学决策对不对,但最终的回答有没有教学效果、学生觉得有没有用、能不能真正提升学习成绩,这些都还没测 [1]。毕竟,教学决策正确只是必要条件,不是充分条件。

最后,也是最根本的:这套方案的核心假设——教学逻辑可以被完全形式化成确定性规则——在多大范围内成立? 对于知识体系清晰、问题类型明确的入门课,可能确实可以;但对于更开放、更思辨的课程,比如哲学、文学、社会科学,教学逻辑本身就不是确定的,那确定性规则还管用吗?

这些问题都没有答案。但有一点是确定的:把LLM当成独立的教学权威,这条路已经被反复证明走不通 [3]。不管是RAG的答非所问,还是纯大模型助教的幻觉,本质上都是把教学决策权交给了一个黑箱。而”把教学逻辑拆出来”的思路,至少让我们重新拿回了主动权——教什么、怎么教,应该由懂教学的人说了算,而不是由模型的参数说了算。

如果你只记住一件事

好的AI助教,首先是好的教学设计,其次才是好的语言模型——把教学决策从大模型的黑箱里拆出来,让懂教学的规则或人掌控”教什么、怎么教”,LLM只负责把话说通顺,才是更可靠的方向。


参考文献

  1. A didactical-driven teacher assistant for a dimensional modeling course(arXiv、2026、全文精读)
  2. Human Thinking under Plural LLM Assistance: Mathematical Problem Solving and Open-Ended Writing(arXiv、2026、全文精读)
  3. Understanding the role of large language models in supporting mathematics education(Research and Practice in Technology Enhanced Learning、2026、仅摘要)
  4. Enhancing Learning Efficiency using GPT-Based AI Platforms(2026、仅摘要)
  5. Artificial Intelligence in Education: A Comprehensive Analysis of Adaptive Learning Platforms and Personalized Tutoring(SSRN、2026、仅摘要)
  6. Chatting Over Course Material : The Role of Retrieval Augmented Generation Systems in Enhancing Academic Chatbots.(KTH Publication Database DiVA (KTH Royal Institute of Technology)、2024、仅摘要)
  7. Enhancing educational AI educhat with fine-tuned open-source language models : comparative study of parameter-efficient fine-tuning techniques and chain-of-thought reasoning(Trepo - Institutional Repository of Tampere University、2025、仅摘要)
  8. LexiLogic at BEA 2025 Shared Task: Fine-tuning Transformer Language Models for the Pedagogical Skill Evaluation of LLM-based tutors(2025、仅摘要)