用大模型「模拟学生」:教育实验能告别真人受试吗?
假设你是一位高校教师,想测试一种新的教学法效果,却苦于找不到足够多的学生参与实验、也很难控制变量。如果用AI模拟出一批「虚拟学生」来跑实验,结果可信吗?
这个问题正在教育研究界引发一场方法层面的讨论。大语言模型(Large Language Model,LLM,即基于海量文本训练、能生成自然语言的人工智能模型)驱动的模拟学生,能在多大程度上替代真人学生成为教育研究的工具?它能解决真人实验的哪些痛点,又有哪些绕不开的瓶颈?
一、为什么教育研究需要「模拟学生」?
教育研究最头疼的问题之一,是真人实验太难做了。
你想测试一种新的课堂互动方式,得先征得学校同意、找够愿意参与的学生、尽量保证对照组和实验组的基础水平差不多,还得担心实验过程中各种不可控的因素——比如某个班刚好赶上期中考试,学生心思不在课堂上,结果就可能不准。更别说要覆盖不同学习风格、不同认知阶段的学生,成本会高到几乎无法承受。
这就是「模拟学生」存在的核心价值:用计算机程序虚拟出具有不同特征的学习者,在可控的环境里快速测试教学方法的效果。它的优势非常直观:成本低、可以无限重复、能精准设置学习者的各种参数,从学习风格到知识基础都可以按需调整 [1]。
过去十几年里,教育技术领域一直在尝试构建这样的模拟系统。早期的思路更多是把AI当作辅助教学的工具,比如用来给学生提供即时反馈、减轻大班教学里教师的负担 [6]。随着大模型的能力越来越强,研究者开始反过来思考:能不能让AI不是当老师,而是当「学生」,帮我们跑通各种教育实验的前置测试?
当然,实际情况比这个比喻更复杂。早期的模拟学生很多是基于规则的,只能按照预设的脚本回答问题,离「像真人一样学习」还差得很远。真正让这个领域出现质变的,是大语言模型的引入。
二、大模型时代的模拟学生:从「按规则答」到「像人一样学」
传统的规则式模拟学生,有点像早期的聊天机器人:你输入一个问题,它从预设的答案库里挑一个匹配的回复。如果问题稍微超出预设范围,它就答不上来,更别说表现出「思考过程」「犯错的规律」或者「学习进步的轨迹」了。
大语言模型驱动的模拟学生,则完全是另一种思路。你可以把它想象成一个「读过很多书、能模仿不同人说话方式的演员」——你告诉它要扮演一个「初二、数学基础中等、偏文科思维、上课容易走神」的学生,它就能在和教学系统的互动中,大致表现出符合这个设定的反应:遇到简单题能做对,遇到需要逻辑推导的题容易卡壳,走神的时候会答非所问,讲过几遍的知识点会慢慢掌握 [1]。
2026年发表在 Computer Science Review 上的综述 Simulating students with large language models: A review of architecture, mechanisms, and role modeling in education with generative AI 系统梳理了这个领域的进展,指出基于大语言模型的模拟学生之所以比传统规则系统强,核心在于两个能力:一是语言真实度高,能生成符合自然对话逻辑的回复,而不是生硬的模板答案;二是行为适应性强,能根据教学输入的变化调整自己的反应,比如老师换了一种讲解方式,它的理解程度也会跟着变化 [1]。
目前的研究已经能让模拟学生覆盖不少学习行为维度:从模仿不同的学习者类型(比如视觉型还是听觉型学习者),到对教学指令做出响应,再到多智能体场景下的课堂互动——也就是同时模拟好几个学生,让它们在同一个虚拟课堂里互相讨论、甚至互相影响 [1]。
打个比方,传统规则模拟就像提线木偶,线怎么拉它怎么动;大模型模拟更像一个有自己「行为逻辑」的角色,你给它设定好基本人设和背景知识,它会在这个框架内自主做出反应。当然,实际情况比这个比喻更复杂——它并不是真的在「学习」,而是在基于统计规律模仿学习的外在表现。
那么,这种模仿到底准不准?这才是问题的关键。
三、模拟得准不准?两个关键维度的最新进展
判断一个模拟学生够不够「真」,有两个维度特别核心:一是它能不能准确模拟学习者的知识状态变化——也就是学了之后哪些会了、哪些还不会,这个轨迹对不对;二是它能不能准确理解教学意图——也就是能不能听懂老师到底在教什么、为什么这么教,而不是只会字面意思。
先看第一个维度:知识状态追踪(Knowledge Tracing,即根据学习者的历史答题记录,预测他当前对各个知识点的掌握程度的技术)。这是模拟学生的基础——如果连「会什么不会什么」都模拟不准,后面的一切都谈不上。
传统的知识追踪方法通常把学生的所有互动记录当成一个统一的序列来处理,但最新研究发现,学习其实是分阶段的:一开始是「能力构建期」,学生对一个新概念完全陌生,容易做错;练得多了,就进入「熟练度提升期」,正确率会稳步上升。把这两个阶段混在一起建模,会产生偏差。
2026年的论文 Disentangling Knowledge States with Ability and Proficiency Modeling for Knowledge Tracing 提出了一个叫「阶段感知知识追踪」(Phase-Aware Knowledge Tracing,简称PAKT)的框架,专门把学习过程拆成「能力构建」和「熟练度提升」两个阶段分别建模,再用多分支的Transformer(当前主流的深度学习架构)把两部分信息整合起来。在六个公开基准数据集上的测试显示,这个方法比之前的代表性模型效果都好,AUC(衡量模型预测准确率的常用指标,越高越好)平均提升了0.82% [2]。
别小看这不到1%的提升——在教育场景里,对学生知识状态的判断差一点点,后续的教学策略可能就完全不一样。把学习阶段拆清楚,模拟出来的学生进步轨迹才更符合真人的学习规律。
再看第二个维度:教学意图理解。真人学生上课的时候,不只是听内容,还会下意识判断「老师讲这个是想让我学会什么」「这个例子是重点还是随便举的」。这种对教学意图的推理能力,过去的模拟学生是没有的——它们只会机械地处理输入的内容。
2026年的另一篇论文 Beyond Skepticism: Evaluating LLMs Pedagogical Intent Reasoning with the Adaptive Pedagogical Vigilance Framework 提出了「自适应教学警觉」(Adaptive Pedagogical Vigilance,简称APV)框架,用一个贝叶斯教学意图推理引擎(Pedagogical Intent Inference Engine,简称PIIE)来模拟学生的这个过程:老师为什么选这个内容、想达到什么教学目的、背后的立场和动机是什么,都可以通过推理得到。
实验结果很有意思:加入APV框架后,大模型区分「刻意设计的教学内容」和「随便看看的素材」的能力大幅提升,和人类判断的相关系数达到了0.958(满分是1,越高说明越一致);而且在真实的自然教学语料里,普通大模型的判断能力会明显下降,APV却能保持稳定的表现 [3]。
简单说,就是现在的模拟学生已经不只是「会答题」了——它能更精细地模拟知识掌握的变化过程,也能更准确地揣摩教学背后的意图。这两点加起来,让模拟的真实感上了一个台阶。
四、离「替代真人实验」还有多远?三个未解决的核心问题
看到这里你可能会问:既然模拟得这么准,是不是以后教育实验都不用找真人了?
现在下结论还太早。前面提到的那篇综述明确指出,当前大语言模型模拟学生还面临三个绕不开的核心问题 [1]。
第一个问题是算法偏见。大模型是用海量互联网文本训练出来的,文本里本身带有的各种偏见——比如对不同性别、不同地域、不同社会经济背景的刻板印象——都会被模型学过去。你想模拟一个「来自偏远地区、基础薄弱的学生」,模型生成的行为很可能掺杂了训练数据里的刻板印象,而不是真实的学习规律。这种偏见会直接影响实验结果的可信度,甚至可能反过来强化教育中的不公平 [1]。
第二个问题是评估可靠性。你怎么知道模拟学生的反应是「对的」?现在很多研究的做法是把模拟结果和真人数据做对比,看相关性高不高。但这个对比本身就有很多问题:选什么样的真人样本?用什么指标来衡量「像不像」?不同研究的评估标准很不一样,结果很难互相比较。更麻烦的是,有些学习行为(比如学习动机、情绪变化)本来就很难量化,模拟得准不准更难说 [1]。
第三个问题是和教育目标的对齐。模拟学生是用来测试教学方法的,但如果模拟出来的「好学生」只是会刷题、会应付考试,那优化出来的教学方法也只会是应试导向的。真正的教育目标——比如批判性思维、创造力、合作能力——大模型能不能模拟、怎么模拟,目前还没有很好的答案。换句话说,你模拟的目标如果偏了,整个实验的意义就打了折扣 [1]。
除此之外,前面提到的两项具体研究也有自己的局限:PAKT框架的阶段拆分机制,在不同的学习场景下是不是都适用,还需要进一步验证 [2];APV框架目前主要在翻译教学领域测试,推广到其他学科、更复杂的真实课堂场景效果如何,也还是未知数 [3]。
所以更准确的说法是:大模型模拟学生现在已经可以做「预实验」了——比如你有一个新的教学想法,先用模拟学生跑一轮,看看大致方向对不对、有没有明显的漏洞,再拿去给真人做小范围测试,这样能节省很多成本。但要说完全替代真人实验,还差得远。
如果你只记住一件事
大语言模型驱动的模拟学生目前更适合作为真人实验的「前测工具」,而非替代品——它能帮你低成本快速验证教学想法的大致方向,但算法偏见、评估标准不统一、和真实教育目标对齐难这三个核心问题不解决,它就永远只能是辅助手段。
参考文献
- Simulating students with large language models: A review of architecture, mechanisms, and role modeling in education with generative AI(Computer Science Review、2026)
- Disentangling Knowledge States with Ability and Proficiency Modeling for Knowledge Tracing(arXiv、2026)
- Beyond Skepticism: Evaluating LLMs Pedagogical Intent Reasoning with the Adaptive Pedagogical Vigilance Framework(arXiv、2026)
- Artificial Intelligence Practical Lesson 4: NLP, Agents and Multi-Agent Systems(Zenodo (CERN European Organization for Nuclear Research)、2026)
- Leveraging the Potential of Large Language Models in Education Through Playful and Game-Based Learning(Educational Psychology Review、2024)
- Adapting to the Future: Examining LLMs and AI for Education Advancement(ScholarSpace - JCCC (Johnson County Community College)、2024)