Chunlin 的论文科普

AI出的物理题,真的能直接给学生用吗?

每个物理老师都有过这种经历:想给学生多练几道同类型的题,要么翻遍题库找不到合适的,要么自己编题又费时间。现在AI说它能自动生成「换汤不换药」的同构题,89%都能直接用——这靠谱吗?

老师的痛点:为什么「同构题」这么重要又这么难出

先从一个最朴素的教学场景说起:你讲完了牛顿第二定律,想让学生巩固一下,布置了三道作业题。结果下节课发现,一半学生是对着答案抄的,还有人干脆背下了解题步骤。你想再测一次,又得重新找题、改数字、编选项,半天时间就没了。

这里的核心需求,就是同构题(isomorphic problem)——也就是我们常说的”换汤不换药”:核心概念、推理路径、解题结构完全一样,只是把场景、数值、物体换了个壳。它的教学价值非常直接:既能让学生反复练习同一个知识点,又能避免”刷题背答案”的无效学习,真正检验学生是不是理解了概念本身。

但同构题的人工产出成本极高。2024年就有物理教育研究者指出,用大语言模型辅助生成物理题,已经成为一线教师减轻备课负担的一个重要方向 [6]。问题是:早期的尝试大多是教师自己跟ChatGPT对话,一步步引导修改,本质上还是”教师出题,AI打字”,效率提升有限。而且生成的题目质量参差不齐,老师还是得从头到尾审一遍,改改数字、修修表述,有时候改题的时间还不如自己出。

那么,有没有可能让AI独立完成这件事,生成的题目直接就能用?2026年的一项研究给出了一个相当乐观的数字:89% [1]。

89%可用:这套AI出题系统是怎么工作的

这篇题为 Reliable isomorphic physics problem generation with large language models 的论文,开发了一套基于大语言模型(Large Language Model,LLM,也就是我们常说的大模型)多智能体工作流的物理题生成系统,用13道入门级牛顿力学选择题做了测试,结论是89%的生成题”表述完整、可直接解答”,不需要专家修改 [1]。

你可以把这套系统想象成一个5个专业老师组成的流水线,每个人只干一件事,干完了传给下一个,中间还有人专门检查:

  1. 结构化老师(Normalizer):先把用户乱七八糟的请求整理成标准格式,避免歧义;
  2. 提取老师(Extractor):从上传的PDF题目里,把题干、选项、数学公式都抠出来,变成规范文本;
  3. 校验老师(Verifier):检查上一步提取得对不对,不对就打回去重来,还要补上答案和解析;
  4. 出题老师(Generator):这是核心角色——保留原题的概念结构、推理路径、干扰项逻辑,只改场景、数值、单位和选项顺序,生成一道新题;
  5. 排版老师(Latexifier):把生成的题目用LaTeX格式化,编译成可以直接用的PDF。

当然,实际情况比这个比喻更复杂。这套系统不是5个模型,而是同一个大模型通过提示链(prompt chaining,就是把一个复杂任务拆成一连串简单提示,逐步完成)加上智能体验证(agent-based verification,每个步骤的输出都由另一个智能体检查,不合格就重试)来实现的,各环节之间传递结构化数据,尽量减少模糊性 [1]。

为了评估生成质量,研究者设计了一个8项二元评分量表(每一项只答”是”或”否”),用13道已经在课堂上用了3年的微积分基础牛顿力学选择题做测试,一共跑了20次试验,其中1次完全失败(没生成LaTeX代码),剩下19次成功生成了247道题 [1]。

结果确实亮眼:

甚至,整套系统的公开网站是跑在一块信用卡大小的树莓派单板计算机上的——你没看错,就是那种几百块钱的微型电脑,通过Cloudflare对外提供服务 [1]。这说明AI教育应用的部署门槛,已经低到了一个相当惊人的程度。

看起来很美:三个藏在高分背后的硬瓶颈

但是,89%这个数字背后,藏着三个非常关键的问题。它们不是”小瑕疵”,而是直接关系到题目教学价值的硬瓶颈。

第一个瓶颈,也是最严重的一个:干扰项逻辑留不住。系统整体只有59%的生成题保留了原选择题错误选项(也就是干扰项)的逻辑结构,数值情境题里更是只有47% [1]。你可能觉得,错误选项错了不就行了?其实不然。好的干扰项都是精心设计的,专门针对学生最容易犯的典型错误——比如把加速度和速度搞混、把质量和重量搞混。学生选错了,老师能立刻知道他哪个概念没掌握。如果干扰项只是随便凑的错误答案,那这道题的诊断价值就大打折扣了。

第二个瓶颈:抽象题不会换场景。对于像”物体位移函数为x(t)=…”这种抽象表述的题目,系统几乎只会改数字,换场景的成功率只有5% [1]。说白了,AI很难把一个抽象的物理表述,翻译成一个有意义的具体故事——比如把”质点的运动方程”换成”电梯的上升过程”。而概念题的”可直接解答”率(76%)也明显低于抽象数值题(100%)和数值情境题(92%)[1],说明越是考概念、越是需要语境的题,AI越容易出问题。

第三个瓶颈:偶尔完全翻车。20次试验里就有1次彻底失败,连LaTeX代码都没生成出来 [1]。11%的题目达不到”直接可用”的标准 [1]。对于课堂教学来说,这个故障率其实不算低——你总不能每次布置作业前,自己先把所有题都做一遍吧?

还有一个容易被忽略的问题:这项评估是由两位论文作者自己做的,既没有独立第三方评审,也没有让学生实际做过这些题来检验真实效果 [1]。会不会有”自己出的题自己觉得好”的偏差?目前还不好说。而且测试集只有13道题,全是牛顿力学选择题,样本量不大、题型也单一,结论能不能推广到电磁学、量子力学,或者计算题、简答题,都是未知数 [1]。

从「能做对」到「能教学」:AI出题的效度门槛

如果把时间往回拨两年,你会发现AI在物理教育里的角色,进化得相当快。

2024年初的一项研究还在测”AI会不会做物理题”:用GPT-3.5做1337道从GCSE到大学水平的物理考题,最好的提示词策略下平均得分才59.9%,大学级别更是只有37.4% [5]。那时候大家讨论的还是”AI能不能当学生的助教”。

才过了大半年,关注点就变成了”怎么让AI出好题”。同样是2024年,有人提出了基于布鲁姆分类学的BPE提示框架(Bloom’s Physics Exercises),用来控制题目的难度和认知深度 [7];也有人总结了教师用ChatGPT生成物理题的两种工作流 [6]。但这些本质上还是”人指挥AI干活”,AI只是工具。

到了2026年的这项多智能体系统研究,AI已经开始能独立产出”89%可用”的题目了 [1]。但这里有一个根本问题还没回答:一道题”能做对”,不等于”能用来教”。

2026年发表在 Educational Psychology Review 上的一篇综述提出,把AI当作教育中的认知模型,不能只看结果对不对,得有一套明确的效度标准(validity criteria)——比如构念效度(它测的是不是它声称要测的那个概念)、机制透明度(它为什么这么出题,能不能说清楚)、和人类学习轨迹的对齐程度(它出的题是不是符合学生的认知发展规律)[2]。

用这个标准回头看AI出题:现在的系统能保证”物理概念没错”,但保证不了”干扰项针对典型误区”——后者才是教学意义上的核心。系统能”换场景”,但换的场景是不是符合学生的生活经验、会不会引入额外的认知负担,这些都还没验证。换句话说,AI出的题目前还停留在”技术上正确”的层面,离”教学上有效”还有一段距离。

下一步:AI出题离走进课堂还有哪些关要过

那么,AI出题要真正走进课堂,还得迈过哪几道坎?至少有三个层面的问题。

第一个层面是技术可靠性。89%的可用率听起来不错,但对于教学场景来说,11%的故障率还是太高了。老师如果每次用都得自己先审一遍、做一遍,那节省的时间就有限了。怎么把可靠性提到接近100%?是靠更多的智能体验证环节,还是靠专门的物理知识校验模块?这都是未来要解决的问题 [1]。而且现在的系统只在牛顿力学选择题上验证过,拓展到其他物理分支、其他题型(比如计算题、开放题)、其他学科,都会遇到新的挑战 [1]。

第二个层面是教学适配性。出题不是为了”有题可做”,而是为了实现特定的教学目标。2026年一项关于AI经济学导师的研究提出,系统提示词设计正在成为大学教师的一种新的教学设计能力——你得懂教学原则(比如主动学习、认知负荷管理、形成性反馈、成长型思维),才能把AI调教成符合课程目标的教学工具,而不是一个只会给答案的答题机器 [3]。AI出题也是一样:生成同构题只是第一步,怎么根据学生的错误模式动态调整题目难度、怎么把题目嵌入整个课程的学习路径里,这些都需要教学法层面的设计。

第三个层面是师生角色的转变。AI出题普及之后,老师的工作不会消失,但会变。就像计算器普及之后,数学老师不再教学生手算开平方,但要教学生什么时候该用计算器、怎么判断结果对不对。未来的物理老师,可能要花更多时间在”设计题目序列""诊断学生误区”上,而不是亲手编每一道题。甚至学生的学习方式也会变:2026年的一项研究发现,学生用关系型语气和追问的方式跟AI导师互动,比用中立、被动的提问方式,能获得更深的批判性思维 [4]。会不会用AI、怎么跟AI对话,本身可能会成为一种学习能力。

如果你只记住一件事

AI出物理题已经做到了”八九成能用”,但离”真正好用的教学材料”还差关键几步——核心不是物理对不对,而是教学效度够不够。


参考文献

  1. Reliable isomorphic physics problem generation with large language models(arXiv、2026、全文精读)
  2. When Can AI Models Explain Learning? Validity Criteria for AI as Cognitive Models in Education(EDUCATIONAL PSYCHOLOGY REVIEW、2026、仅摘要)
  3. When the Professor Writes the Prompt: Designing an AI Tutor for Introduction to Microeconomics in Distance Higher Education(SSRN、2026、仅摘要)
  4. Talking to Machines: How Communication Style Shapes Student Engagement with AI Tutors(SSRN、2026、仅摘要)
  5. The impact of AI in physics education: a comprehensive review from GCSE to university levels(Physics Education、2024、仅摘要)
  6. Streamlining Physics Problem Generation to Support Physics Teachers in Using Generative Artificial Intelligence(The Physics Teacher、2024、仅摘要)
  7. BPE: Exploring the Prompt Framework of Physics Exercises Generated from Bloom s Taxonomy in LLM(2024、仅摘要)