Chunlin 的论文科普

当AI能自己登录网课交作业:我们的成绩还有效吗?

想象一下:老师在Moodle上布置的测验和反思作业,AI只需要一句指令就能自己登账号、读课件、答题拿满分,甚至编出感人的个人故事骗过讨论板——这不是科幻,是2025年真实发生在本科课堂里的研究演示。

从「学生用AI作弊」到「AI自己当学生」

过去我们讨论AI和教育的关系,默认的场景是”学生拿着AI工具写作业”:人在电脑前,把题目复制给AI,再把答案粘回去,本质上还是人在主导流程。但最新的研究显示,这个边界已经被彻底打破了。

2025年到2026年间,研究人员在一门真实的本科心理学课程(Moodle平台)上做了三次演示,主角是自主AI智能体(autonomous AI agent)——也就是能自己设定目标、规划步骤、操作软件完成任务的AI系统,不需要人类一步步发指令。第一次演示用Claude for Chrome浏览器扩展,只给了一条总指令,AI就自己完成了10道开卷测验题,耗时约12分钟,全程没有人工干预 [1]。第二次演示用Perplexity Comet代理,同样的10道题,它走了52个操作步骤,耗时不到5分钟,得分10/10 [1]。

更有冲击力的是主观作业。第三次演示里,AI代理接到讨论板的反思任务——“分享一次让你惊讶的对话”,它先读了其他同学的帖子,抓住”代际隔阂""分歧中的尊严”这类主题,当场编出一个完整故事:祖父开车四十年,接送家人上班、化疗,现在因为年纪大要被收走车钥匙,祖孙俩为此发生了一场复杂的对话。AI以第一人称写出情真意切的反思帖,还顺着这个虚构身份回复了两条同学评论,完全看不出是假的 [1]。

当然,实际情况比这个比喻更复杂:这些演示是在特定课程、特定任务下完成的,不代表所有科目、所有作业都能被如此轻易地攻破。但它至少证明了一件事:AI已经从”学生手里的工具”,变成了”可以自己当学生的角色”。

为什么这不是作弊问题,而是成绩本身失效了?

很多人听到这件事的第一反应是:“那学校抓作弊不就行了?“但这篇核心论文的真正分量,在于它指出:问题根本不是作弊,而是成绩的有效性从根上塌了。

要理解这一点,得先说说Kane基于论证的效度框架(Kane’s argument-based validity framework)——这是教育测量领域一个经典的分析工具,它把”成绩代表能力”这件事拆成一条环环相扣的推理链:从”学生做了这份作业”,到”作业分数反映了学生的掌握程度”,再到”课程成绩能证明学生达到了培养目标”,最后到”专业认证认可学校的培养质量”。每一环都有前提,前一环塌了,后面所有环节都站不住 [1]。

AI智能体端到端完成作业,破坏的是这条推理链最开头的那一环:归因——也就是”这份作业是这个学生做的”这个基本假设。论文里打了个很贴切的比方:如果考场里分不清谁是替考,那么就算抓住了几个替考者,剩下的所有成绩也照样不作数,因为你没有理由相信任何一个分数真的对应了考生本人的能力 [1]。

这就是”效度问题”和”诚信问题”的本质区别:诚信问题只针对个别违规学生,你处罚了违规者,剩下的成绩依然可信;但效度问题是系统级的——只要评估设计本身区分不出人和AI,那么所有成绩(包括诚实学生的成绩)的可信度都会一起打折扣 [1]。

更麻烦的是,这个问题不止影响单门课的分数。推理链的下游连着专业培养方案评估、学科认证、甚至整个高等教育质量体系的证据基础。如果课程成绩的归因前提不成立,那么建立在这些成绩之上的所有质量报告,根基都在松动 [1]。

AI智能体在教育里的两面:从辅助工具到评估挑战者

有意思的是,AI智能体本身并不是教育的敌人。就在同一时期,教育领域正在积极探索用智能体提升教学效率,它的”正面身份”和”挑战者身份”几乎同时出现。

在教师端,智能体已经被用来辅助教案设计。比如针对学前STEM教育,有研究提出了基于**检索增强生成(Retrieval-Augmented Generation,RAG,即让AI先从知识库调取权威资料再生成内容的技术)**和多智能体协作的框架:不同角色的AI模型互相交叉检查内容,所有生成都锚定在一个经过专家审核的知识库上,以此减少事实错误、避免出现不适合儿童的语言或不安全的活动建议 [2]。这个框架还和TPACK(整合技术的学科教学知识)教师专业发展模式结合,让AI成为教师备课的辅助架构,而不是替代者 [2]。

在学生端,智能体驱动的自适应学习系统也展现出明显效果。一项针对职业英语培训的16周准实验研究发现,集成了学习者建模、内容适配、自主进度调节和强化学习排序的AI自适应平台,在整体语言熟练度上比非自适应在线学习和教师授课模式都有统计上显著的大幅优势,同时还降低了教师在作业批改、进度监控等日常事务上的工作量 [3]。

甚至在高等教育的整体流程里,代理式AI也被定位为一种”支持架构”:它可以帮着设计学习活动、给学生提供支持、辅助科研、整理证据、生成反馈,前提是它不取代人类智慧、不取代学生的作者身份、不取代教师的责任 [5]。

但硬币的另一面是,同样的技术能力,换一个使用场景,就成了评估体系的挑战者。智能体越擅长自主完成复杂任务,它”扮演学生”的能力就越强。这不是哪一方的错,而是技术本身的中性——它能帮老师干活,自然也能帮学生(或者替学生)干活。

从规则系统到LLM智能体:教育AI评估走了多远?

AI智能体进入教育评估领域,其实不是突然发生的。对多智能体系统(Multi-Agent Systems,MAS,即多个AI代理分工协作完成任务的系统)在教育评估中应用的系统综述显示,这个领域已经走过了两代演进 [4]。

早期的教育评估多智能体系统,是基于规则的架构:每个代理有固定的职责和预设的行为逻辑,能处理一些标准化的评估任务,比如自动批改客观题、跟踪学习进度。这一代系统的好处是稳定、可控,但灵活性很差,稍微超出预设场景就无法工作 [4]。

随着大语言模型的兴起,第二代系统变成了LLM集成的生态系统:代理不再只靠预设规则,而是能理解自然语言、自主规划步骤、处理开放式任务。它的主要应用场景是个性化形成性评估,也就是在学习过程中给学生提供及时的、适配个人水平的反馈,而不只是期末给个分数 [4]。

但这篇综述也明确指出了目前的瓶颈:可扩展性、可解释性、数据隐私、算法偏见、幻觉问题,这些都阻碍着多智能体系统在教育评估中的大规模落地。而且综述的结论很清醒:多智能体系统最好的定位是增强人类教育工作者的能力,而不是取代他们 [4]。

从这个坐标看,AI智能体能自己完成LMS(学习管理系统,即承载课程、作业、测验的在线教学平台)考核这件事,既是技术演进的自然结果——当代理的自主能力足够强,它自然能从”帮老师评估学生”延伸到”替学生应付评估”——也再次印证了那个核心判断:技术是工具,怎么用、怎么应对,最终还是人的事。

怎么办:从「检测AI」到「设计验证人类在场」

既然技术检测追不上AI的进化速度,那出路在哪里?这篇核心论文给出的方向是:放弃”检测AI”的思路,转向从设计上验证人类在场(verified human presence)——也就是把评估设计成”只有真人才能完成”的样子,而不是事后去猜这份作业是不是AI写的 [1]。

论文提出了四项设计原则(具体方向,而非现成技术方案),核心都是让评估过程和学生本人的真实经历、实时思考绑定 [1]。而另一项关于语音AI口试的研究,刚好给这个方向提供了一个可落地的样本。

传统口试本来是验证人类能力最可靠的方式——它要求实时推理,没法外包给AI——但口试最大的问题是没法大规模开展,太费老师时间。而语音AI和多智能体架构正在改变这一点:有研究用一套多智能体系统给本科AI/ML课程做了36场口试,总成本只有15美元,平均每个学生0.42美元,成本低到可以给每次作业都加一个口头理解检查,而不是只在期末考试用 [6]。

这套系统的工作方式是:LLM根据评分标准动态生成问题,所以整个考试结构都可以提前公开,学生练习的过程就是学习的过程,不存在”泄题”的问题;评分环节由三个不同模型家族的LLM组成评审委员会,先各自打分,再看了同行的评分理由后修订自己的分数,最终评分者间信度(Krippendorff α = 0.86)达到了常规教学评估的可接受阈值 [6]。

当然,这个系统也出了不少有启发性的故障:比如代理不顾明确禁止还是把问题堆在一起问,没法随机选择案例,还有一些提示词约束完全失效的情况 [6]。这也印证了一个道理:没有任何单一方案是完美的。

回到核心论文的立场,它也坦诚自己的局限:目前的演示案例还很少,学生实际使用代理的流行率还不清楚,任何单一设计保障都有漏洞,只能通过多层设计叠加把剩余风险降到可接受水平 [1]。至于怎么在不增加教师过重负担的前提下大规模实现”验证人类在场”,有哪些具体的教学设计老师可以马上采用,认证机构又会怎么更新指导标准——这些都还是开放问题 [1]。

如果你只记住一件事

AI智能体能自己登录网课、完成作业,带来的真正挑战不是”又多了一种作弊手段”,而是我们用了几十年的”交作业→打分→给成绩”这套评估逻辑,最底层的”作业是学生本人做的”这个前提,已经在技术上被动摇了。


参考文献

  1. AI Agents Can Now Navigate and Complete LMS Tasks: A Call for Pedagogical Innovation(Intersection A Journal at the Intersection of Assessment and Learning、2026、全文精读)
  2. Enhancing Teacher Professional Development for Preschool and Early STEM Education Through RAG and a Knowledge-Grounded Agentic System(Advances in computational intelligence and robotics book series、2026、仅摘要)
  3. A mixed-methods evaluation of an AI-powered adaptive learning system for professional english training(Scientific Reports、2026、仅摘要)
  4. Multi-Agent Systems for Learning Assessment in Education: A Comprehensive Survey(2025、仅摘要)
  5. Inteligencia artificial agéntica en educación superior: una investigación sobre aplicaciones, protocolos y trazabilidad académica(2026、仅摘要)
  6. Scalable and Personalized Oral Assessments Using Voice AI(ArXiv.org、2026、仅摘要)