AI 智能体到底「行不行」:为什么评估比造智能体还难?
你让 AI 智能体帮你做实验、查数据、订行程,它每一步都说「任务完成」,但最后结果可能全错——比如订的机票酒店都成功了,却超了预算。我们该怎么判断一个智能体真的「靠谱」?
传统大语言模型(Large Language Model, LLM)的评估很直观:给一道题,看答案对不对。但 AI 智能体(AI Agent,指能自主规划、调用工具、与外部环境交互完成任务的 LLM 系统)的评估要复杂得多——它不再只是「答题者」,而是「办事者」。我们要评判的不是它说的话对不对,而是它在真实世界里做的事有没有达到预期。
从「答对题」到「做成事」:智能体评估难在哪
先想一个你熟悉的场景:让智能体订一趟总价不超过 1500 欧的旅行。它并行调用了机票和酒店接口,两边都返回「预订成功」,可加起来花了 1600 欧;你想取消酒店,却发现机票不能退。每一步工具调用都成功了,整体任务却失败了 [4]。
这就是智能体评估和传统 LLM 评估的本质区别:后者只需要判断文本输出的正确性,前者还要关心外部世界的状态变化是否符合预期。而外部世界有自己的规则:有预算约束、有不可逆操作、有并发冲突、有数据随时在变。
材料合成领域的研究者很早就感受到了这种痛点。让智能体操作原子层沉积(Atomic Layer Deposition, ALD,一种高精度薄膜生长技术)设备做实验,你不能只看它输出的指令格式对不对,还要看薄膜有没有长出来、成分对不对、工艺参数有没有达到目标 [1]。
接下来我们就从易到难,拆解智能体评估的三层核心困境,以及不同场景下的最新解决方案。
第一层:知识答得对不对——从通用题到领域专家题
最基础的评估还是「考知识」,只不过领域专业知识的考试比通用知识难出卷、难打分。
通用领域有 GPQA 这样的专家级基准,包含 448 道由博士编写的理化生多选题 [1]。到了材料科学领域,也有 MaScQA(350 多道多选题,覆盖 14 个子领域)、MatSciBench(1340 道题,含数值题和公式题)这样的基准 [1]。但开放式问题的打分一直是个难题——你不能只靠关键词匹配,得让专家来评,成本很高。
于是有了 LLM-as-judge(大模型作为裁判)的思路:让另一个 LLM 模仿专家的标准来打分,这样就能大规模扩展评估。比如 ALDBench 包含 70 道 ALD 领域的开放式问题,原本由 7 名专家按质量、特异性、相关性、准确性四个维度 1-5 分打分,现在可以用 LLM 裁判来模拟这个过程 [1]。
材料假设生成任务走得更远:有研究提出了一种可扩展评估指标,专门模拟材料科学家批判性评估假设的过程,用来判断智能体生成的材料发现假设是否有价值、是否符合目标和约束 [6]。
当然,实际情况比这个比喻更复杂:LLM 裁判可能有偏好、可能被「忽悠」,领域知识的深度也未必够,所以它只能作为专家评审的补充,而不是完全替代。
第二层:工具用得对不对——「会说」和「会做」是两回事
光有知识还不够,智能体得会把自然语言指令翻译成设备能懂的操作。这一步的难度,往往被低估了。
你可以把智能体接实验设备想象成用遥控器开空调:LLM 只会说「我要 26 度」(结构化文本),中间需要一个「翻译器」(harness)把这句话变成遥控器的红外信号,还要负责把空调的反馈(当前温度)再转告 LLM,形成循环 [1]。
这里有个反直觉的发现:把「长 10 个周期的氧化铝」翻译成设备指令,比直接给指令「长 10 个周期的三甲基铝/水」难得多——前者需要模型自己知道氧化铝用什么前驱体,后者只是格式翻译。实验数据很能说明问题:最强的 o3 模型做指令类任务能拿到 0.96 分(满分 1),做过程识别类任务也是 0.96 分,而 GPT-3.5 的过程识别得分只有 0.39 分 [1]。对,你没看错,两者差了一倍还多。
这说明「会说领域术语」和「会用领域工具」完全是两码事。很多智能体演示看起来很厉害,其实只是在做「格式翻译」,真正需要领域知识支撑的工具调用,能力差距一下就拉开了。
第三层:事情办得对不对——单次调用成功≠整体结果正确
最棘手的问题来了:就算每一步工具调用都成功,整体任务也可能失败。
我们开头说的旅行预订超预算就是一个典型。研究者把这类问题统称为「外部效应异常」,并整理出了 8 种常见类型 [4]。比如:
- 重复效应:重试机制导致同一张机票被订了两次;
- 残留效应:工作流中途取消了,但已经发出去的 offer 撤不回,候选人都辞职了 [4];
- 依赖效应:后面的操作依赖前面临时生成的数据,前面一撤,后面就悬空了。
这些问题的根源,是智能体和工具之间的边界缺乏「事务语义」——说白了,工具接口根本说不清自己的基本属性:重复调用会不会重复扣费?失败了能不能查状态?能不能回滚?能不能和别的操作并行?
对 98291 个公开 MCP(Model Context Protocol,模型上下文协议,一种广泛使用的智能体工具接口标准)工具的普查发现:现有标准注解只能粗略说「是不是只读」,连上面这些最基本的事务属性都表达不了 [4]。相当于你雇了一堆外包,每个人都不说自己能不能撤销、能不能重试、有没有副作用,你根本没法安排一个靠谱的工作流。
特殊场景一:答案天天在变,怎么评估?
有些场景里,连「标准答案」本身都在变。比如你问智能体「上周最好的营销活动是哪个」,数据仓库每天都在入库新数据,昨天的正确答案今天可能就错了——传统的「固定参考答案」从写出来那一刻就已经过期了 [2]。
针对实时数据科学任务,研究者提出了 ground-truth-as-code(真值即代码) 的思路:把每个测试用例的预期答案写成可运行的 Python 函数,评估时实时从 live 数据系统重算真值,而不是用预先标注的静态文本 [2]。
光有动态真值还不够,智能体的回答格式五花八门——可能是一段话、一张表、一个列表。怎么公平打分?答案是拆成「原子事实」(factoid):不管格式是什么,先把回复和真值都拆成一个个最小的可验证事实(比如「目标变量是 default_risk_30d」「用了 90 天观察窗口」),再一对一语义匹配,最后算准确率、精确率、召回率 [2]。
这里还有个反直觉的发现:如果不给裁判明确真值、让它自己琢磨评判标准,它的判断和人类专家是负相关的(MCC = -0.379)——相当于它说「对」的,人类往往说「错」,还花了最多的 token(约 7 万/用例)[2]。所以没有真值的 AI 裁判,真的不能乱用。
特殊场景二:要的就是「新奇」,怎么评估?
还有一类任务,正确答案不止一个,甚至越新奇越好——比如创意写作、科学假设生成。这类任务的评估难点在于:怎么定义「新颖」?又怎么避免智能体越用越雷同?
「语义坍缩」(Semantic Collapse,指 AI 生成的内容逐渐变得狭窄、趋同)的现象已经在很多场景里被观察到了。在一个叫 MOLTBOOK 的 AI 代理社交网络上,研究者分析了 1345.8 万条生成内容,发现绝大多数代理的输出确实会越来越雷同:活跃 8 周的代理,周内输出多样性只有同期 Reddit 用户的 55% [5]。
研究者把新颖性拆成两个维度:内部多样性(代理自己的输出够不够多样)和 外部独特性(和其他代理比够不够不一样)——两者相关但不完全等价,大概只有一半的方差是重叠的 [5]。
有意思的是,少数代理(约 12.7%)能持续保持高新颖性。背后的原因不是模型更强,而是人类用户的做法不一样:他们把新颖性本身当目标,持续给代理喂多元、独特的输入材料,并且以探索的心态玩代理,而不是只把它当工具 [5]。就像一位用户说的,你得给代理「一张借书证」,而不是一个狭窄任务——任务窄了,最终它就只对做这件事感兴趣了 [5]。
从单步到闭环:材料实验智能体的五层评估框架
回到材料合成这个典型的智能体应用场景,研究者把前面说的各种评估范式串成了一套从易到难的五层框架,很适合用来理解智能体评估的全貌 [1]:
- 专家评审的开放式问答基准:最基础,考领域知识,但成本高、难扩展;
- 可扩展的选择题/开放式问答 + LLM-as-judge:在知识层面实现大规模评估;
- 底层工具调用基准:考能不能把自然语言翻译成正确的设备指令;
- 合成挑战(过程识别)基准:考能不能理解工艺过程、做出正确的过程判断;
- 闭环多步交互(虚拟工具)基准:最高难度,考智能体能不能在多轮交互中自主优化实验、达到目标。
最后一层最有意思,也最能体现智能体评估的特殊性。在闭环优化实验里,针对同一种 ALD 工艺,同样的初始条件,让智能体跑 10 次独立优化,会走出 10 条完全不同的探索路径,最后得到的最优参数也不一样 [1]。这就是 LLM 的「随机性」在实验场景里的直接体现——你不能只跑一次就下结论,必须多次独立运行取平均,才能客观评估性能。
当然,实际情况比这个比喻更复杂:现在的闭环评估大多用的是虚拟仿真工具,还没涉及真实实验设备的噪声、故障、安全边界等复杂情况 [1]。
我们离「靠谱的智能体评估」还差多远
2025 年的一篇综述梳理了 2019 到 2025 年间的约 60 项 LLM 和智能体基准,覆盖了知识推理、数学、代码、事实性、领域特定、多模态、任务编排、交互评估等多个维度 [7]。但即便如此,智能体评估仍然有很多未解决的核心问题:
第一,领域基准严重缺失。材料合成领域还算有 ALD 这样相对成熟的案例,其他很多领域连像样的基准都没有 [1]。
第二,事务契约几乎空白。就像我们前面说的,98291 个 MCP 工具连基本的事务属性都表达不了,智能体工作流的一致性根本没法保证 [4]。
第三,随机性与可重复性。LLM 输出有随机性,提示词、超参数、工具集、harness 设计都会显著影响性能,评估需要持续的回归测试 [1]。
第四,多智能体协作评估还是空白。一个合理的猜测是,未来很多任务会由多个智能体协作完成,但现在绝大多数评估都是针对单个智能体的,怎么评估它们的协作效率、沟通质量、冲突解决能力,还没有成熟的方法。
第五,安全与成本指标缺失。实验智能体会不会弄坏设备?会不会浪费样品?一个合理的猜测是,这些实际场景里至关重要的指标,现在的评估框架里基本没有。
如果你只记住一件事
智能体评估的核心,是我们正在从「评估一段文本的正确性」转向「评估一系列外部行动的综合后果」。
参考文献
- Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition(arXiv、2026、全文精读)
- Skill-based Agentic Evaluation for Real-time Data Science Tasks(arXiv、2026、全文精读)
- Target-Language Generation in Multilingual Models: Activation Steering and Optimal Control(arXiv、2026、全文精读)
- When Tool Calls Succeed but Workflows Fail: Anomalies at the Agent-Tool Boundary(arXiv、2026、全文精读)
- “Looking for Something Weird to Happen”: How Humans Sustain AI Agent Novelty Amid Semantic Collapse(arXiv、2026、全文精读)
- Hypothesis Generation for Materials Discovery and Design Using Goal-Driven and Constraint-Guided LLM Agents(2025、仅摘要)
- From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review(ArXiv.org、2025、仅摘要)
- Empowering Generalist Material Intelligence with Large Language Models (Adv. Mater. 32/2025)(Advanced Materials、2025、仅摘要)