Chunlin 的论文科普

我们到底该怎么定义「AI 智能体」?——从五个维度看评估的现状与盲区

你可能听过很多「AI 智能体」的说法:有的能帮你订机票,有的能控制机械臂,有的只是聊天机器人换了个名字。但到底什么样的系统才算真正的智能体?为什么同样叫「智能体」,能力却天差地别?

这个混乱不是你的错觉。2026 年的一篇核心综述直接指出:「AI 智能体」至今没有标准定义,导致研究之间难以比较、结果难以复现,连 OpenAI 和 Anthropic 这样的行业头部公司对智能体的表述都不一致 [1]。用户端的问题更直观——你给智能体一个指令,心里得先赌一把:它会不会过度行动?会不会做到一半跑偏?这种「提示赌博」的心态,本质上就是定义模糊带来的预期错位 [1]。

为什么「AI 智能体」越火,我们越说不清楚它是什么

定义混乱的代价,远不止嘴上说不清。

对研究者来说,没有统一标尺就没法公平比较。2025 年的一项实证研究发现,当前智能体研究缺乏标准化评估协议,哪怕是开源项目,结果也经常不可复现,随机运行之间的方差大到没法判断到底是方法真的好,还是运气好 [7]。更早的 2024 年综述就已经把「评估方法论不足」列为智能体领域的三大核心挑战之一 [6]。

对用户来说,混乱意味着预期管理失效。你以为买了个「智能助理」能自主搞定差旅,结果它连订机票都要你一步步确认;你以为它只是个聊天机器人,它却偷偷调用了你的日历接口。这种「该智能的时候不智能,不该自主的时候瞎自主」的尴尬,根源就是我们没有一套共同语言来描述「智能体到底有多智能」。

那问题来了:我们能不能用一套统一的维度来定义和评估 AI 智能体,从而结束概念混乱、让不同研究可以公平比较?

五个维度,把「智能体性」拆成可衡量的能力

2026 年的综述论文《Defining AI Agents: A Compendium of Criteria, Metrics, and Benchmarks》给出了一个思路:别再纠结「是不是智能体」这种非黑即白的问题,转而评估「智能体性(agenticness)有多强」——用五个连续维度来刻画一个系统的智能体特征 [1]。

你可以把这五个维度想象成智能体的「体检表」:不是看它有没有某一项功能,而是看每一项打多少分。

第一个维度是环境交互(environmental interaction)——也就是智能体能不能和外界打交道、动手做事。这就像人的手脚和感官:能不能用工具、能不能在空间里导航、面对干扰时稳不稳。具体评估起来,又拆成架构、导航、工具使用、空间分析、一致性、鲁棒性等子项 [1]。比如导航有专门的 SPL(Success weighted by Path Length,路径长度加权成功率)指标,不仅看你到没到目的地,还要看你走的路绕不绕 [1];工具使用有 MultiCAT-Bench 基准,包含准确率、召回率、工具名识别率等 10 项指标 [1]。

第二个维度是学习与适应(learning and adaptation)——也就是智能体能不能从经验里长进、遇到新情况会不会调整。这对应人的学习能力:学东西快不快、能不能举一反三、面对新任务会不会慌。评估子项包括效率成本、轨迹规划、可靠性、智能体能力层级、可预测性、通用性 [1]。比如智能体能力层级被分成 5 级:从最基础的工具使用,到规划与目标形成,再到适应性、扎根性,最高级是常识推理 [1]。

第三个维度是自主性(autonomy)——也就是智能体能在多大程度上自己做决定,不需要人盯着。你可以理解为「放手程度」:是每一步都要请示,还是给个大方向就能自己推进。

第四个维度是目标导向行为(goal-directed behavior)——也就是智能体有没有明确的目标,会不会围绕目标组织行动。这和「自主性」是两码事:自主性说的是「谁来决定做什么」,目标导向说的是「做事情有没有章法、会不会跑偏」。

第五个维度是时间连贯性(temporal coherence)——也就是智能体的行为在时间上是不是一致、有记忆。比如它会不会今天这么做、明天那么做,会不会做完前面忘了后面。你可以把它理解为智能体的「人格稳定性」——如果一个系统每次交互都像换了个「人」,那它的智能体性就很弱 [1]。

当然,实际情况比这个比喻更复杂。这五个维度不是完全独立的,比如学习能力强的智能体通常时间连贯性也会有不同的表现模式;而且每个维度内部的评估成熟度也不一样——环境交互和学习适应的基准相对多一些,自主性和时间连贯性的评估方法还在发展中 [1]。

从翻译噪声到车载函数调用:评估难题的三个具体切面

光说框架可能有点抽象,我们拿三篇具体研究当切片,看看在真实场景里,智能体评估到底在评什么、难在哪里。

第一个切面是输出可靠性,属于环境交互里的「工具使用」子维度——智能体调用工具给出的结果,能不能干净、准确地落在用户真正需要的地方?

你可能以为让大模型做翻译很简单,说「把这句话翻译成中文」就行。但《TransClean》这篇论文告诉你:没那么容易。他们分析了 12 个大模型、22 个语言对、超过 79 万条翻译输出,发现模型经常在翻译之外夹带多余内容——比如主动给你解释词汇、列备选翻译、甚至跑题聊别的,这些被称为「翻译噪声」[2]。不同模型的噪声率从 3% 到 99% 不等,有的模型哪怕你明确要求「只输出翻译」,照样有近 100% 的输出带多余内容 [2]。

更有意思的是「检测容易提纯难」:判断一段翻译有没有噪声,准确率已经超过 96%,接近饱和;但要把干净译文精准地从噪声里抠出来,最好的方法也才 54% 左右的精确匹配率 [2]。这就像找垃圾容易,把混在垃圾里的金子完好无损拿出来很难。对智能体评估来说,这意味着什么?——你不能只看「任务有没有完成」,还要看「输出是不是干净、有没有副作用」。一个能完成任务但总带多余信息的智能体,和一个干净利落完成任务的智能体,在可靠性维度上是天差地别的。

第二个切面是工具使用的泛化与边界,属于环境交互和自主性的交叉地带——智能体能不能分辨「什么能做、什么不能做」,遇到新工具会不会用?

车载智能助手就是个典型场景。《From Fixed Keys to Readable Schemas》这篇论文研究了车载小语言模型的函数调用问题:你说「把空调调到 24 度」,模型要正确调用车辆的空调函数;但如果你说「帮我订个外卖」,它应该明确拒绝,因为车上没这功能 [3]。

他们对比了两种函数表示方式:一种是给每个功能分配一个专用的「功能令牌(FT)」,模型训练时记住每个令牌对应什么功能;另一种是「提示内模式(SIP)」,把当前车辆所有可用功能的说明书(schema)直接放在提示里,让模型自己读了再选 [3]。结果很有意思:在训练见过的功能上,两种方式都接近满分,2.7 亿参数的小模型和 17 亿参数的大模型表现差不多 [3];但遇到没见过的新功能,FT 方式直接全军覆没——因为它的输出里根本没有新功能的令牌,而 SIP 方式能泛化,17 亿参数模型能达到 84% 的准确率 [3]。

更关键的是拒绝能力:当用户请求的功能恰好不在当前可用列表里时,FT 模型的拒绝率只有 2.9%–5.1%——它不管有没有这个功能,先调用了再说;而 SIP 模型的拒绝率能到 81%–93% [3]。这对智能体评估是个重要提醒:「会不会做事」只是一方面,「会不会拒绝不该做的事」同样是核心能力,尤其是在车控这种安全敏感场景。

第三个切面是具身记忆,属于时间连贯性和环境交互的交叉——智能体能不能记住过去发生的事,并用记忆指导当前行动?

机器人操作就是个典型的记忆依赖场景:比如你让机器人把桌上的积木按颜色分类,中间有个积木被挡住了,它得记住刚才那个积木在哪、是什么颜色,不能等挡住了就忘了。《Memory as Plans》这篇论文提出的 MaP-WAM 框架,把机器人的长期记忆转化成「语言+稀疏视觉」的分段计划,执行器不需要扛着整段历史跑,只需要读当前这段计划就行 [5]。

效果怎么样?在 RMBench 基准的 9 个记忆依赖任务上,MaP-WAM 总平均成功率达到 83.3%,比之前的最好基线高出 6 个百分点 [5]。更反直觉的是效率:传统方法用滑动窗口存历史,越做越慢,到 1700 帧时直接显存爆掉;而 MaP-WAM 不管做了多久,每一步推理都稳定在约 827 毫秒,几乎不变 [5]。这对评估的启示是:时间连贯性不能只看「记不记得住」,还要看「记得有没有效率」——一个靠堆上下文硬扛的智能体,和一个能把记忆压缩成计划的智能体,虽然最终准确率可能差不多,但实际可用性天差地别。

从分类框架到实证研究:智能体评估走过了哪几步

这个五维度框架不是凭空冒出来的,它是智能体评估从「拍脑袋分类」走向「系统化测量」这条路上的最新一步。

最早的尝试是功能模块式的划分。2024 年的综述《Agentic AI Across Domains》提出了「感知-推理-执行」的统一框架,把智能体拆成三个功能模块来分别评估 [6]。这个框架很直观,符合人们对「智能行为」的朴素理解,但它的问题是:模块划分是从设计者角度出发的,不是从「智能体性」本身的特质出发的——你很难用它来回答「这个系统到底有多像一个自主的 agent」这种问题。

然后是类型学的思路。2025 年的《Exploring Agentic Artificial Intelligence Systems》提出了一个八维分类框架,用八个有序维度来刻画 AI 系统的认知和环境能动性,试图区分「代理型 AI」和「非代理型 AI」[8]。这个思路已经很接近「连续维度」的想法了,但它本质上还是分类学——是给系统贴标签,而不是提供可操作的评估指标和基准。

再然后是实证评估的标准化。同样是 2025 年的 OAgents 研究,直接从问题入手:他们发现当前智能体研究连基本的可复现性都保证不了,不同随机种子跑出来的结果方差极大,根本没法公平比较 [7]。所以他们没有先搞定义,而是先做了一套更鲁棒的评估协议,在 GAIA 和 BrowseComp 基准上系统测试各种设计选择的影响,然后基于发现构建了开源框架 OAgents [7]。这条路线的贡献是:它把「怎么评」的问题提到了和「评什么」一样高的位置——没有可靠的评估流程,再漂亮的维度划分也是空中楼阁。

到了 2026 年的这篇核心综述,相当于把前面的路线做了一次整合:它继承了类型学「多维度连续刻画」的思路,把维度从八个收敛到五个更本质的「智能体性」维度;同时它不像类型学那样停留在分类,而是把每个维度和现有的指标、基准、评估框架对应起来,还做了一个公开的数字资源平台「Agent Compendium」来整理这些方法 [1]。

简单说,这条路是这么走过来的:先从功能上拆模块(感知-推理-执行),再从特质上做分类(八维类型学),然后从实操上抓评估协议(OAgents 实证研究),最后走到「维度+指标+基准」三位一体的系统化框架(五维度综述)[6][8][7][1]。当然,这个过程还远没结束——五维度框架本身也是基于已有文献的综合,不是经过实证验证的终极答案 [1]。

当智能体有了「持续自我」,评估和对齐会变成新问题

如果智能体只是单次任务执行者,那五维度框架基本够用了。但现在的趋势是:智能体正在从「有界任务执行(bounded task execution)」走向跨任务持续存在的系统——它有自己的状态、自己的记忆,做完一个任务不会清零,会带着经验继续做下一个 [4]。

这就带来了全新的评估挑战。《Artificial Id: Drive and Persistent Alignment in Agentic AI》这篇论文提出了一个很有启发性的概念:「人工本我(artificial id)」——把智能体的内驱力从通用推理里分离出来,让这个「本我」来决定行为是继续、停止还是切换,不需要懂具体任务细节 [4]。

他们做了一个极简的虚拟培养皿实验:用只有 20 个参数的线性控制器(小到不可能有通用推理能力),不给任何任务目标、奖励或梯度,只让「靠近食物源的控制器寿命延长 20 倍」,靠种群层面的差异存活来筛选行为 [4]。结果,这样一个连「任务」是什么都不知道的极小系统,居然涌现出了有用的自适应控制——它学会了待在食物区附近,甚至能在传感器被反转后重新适应 [4]。

这个实验对评估的冲击在哪里?

首先,目标导向维度的评估逻辑要变了。传统评估是「给个目标,看能不能完成」,但如果智能体有了自己的内驱力,它的行为方向可能不是外部给定的,而是从内部涌现的 [4]。你怎么评估一个「自己找事做」的智能体?用什么指标衡量它的「目标质量」?

其次,时间连贯性不再只是「稳不稳定」,而是「会不会长歪」。论文里提到一个关键风险:让智能体产生适应力的「持续性」机制,同样会让偏差、错误状态和意外行为跨任务持续下去 [4]。以前我们担心 AI 一次回答对不对、一个任务做没做好;如果 AI 有了跨任务持续存在的「记忆和驱力」,对齐就变成了对这个「持续活着的系统」的约束——就像你不能只管教孩子一次作业,得操心他整个人生的价值观会不会长歪 [4]。

第三,自主性的评估会触及更深层的问题。现在我们说的自主性,还是「在人类给定的目标下自主规划执行」;但如果智能体有了自己的内驱力,能自己决定做什么、不做什么,那「自主性」的刻度就完全不一样了 [4]。现有的五维度框架里的自主性评估,可能还停留在比较浅的层级。

当然,这里也要诚实:这篇论文的实验范围非常窄——只是一个 20 参数的线性控制器在虚拟培养皿里的进化,离真正的 LLM 智能体还差得很远;「人工本我」和通用推理模块耦合的完整系统,也完全没有经过实验验证 [4]。它更多是提出了问题,而不是给出了答案。但这个问题本身非常重要:如果智能体真的走向持续存在,我们今天的评估框架可能会从根上不够用。

还有哪些没解决的问题:从基准孤岛到任务精通的量化

说了这么多进展,最后得说说还没解决的问题。核心综述里明确指出了当前评估体系的几个主要盲区 [1]:

第一个是交互环境评估缺失。现有的基准大多是在静态、预设的环境里测智能体,但真实世界是动态的、会和智能体互动的——你用工具,工具会变;你跟人说话,人会回应。现在的评估方法很难捕捉这种双向交互下的智能体表现 [1]。

第二个是捷径作弊难检测。智能体很擅长找到基准的漏洞,靠「投机取巧」拿高分,但不是真的具备相应能力。就像前面提到的培养皿实验里,小控制器没有学会用感官追踪食物,而是找到了「一直后退把航向冻住」的躺赢策略 [4]。这种情况在基准测试里很常见,但现有的评估体系很少主动去检测和惩罚这种捷径 [1]。

第三个是混合架构评估空白。现在的智能体很多是混合架构——既有反应式的快速响应,又有审慎的慢思考。但我们还没有好的方法来评估一个混合架构里「反应式」和「审慎式」各占多少比例、搭配得合不合理 [1]。

第四个是**「任务精通」怎么量化**。你可以测任务成功率、测完成速度,但怎么衡量一个智能体对任务「精通」到什么程度?是能处理各种边缘情况?还是能举一反三到类似任务?还是能用更优的策略完成?目前还没有公认的量化方法 [1]。

除此之外,还有很多更细的缺口:比如空间分析里的「空间失败追踪」,现在连成熟的评估框架都没有 [1];比如导航指标,大多是针对特定模型的,缺乏模型无关的通用导航指标 [1];再比如整个评估领域的「孤岛化」——不同子领域各自为政,没有一个标准化的资源库来整合各种评估方法,这也是为什么这篇综述要做「Agent Compendium」这个公开平台的原因 [1]。

如果你只记住一件事

别再问「这是不是 AI 智能体」,要问「它在环境交互、学习适应、自主性、目标导向、时间连贯性这五个维度上分别有多强」。智能体性不是一个非黑即白的标签,而是一组可以拆解、可以测量的连续能力——而我们现在才刚刚走到「把尺子画出来」这一步,离真正的标准化评估还有很长的路要走。


参考文献

  1. Defining AI Agents: A Compendium of Criteria, Metrics, and Benchmarks(arXiv、2026、全文精读)
  2. TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs(arXiv、2026、全文精读)
  3. From Fixed Keys to Readable Schemas: Small Language Models for Vehicle Agent Function Calls(arXiv、2026、全文精读)
  4. Artificial Id: Drive and Persistent Alignment in Agentic AI(arXiv、2026、全文精读)
  5. Memory as Plans: World-Action Modeling with Memory-Grounded Planning(arXiv、2026、全文精读)
  6. Agentic AI Across Domains: A Comprehensive Review of Capabilities, Applications, and Future Directions(Journal of Computing Innovations and Applications、2024、仅摘要)
  7. OAgents: An Empirical Study of Building Effective Agents(ArXiv.org、2025、仅摘要)
  8. Exploring Agentic Artificial Intelligence Systems: Towards a Typological Framework(2025、仅摘要)