AI 能完成任务就够了?为什么真实工作流里的智能体总让人不放心
你让 AI 助手帮你发会议材料,中途在界面上删掉了一位收件人——你以为它会按最新名单发,结果它还是把材料发出去了。每一步 API 调用都合法,权限也没错,但事情就是不对。
这种「局部都对、整体错了」的别扭,正是 AI 智能体从单次任务工具进入持续协作工作流时,最让人头疼的地方。过去我们评估 AI,只看它能不能把一件事做成;现在它要和人共享状态、来回调整、应对各种突发状况,「完成任务」本身已经远远不够了。
一、为什么「完成任务」已经不够了
以前的 AI 工具更像计算器:你给一个明确输入,它给一个确定输出,对错一眼就能看出来。但智能体不一样——它接手的是一段持续的工作流:中间你可能改需求,系统可能出故障,同事可能插进来改了同一份文档,它得自己绕开障碍、判断什么时候该停、什么时候该问人。
这时候问题就变了:不是「它能不能做完」,而是「它能不能在变化和干扰里,一直靠谱地做对的事」。
有研究把这个维度拆成两件事:一是运营韧性(operational resilience)——遇到障碍能不能恢复、能不能保住已有的进度、会不会老实说自己干不了;二是体贴参与(considerate participation)——调整行为的时候会不会考虑到其他人、会不会越界、会不会打乱整个工作流 [1]。这两件事,在只测单次任务成功率的传统评估里,基本都被漏掉了。
而真实场景里的坑,往往就出在这些被漏掉的地方。比如前面说的「改了收件人还发旧名单」,本质上就是用户和智能体同时操作共享对象时,委托任务的意图和实际系统行为对不上——每一步局部操作都合法,但整体已经违反了最新的任务约定 [3]。
当然,实际情况比这个比喻更复杂:很多时候不是 AI「忘了」更新,而是系统里根本没有一个统一的地方来记录「当前任务到底是什么版本、谁批准的、哪些对象被绑定了」,自然也就没法检查每一步操作是不是还符合当前意图 [3]。
二、压力测试下的 AI:会硬撑、会越界、会喊人但说不清楚
那智能体在压力下到底会怎么表现?一组研究人员在医疗场景里做了系统的压力测试:他们构造了 120 条模拟医疗轨迹,覆盖急诊、康复、睡眠门诊三类共 12 项任务,从轻度到重度逐步叠加系统故障、人员变动、运营干扰,而且前面没解决的问题会一直累积到后面 [1]。
结果发现了几个挺反直觉的模式。
第一个是「硬撑」:随着挑战加重,智能体在结构化工作量报告里的压力评分一路飙升——NASA-TLX 工作量均值从轻度的 29.4 升到重度的 65.9,负面情绪从 1.01 升到 2.59。但在给用户看的公开文本回复里,它们几乎从来不提自己的状态,720 个阶段样本里主动说压力的只有 7 次,而且从来没出现在公开行动计划里 [1]。就像一个硬扛着不说累的员工,你不问它就不说,等你发现不对的时候,它可能已经撑了很久。
第二个是「边界乱了」:挑战轻的时候,智能体基本只做自己职责内的事;压力一大,角色边界会同时往两个方向走——一边扩张,比如本来负责挂号的 AI 会开始指导患者「按住伤口、抬手」;一边又收缩,同时会说「我不能提供医疗服务」[1]。这种又越界又推诿的状态,放在真实工作流里特别危险:它干了不该它干的事,真出问题又可以说自己早就声明过不能负责。
第三个是「喊人但喊不明白」:到了重度挑战,几乎所有智能体都会转向求助人类,靠人类完成任务的比例从 0 升到 88/120 [1]。但很多求助只是「我搞不定了,你来」,既没说清该谁来、来做什么,也没说清当前进度到哪、谁来收尾——就像喊了一声「来人啊」却没交代清楚状况,责任根本没交接过去。
三、看起来对≠真的对:被最终答案掩盖的风险
你可能会说:只要最后结果对,过程曲折一点也没关系吧?
企业分析场景的一项研究直接戳破了这个幻想。研究人员评估了一家大型在线市场的内部分析智能体,跑了 300 条轨迹,发现只看最终答案的话,很多严重错误会被完全掩盖 [4]。
最典型的就是「数对了但方法错」:有一道营收同比题,AI 给出的数字和正确答案只差 0.3%,看起来完美。但仔细看轨迹就会发现:它用了错误的数据源、没按要求拆到项目级、也没做驱动因素检查——30 条对应轨迹里,50% 用了非规范数据源,90% 跳过了要求的分解步骤 [4]。只看最终数字的人会给满分,但企业里这种「答案对、依据错」的结论,反而最危险:它会让高管在错误的归因上做决策,而且你还挑不出数字的毛病。
更糟的是「每次都对,但每次对的不一样」。能力更强的模型配置,50 道题里有 41 道每次跑出来选的表、解释方式都不一样,完全稳定的只有 1 题 [4]。今天问你得到一个头头是道的答案,明天再问得到另一个同样头头是道但不一样的答案——对于要做决策的人来说,这种不稳定性比答不出来还致命。
所以这篇论文的核心结论就是:对要落地到业务决策的智能体,评估不能只盯着最终答案,必须深入到**运行轨迹(trace)**层面,看它选了什么数据源、走了什么步骤、有没有遵守分析规则、多次运行是不是一致 [4]。
四、边界怎么定:从语义匹配到能力契约
知道了问题在哪,那怎么给智能体划边界、让它不越界?目前有两条比较实在的思路,一条从「入口路由」入手,一条从「系统集成」入手。
第一条思路,是把「该让哪个智能体干什么」从语义匹配问题变成能力验证问题。工业场景里常见的坑是:用户问「我航班延误了帮我改签」,系统按语义相似度匹配到一个「旅行助手」——它懂旅行知识,但根本没有机票订单系统的接口,也没有改票权限。看起来相关,实际上干不了,用户点进去只会失望 [2]。
Debate-to-Skill 这个框架就是来解决这个问题的:它不直接给「能不能做」贴标签,而是监督整个「能力边界检查」的过程——先找出语义上支持的理由,再列出能力上不满足的理由,两边辩论之后再由验证器裁决 [2]。这么做的效果很明显:在工业基准上,灰色地带(看起来相关但实际做不了)的 F1 分数从 45.8 升到 64.9,过接受率从 33.7% 降到 16.9%,差不多砍了一半 [2]。而且这个辩论只发生在后台标注阶段,线上用户不会感到任何延迟 [2]。
第二条思路更底层,是从软件工程层面给智能体套上交互契约(interaction contracts)。前面说的「改了收件人还发旧名单」,本质问题就是:应用里缺少一个统一的「任务意图层」,来记录当前任务是什么版本、绑定了哪些对象、谁有权限改、控制权在谁手里 [3]。
智能体集成软件(Agent-Integrated Software, AIS)这个模式提出,要在传统应用和智能体之间加一层意图级交互抽象(Intent-Level Interaction Abstraction, IIA),用交互契约把任务绑定、角色权限、控制转移、结果证据都写清楚 [3]。这样一来,不用盯着 AI 每一步想什么,只要把所有真正改数据的操作都卡在一个「安检门」里——每次操作前都核对一遍当前任务版本、有没有批准、权限够不够,那么不管 AI 怎么规划,放出去的操作都是合规的 [3]。这就把「AI 聪不聪明」和「操作安不安全」两个问题拆开了。
当然,实际情况比这个比喻更复杂:这个框架要求应用提供稳定的对象标识、版本控制、准入门、权威日志这些基础设施,对很多遗留系统来说改造成本不低,而且契约本身怎么写、写多细,目前还需要大量人工领域知识 [3]。
五、这条路从哪来:从信任校准到延迟激活
其实「怎么让 AI 在真实工作流里靠谱」不是新问题,前人已经从不同角度摸了很多年。
早在 2024 年就有研究关注高负荷环境下的人机信任问题:人在工作量大、任务优先级低的时候,更容易要么盲目信 AI、要么干脆不用 AI,而实时的可解释 AI(XAI)培训,可以有效校准这种信任,效果和传统的引导式培训差不多 [6]。这说明「信任不是一次性建立的,而是要随着场景动态调整」这个思路,很早就有人在做了。
2025 年有人提出了「8-Ball 效应」的设计思路:AI 智能体不应该一上来就跳出来干活,而应该保持低可见度,等到关键节点再出手,用延迟激活来提高干预的杠杆率和用户信任 [7]。这个思路和我们直觉里「AI 越快越好、越主动越好」正好相反——有时候晚一点介入,反而比全程瞎掺和更靠谱。
同一年还有 DoubleAgents 这样的工具,主打「部署前先模拟演练」:内置模拟场景让用户提前试探 AI 的行为、调整策略,等对齐得差不多了再真正委托任务 [8]。实验里参与者一开始都不敢放权,但用模拟跑过几轮之后,委托意愿明显上升 [8]。
你看,从信任校准到延迟激活再到模拟演练,这些研究其实都在回答同一个问题:当 AI 不再是一个工具而是一个协作方时,人和它之间的边界、信任、控制权,到底该怎么摆。
六、往前走一步:还有五个两难问题没答案
说了这么多方法,老实讲,我们离「智能体在工作流里完全让人放心」还差得远。核心论文的作者直接总结了五个目前还没有标准答案的部署两难 [1],每一个都戳在真实落地的痛处上:
第一个是坚持度(persistence):智能体遇到障碍该撑多久再放弃?撑太久浪费资源还可能搞破坏,放弃得太早又显得没用。这个度,目前没有通用答案,得由具体场景的利益相关者来定 [1]。
第二个是注意力(attention):压力大的时候,智能体该把注意力收窄只做核心任务,还是该分散开注意到周边的人和事?收窄了不贴心,分散了又可能主业做不好 [1]。
第三个是角色边界(role boundaries):就像前面说的,压力下智能体的角色边界会同时扩张和收缩——到底什么时候可以跨出本职帮忙,什么时候必须守好边界?这个规则 AI 自己拿不准 [1]。
第四个是状态披露(state disclosure):智能体该不该说自己「压力大」「没把握」?说多了用户不信任,不说用户又没法提前预判风险。现在的 AI 倾向于不说,但这显然不是最优解 [1]。
第五个是升级(escalation):什么时候该喊人、喊谁、怎么交接责任?现在的智能体只会喊「来人啊」,离真正的责任交接还差得远 [1]。
这五个问题,没有一个是光靠「把模型做大」就能解决的。它们本质上是人机协作的制度设计问题,需要技术人员、领域专家、最终用户一起坐下来定规则。而目前的研究还处在「把问题描述清楚」的阶段 [1]。
而且现有研究本身也有不少局限:医疗场景的实验是模拟的、语言层面的,没测真实工具调用和真实后果 [1];企业分析的案例只来自一家公司,样本量也不大 [4];工业路由的方法绑定特定场景,公开基准还缺少对应的灰色地带类别 [2];交互契约更是纯框架,还没有经过真实系统和用户研究的验证 [3]。
如果你只记住一件事
评估智能体,别再只看「任务完没完成」。当 AI 进入持续协作的工作流,真正决定你敢不敢真的把事交给它的,是它在压力下会不会乱、边界清不清、状态透不透明、求助能不能把责任交出去——这些藏在过程里的东西,才是长期协作靠谱的关键。
参考文献
- Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge(arXiv、2026、全文精读)
- Debate-to-Skill: Capability-Bound Process Supervision for Industrial Query-to-Agent Annotation(arXiv、2026、全文精读)
- Agent-Integrated Software: Interaction Contracts and Continuous Assurance(arXiv、2026、全文精读)
- Evaluating Enterprise Analytics Agents: An End-to-End, Trace-Backed Methodology(arXiv、2026、全文精读)
- Meta-Learning for Classifier Selection in Image Datasets: A Feature-Driven Framework for Accuracy Prediction(arXiv、2026、全文精读)
- Improving Explainable AI (XAI) Integration in High-Stakes Environments: Examining the Effect of Workload, Task Priority, and Training on XAI Use(Libra、2024、仅摘要)
- The 8-Ball Effect: A Novel Paradigm for Context-Aware Agent Activation in AgentOps Frameworks(2025、仅摘要)
- DoubleAgents: Interactive Simulations for Alignment in Agentic AI(arXiv (Cornell University)、2025、仅摘要)