AI 智能体越能干越危险?我们到底该怎么给它「开权限」
你有没有过这种经历:让 AI 助手帮你订机票,它却自作主张改了你的酒店;或者让它整理文件,它把重要文档删了还找不回来?AI 越来越会「做事」了,但我们真的敢把重要的事交给它吗?
当 AI 从「说话」走向「做事」,我们该如何在能力边界内安全地授予它行动权限?
一、从「聊天机器人」到「办事员」:AI 正在长出「手脚」
过去我们熟悉的 AI,本质上是个「聊天对象」——你问它问题,它回一段文字,所有影响都停留在屏幕上。但现在的 AI 正在变成「办事员」:它能调用工具、操作软件界面、委派任务给其他系统,甚至控制机器人和实验设备。这种从「输出文本」到「改变外部世界状态」的转变,就是最近常说的智能体 AI(Agentic AI)——一类能通过接口作用于外部环境的 AI 系统 [1]。
你可以把它想象成一个从前只能坐在办公桌前给你出主意的顾问,现在拿到了你电脑、账户甚至办公室的钥匙。同样的大模型,只要配上不同的「行动接口」,能干的事就天差地别:比如配上专用的编程命令集,它就能直接修改代码;配上浏览器控制权限,它就能帮你填表单、买东西 [1]。这就像同一个人,用快捷键和用鼠标点菜单,效率完全不是一个量级。
当然,实际情况比这个比喻更复杂——智能体并不是一个单一的「聪明模型」,而是一套由模型(Model)、控制层(Harness,也就是连接模型和工具的中间系统)、**环境(Environment)和授权者(User)**组成的系统 [1]。模型负责思考,控制层负责把想法变成具体操作,环境是操作的对象,而授权者决定它能碰什么、不能碰什么。
这四者里,大家最关注的往往是模型聪不聪明,但真正决定风险的,是后面三样:它有什么权限、在什么环境里干活、谁给它开的门。
二、能做 100 件事 ≠ 能做好 1 件事:智能体的真实能力水位
既然智能体已经长出了手脚,那它到底有多能干?一个常见的叙事是「AI 马上就能自主完成各种任务」,但实证数据告诉我们,行动接口的扩张速度,远快于实际完成任务的可靠性 [1]。
先看数字世界的表现。在模拟真实网页操作的 WebArena 基准测试中,最强的 GPT-4 智能体任务完成率只有 14.41%,而人类是 78.24%;在模拟操作系统操作的 OSWorld 基准中,最佳智能体的完成率不到 12.2%,人类是 72.4% [1]。哪怕是 OpenAI 自家的计算机使用智能体(CUA),在 OSWorld 上也只达到 38.1%,官方系统卡明确表示这个水平不足以用于操作系统自动化,仍然需要人类监督 [1]。
更值得注意的是「重复可靠性」——单次做对不算真本事,每次都做对才有用。τ-bench 的多次重复测试显示,智能体连续多次成功的一致性,远低于单次成功率 [1]。这就像一个实习生,偶尔能把事情办好,但你不敢把重要任务交给他,因为你不知道他这次会不会掉链子。
有人可能会说,那用多智能体呢?让几个 AI 一起干活,总比一个强吧?这个问题要分场景看。在复杂临床诊断这类需要多角度推理的任务上,结构化的多智能体框架确实有帮助——比如「辩论-智能体混合(DMoA)」框架,通过模拟「提出诊断→反驳挑错→修正→汇总」的会诊流程,在罕见病和疑难病例上,把 Top-1 诊断准确率比单 GPT-4o 提高了 10.21 个百分点,安全率提高了 11.36 个百分点 [3]。
但这并不意味着「多智能体一定更强」。2026 年的一项预印本研究发现,在推理 token 预算相同的情况下,单智能体在多跳推理任务上的表现持平甚至优于多种多智能体架构 [1]。而且多智能体系统还会引入新问题:成本更高,还可能出现「相关失效」——一个模型犯的错,其他模型也跟着犯,反而放大风险 [1]。
最近的大规模评测也印证了模型能力的核心作用:Harbor Adapters 统一了 80 多个智能体基准,在 54 个基准、6627 个任务上的测试显示,基础模型能力对性能差异的贡献,是控制层设计的 5 倍以上 [4]。换句话说,换个更强的模型,比折腾工具链管用得多。他们还筛选出了一个由 82 道高质量难题组成的 Harbor-Index 评测集,最强的 GPT-5.5 配 Codex 工具链,通过率也只有 28.0%,没有任何配置能超过 30% [4]。
这里还有个反直觉的发现:很多所谓的「难题」其实根本不是真难,而是题目本身有问题——比如验证逻辑有bug、要求没写清楚却按格式扣分。人工审核发现,最难的候选任务里约三分之一都是这种「坏题」 [4]。这也提醒我们,看智能体的能力不能只看 headline 数字,得先看测试本身靠不靠谱。
三、为什么「聪明」不等于「可信」:授权比能力更重要
说到这里你可能已经发现了:我们真正该担心的,不是 AI 够不够聪明,而是我们该不该给它开门、开多大的门。一个只能改代码、有版本控制和测试把关的窄编程智能体,可能比一个能随便点你所有网页和账户的「通用智能体」靠谱得多——因为权限越小,出问题的后果越可控 [1]。
这正是那篇批判性综述提出的核心观点:我们需要用**正当授权(justified delegation)**的框架来思考智能体部署,而不是一味追求「更自主」「更通用」 [1]。
什么是正当授权?简单说就是三条:权限要匹配能力、操作要可验证、出问题要能恢复。你给 AI 开的权限,必须有对应的证据证明它能在这个范围内可靠地完成任务;它做的每一步操作,都得有记录、能审计;万一出了错,得有办法撤回、恢复,而不是造成不可逆的后果 [1]。
这个思路和「有限自主性(Bounded Autonomy)」的研究方向不谋而合——智能体部署的核心问题,不是让它完全自主,而是在保持它主动性的同时,给它套上一个可审计、有弹性、安全的行为边界 [7]。传统软件的那套规范和运行时验证方法,没法直接套用到智能体上,因为智能体的行为是从「模型+工具+环境」的交互中涌现出来的,不是写死的代码路径 [7]。
那怎么实现可验证呢?一个方向是给 AI 的决策装上「知识底稿」。最近提出的**知识卡(Knowledge Card)**概念,就是想做这件事 [5]。现在的 AI 已经有三张「身份证」:模型卡说它表现如何,数据卡说它用什么训练,系统卡说它有什么风险——但没人知道它「脑子里装了什么知识、这些知识在哪种情况下不管用」。知识卡就是补这第四张卡的:每张卡对应一个明确的概念,有领域专家验证,有来源追溯,更重要的是,它会明确写出「在什么条件下这个知识不成立」 [5]。
比如风电场齿轮箱的振动诊断,知识卡里会明确写:如果轴承 48 小时内刚加过润滑脂,这个诊断就不算数。这时候 AI 就不会贸然派昂贵的维修队,而是转交给人处理,直接避免了「自信的昂贵错误」 [5]。你可以把它想象成给 AI 配了一本带「禁忌条款」的操作手册,而且每一条都有专家签字、能追溯责任。
当然,知识卡目前还只是 v0.1 草案,只在能源和制药领域做了初始原型,还没有大规模的实证数据证明它的实际效果 [5]。但它代表了一个重要的方向:可信不是靠模型「自己变乖」,而是靠外部的结构化约束和审计机制。
四、从实验室到真实世界:我们还差哪几步?
看到这里你可能会问:那智能体离真正在真实世界里可靠干活,还差多远?
首先得说,实验室里的成绩,不能直接等同于真实世界的能力。现在大多数智能体基准都是在可重置、隔离的合成环境里测的,没有真实权限、没有受影响的用户、接口也不会动态变化 [1]。就像你在驾校里开得再好,上路面对真实路况也是两回事。
物理世界的智能体更是如此。比如 RT-2 机器人模型,在 6000 次评估试验中验证了对新物体和新指令的泛化能力;Coscientist 系统在 6 项化学任务中实现了半自主的实验设计与执行 [1]。但这些证据都来自有边界的实验室环境、预设的工具和专家监督,无人值守的开放世界可靠性还没有被验证 [1]。
更值得警惕的是,智能体的「手」已经不只是伸到机器人了,它还能通过钱伸到真人身上。2026 年 2 月的一项预印本测量了某平台的 303 个悬赏任务,其中 99 个(32.7%)来自 API 或 MCP 渠道,涉及凭证欺诈、身份冒充等多种风险 [1]。也就是说,AI 已经能「雇人干活」了,而且其中不少活是灰色甚至黑色的——这比 AI 自己操作电脑的风险大得多,因为它绕过了所有技术层面的权限控制。
多模型系统的兴起还带来了新的结构性风险。有研究指出,现在的 AI 安全框架大多是针对单个模型设计的,但当多个不同对齐机制、不同安全标准的模型交互时,会出现系统性的失效模式——比如认知遏制级联、归因不稳定、没有协调的语义趋同等等,这些都是现有治理框架的盲区 [6]。
回到那篇批判性综述提出的开放问题,我们现在还有很多根本问题没解决:怎么建立可信的授权机制?怎么实现持久的状态管理和跨智能体的问责?怎么对开放世界的物理智能体做分阶段的验证 [1]?这些问题不解决,智能体越能干,风险就越大。
而且作者也坦诚,这篇综述本身也有局限:它只覆盖了截至 2026 年 8 月 31 日的公开证据,不是系统综述或元分析,没法估计全领域的整体情况;提出的「正当授权」也只是一个启发式框架,不是什么经过验证的量化标准 [1]。但恰恰是这种诚实,反而让它的判断更值得重视——当我们谈论智能体的未来时,最危险的不是无知,而是把愿望当成事实。
如果你只记住一件事
智能体 AI 的核心问题,从来不是「它能不能做」,而是「我们能不能放心让它做」。与其追求无所不能的通用智能体,不如从窄场景、小权限、可撤回的授权开始,用「正当授权」的尺子,一步步丈量安全的边界。
参考文献
- From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments(arXiv、2026、全文精读)
- EuroAlpaca: Task-Preserving Localisation of Instruction Data for European Languages(arXiv、2026、全文精读)
- A Structured Debate-Mixture-of-Agents Framework for Complex Clinical Diagnostic Decision Support(arXiv、2026、全文精读)
- Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation(arXiv、2026、全文精读)
- Knowledge Cards: Structured Knowledge for AI Systems(arXiv、2026、全文精读)
- Technical Report: Structural Vulnerabilities and Governance Risks in Multi-Model AI Systems(Zenodo (CERN European Organization for Nuclear Research)、2025、仅摘要)
- Bounded Autonomy: Behavioral Specification Languages and Runtime Enforcement Architectures for Trustworthy Agentic AI Systems Authors Harper G(Innovative Journal of Applied Science、2026、仅摘要)
- Bounded Autonomy: Behavioral Specification Languages and Runtime Enforcement Architectures for Trustworthy Agentic AI Systems(2026、仅摘要)