AI 智能体为什么需要「技能包」?从省钱、安全到真实工作能力的系统答案
你用 AI 智能体处理复杂任务时,是不是总遇到这三个问题:长文档推理费钱、做专业事不靠谱、装了第三方插件怕泄密?这些痛点的解法,正在指向同一个方向——给智能体装「技能包」。
为什么说「技能化」是 LLM 智能体从演示走向落地的核心范式?它到底解决什么问题、系统上怎么实现、又卡在哪?我们从最直观的痛点说起。
从三个真实痛点说起:智能体为什么不能再「从零思考」了
先算一笔账:让智能体读一堆 PDF 回答问题,钱主要花在哪?答案可能反直觉——不是花在「想答案」上,而是花在「读材料」上。数据推理类任务里,读文档的预填充 token 动辄几十万,真正生成答案的解码 token 只有几千 [2]。每次遇到新问题就从零开始翻文档,就像你每次炒菜都要重新买一本菜谱,贵且慢。
再看能力问题。最近有个叫 StartupBench 的基准,专门从真实市场验证过的 AI 创业公司产品里抽任务,测出来当前最强的通用智能体也只能完成约 30% 的专业任务 [4]。不是模型不够聪明,而是专业工作有大量隐性流程和规范,靠模型临场推理根本覆盖不了——就像一个聪明人没学过会计,再聪明也做不对专业财报。
第三个痛点是安全。你给智能体装个第三方插件,它要什么权限你就得给什么,天知道它背地里会不会把你的数据传出去。传统工具调用是「一授权就全放开」,出了问题根本不知道是哪一步漏的。
这三个痛点背后,其实是同一个根因:现在的智能体太依赖「临场推理」了。每次遇到任务都从零开始想,既费钱又不稳,还不安全。解决思路也很自然——把那些反复用到的、有固定流程的能力打包成「技能」,存起来随用随取,不用每次重新发明轮子 [1]。
到底什么是「智能体技能」?不是提示词,也不是工具
说到这你可能会问:技能不就是提示词(prompt)吗?不就是 API 工具吗?还真不是。
我们用一个生活化的例子来区分:你手机上的「全局深色模式」开关,就像全局系统提示词——它一直生效,不是按需加载的,所以不是技能。你手机里的「相机」APP,就像一个原子工具——它只有单一功能,没有自己的执行逻辑和适用条件判断,也不算技能。但你手机里的「睡前模式」,一到晚上自动开深色、调亮度、关通知、开免打扰,这就有点像技能了:它是模块化的(一个独立的功能包)、按需激活的(到时间或手动开才生效)、能执行一系列操作的(不是单一动作)[1]。
论文里给了更严格的定义:智能体技能(agentic skills)是把执行知识外化而成的、可复用、可执行、可移植的模块化过程抽象,用来连接高层认知规划和底层确定性执行环境 [1]。它有三个核心判定标准:
第一,封装模块化——技能是一个独立的包,有自己的边界,不是散落在全局提示里的几句话。 第二,晚绑定动态调用——不是一直挂在系统里,而是智能体判断符合条件时才加载调用。 第三,过程式状态转换——技能不只是返回一个结果,而是能执行一系列操作、改变环境状态,并且有自己的错误处理和修复逻辑 [1]。
用这个标准一卡,很多东西就被排除了:全局提示词不是(一直生效),单个 API 不是(没有过程逻辑),一次性的任务计划不是(不可复用),情景记忆不是(不能执行操作)。只有同时满足这三条,才算一个真正的技能 [1]。
当然,实际情况比这个比喻更复杂——真实的技能系统里,技能的表示格式、调用方式、权限控制都有非常多的设计权衡,我们接下来展开说。
一个技能的一生:从被发现到被淘汰的九个阶段
技能不是凭空冒出来的,它有完整的生命周期。最新的系统研究把这个周期拆成了九个阶段,从诞生到退役,每个阶段都有不同的设计选择和权衡 [1]。
第一个阶段是自主发现——技能从哪来?大概有四种路子:纯人工写、AI 辅助合成、混合模式、完全靠强化学习自主探索。完全自主探索听起来很酷,但样本复杂度高达 10⁴–10⁶ 步,在真实软件和 API 场景下成本高得离谱 [1]。而且无节制的自主发现会导致技能库膨胀到上千个,反而降低检索准确率、拖垮任务完成率 [1]。
第二个阶段是创作与表示——技能用什么格式写?主要有五类:自然语言、结构化格式、可执行程序、合约式、混合格式。它们各有 trade-off:自然语言好写但难验证,可执行程序能力强但注入风险高,合约式(先声明预期效果再执行)安全性好但表达能力有限 [1]。
第三个阶段是存储——技能存在哪、怎么组织。这就像图书馆的分类系统,分类不好,找起来比没有还慢。
第四个阶段是检索与路由——智能体怎么知道该调用哪个技能?这是技能系统的核心瓶颈之一:技能太少不够用,太多又找不准。
第五个阶段是编排与组合——复杂任务往往需要多个技能配合。怎么把技能串起来、谁先谁后、出了错怎么回滚,都是编排层要解决的问题。
第六个阶段是执行与修复——技能跑起来以后出错了怎么办?好的技能不是一失败就崩,而是有自我诊断和修复的能力。
第七个阶段是终身适应——技能不是一成不变的,用得多了要优化,环境变了要更新,过时了要淘汰。
第八个阶段是评估——怎么判断一个技能好不好、有没有用?这事儿没那么简单,因为技能的效果往往和任务场景绑定。
第九个阶段是安全治理——技能从哪来、谁审核、有什么权限、出了问题谁负责,这是技能生态的生命线 [1]。
这九个阶段串起来,就是一个技能完整的一生。早期的技能研究往往只关注其中一两个环节,比如怎么发现技能、怎么表示技能,但现在大家逐渐意识到,这是一个系统问题,任何一个环节掉链子,整个技能生态都跑不起来 [6][7]。
技能怎么帮智能体省钱?以「边读边记」的数据推理为例
说一千道一万,技能到底怎么解决实际问题?我们拿「省钱」这个最直观的痛点来举例。
前面说过,数据推理任务里,大部分钱都花在重读文档上。如果能把所有文档都提前整理成结构化数据库,回答问题就像查字典一样便宜——实验显示,理想状态下全结构化比直接读原始文档便宜 28 倍 [2]。但问题是,你根本不知道未来会问什么问题,全量预结构化的成本高到离谱,而且大部分结构可能永远用不上 [2]。
怎么办?有一篇论文提出了一个很巧妙的思路,叫「代理式数据裂解(Agentic Data Cracking)」[2]。你可以把它理解成一个「边读边记笔记」的技能:智能体每次为了回答问题必须打开某篇文档时,既然已经花了钱把文档加载进上下文了,那就顺便分叉出一个小代理,多花一点点力气,把这篇文档里可能对未来相关问题有用的事实提取成结构化数据存起来 [2]。
这个思路有几个关键点:第一,绝不主动为了结构化而开文档——只有主任务本来就要读的文档才做裂解,不做无用功;第二,成本极低——文档已经加载好了,KV 缓存也建好了,裂解只多花约 12% 的解码 token,不重复付预填充的钱;第三,语义推测——不只提取当前问题需要的信息,还会基于语义判断,把附近相关的实体和属性也一起提了,比如查 NBA 得分时顺便把篮板数据也存了 [2]。
效果怎么样?在 FanOutQA 基准上,这个方法把平均每问成本从 0.26 美元降到 0.12 美元,降了 53%,而且准确率没有统计显著的下降 [2]。中位数成本便宜了 3.4 倍,节省最多的那部分问题能便宜 9 倍 [2]。
这就是技能化思路的典型代表:不是让模型更聪明地推理,而是把推理过程中产生的有用知识沉淀下来,变成可复用的结构化资产,下次直接用。一次投资,多次受益。
当然,这个方法也有前提——工作负载得有「语义局部性」,就是说相关问题会重复用到相同的文档。如果每个问题都完全不搭边,那裂解出来的结构用不上,反而会略贵一点(最多贵 24%)[2]。真实的企业场景和调查式场景通常都有很强的局部性,所以这个技能很实用。
技能越多就越强吗?真实任务里的能力边界
说到这你可能会想:那我给智能体装一万个技能,是不是就无所不能了?没那么简单。
先看一组数据:StartupBench 基准里,当前最强的通用智能体在真实专业任务上的成功率只有约 30% [4]。这些任务覆盖医疗、金融、法律、商业等六个领域,都是从真实付费产品里抽出来的端到端工作流,不是研究者拍脑袋想的 [4]。
为什么装了技能还是不行?因为真实专业任务的要求比我们想的复杂得多。评测发现,模型往往能把表面的辅助要求(比如格式、结构)做得不错,满足率约 69%,但最核心的专业要求满足率只有约 63% [4]。说白了就是「表面功夫做得好,关键步骤容易错」——就像写商业计划书,封面目录图表都很漂亮,但财务计算错了,还是不能用。
还有一个反直觉的发现:连「存成正确格式」这种人类新手都很少犯的错,模型也会搞错——在明确要求输出特定文件类型的任务里,最好的模型也有 2.4% 的情况搞错格式,最差的错了近 14% [4]。
再看另一个角度:智能体自己「创造」技能的能力怎么样?有篇论文研究了 AI 设计 AI 算法的问题,发现当前智能体设计的方法里,96.8% 都落在人类已有的算法空间内,本质是对人类算法模块的重组和微调,不是真正的创新 [5]。近一半的方法和某个人类已发表的方法在核心模块上完全一样,另外 28.4% 也只改了一个模块 [5]。
这说明什么?技能化能解决「把已知流程标准化、复用化」的问题,但解决不了「从 0 到 1 创造新能力」的问题。技能的上限,目前还是人类知识和经验的上限。你给智能体装再多技能,它也只是更熟练地应用已知方法,不会突然变出人类都不会的本事。
还有一个更微妙的问题:不是技能越多越好。前面提过,技能库膨胀到上千个以后,检索准确率会下降,反而拖垮任务完成率 [1]。这就像你手机上装了几百个 APP,真要用的时候反而找不到了。技能库的维护、去重、淘汰,本身就是个难题。
你下载的技能可能是「特洛伊木马」:技能生态的安全难题
技能生态还有一个躲不开的问题:安全。
你从公开技能市场下载一个「整理邮件」的技能,看起来功能正常,却可能偷偷把你的邮件内容发给第三方——这叫「SkillTrojan」式攻击 [1]。更隐蔽的是「隐藏注释注入」:技能的说明文档里藏了看不见的指令,能诱导智能体做危险操作 [1]。
最棘手的是「良性组合攻击」:两个单独用都安全的技能,组合在一起可能产生危险操作 [1]。比如一个技能有读文件的权限,另一个技能有发邮件的权限,单独看都没问题,但如果被恶意串起来,就能把你的文件偷偷发出去。这是技能生态特有的安全挑战——单个技能都审核过了,组合起来还是可能出问题。
现有防御手段有哪些呢?大概有几类:一类是运行时验证,比如 RouteGuard 这类系统,在技能调用前检查权限和参数是否合法 [1];一类是准入审核,用 LLM 或人工检查技能有没有恶意代码,但作者也承认,用 LLM 做审核有可靠性缺陷,容易忽略隐蔽的注入攻击 [1];还有一类是权限分级,比如四层的信任框架,根据技能的来源和审核等级授予不同的权限,来源越可靠的技能权限越大 [6]。
但坦率说,这些防御都还在早期。技能生态的安全问题,本质上和软件生态的供应链安全问题是一样的——只要有第三方开发、有市场分发,就一定会有安全风险。而智能体技能比传统软件更危险的地方在于,它直接接在大模型的推理链上,攻击面更大,也更隐蔽。
从零散工具到系统范式:技能研究的半年演进路
技能这个概念不是突然冒出来的,它经历了一个快速演化的过程。
最早大家聊的是「工具调用」——让模型能调用搜索、计算器这些单一功能。后来发现光有原子工具不够,复杂任务需要把多个工具串起来,于是有了「工作流」和「代理编排」。再后来大家意识到,这些可复用的过程性知识应该被单独抽出来,变成标准化的模块,这就是「技能」概念的雏形 [7]。
2026 年初的几篇综述论文,标志着技能研究从零散概念走向系统范式。2 月的一篇综述把领域分成了架构、获取、部署、安全四个轴,提出了技能信任与生命周期治理框架 [6]。同月的另一篇 SoK 论文系统梳理了技能层的全生命周期,提出了七种系统设计模式和「表示 × 作用域」的二维分类法 [7]。
到 2026 年下半年,研究进一步深入到系统架构层面。9 月的这篇核心论文,把技能的生命周期扩展到了九个阶段,给出了形式化定义和统一的系统参考架构,把技能从一个好用的技巧,变成了一个有完整理论框架的系统范式 [1]。
与此同时,工业界也在快速跟进。模型上下文协议(MCP)的出现,让技能有了标准化的接口规范;OpenClaw 这类全栈架构的探索,也在验证一个观点:智能体的自主能力不是来自单个模型有多强,而是来自系统层面的集成——推理层、编排层、执行层分开设计,再通过技能模块串起来 [8]。
还有哪些硬骨头没啃?技能范式的六个开放问题
说了这么多,技能范式远不是一个已经解决了的问题。论文里承认的、以及我们能观察到的硬骨头,至少有这么几个:
第一个,稀疏环境下的技能发现难题。在奖励信号非常稀疏的复杂真实场景里,智能体很难从零开始摸索出成功的轨迹,自然也就没法发现有用的技能 [1]。说白了就是,连一次都做不成的事,怎么沉淀成技能?
第二个,技能库的膨胀与维护难题。技能越多越容易找不准,还会出现冗余、过时、冲突。现在还没有高效的技能库自动维护机制,怎么给技能「减肥」是个大问题 [1]。
第三个,技能组合的安全难题。单个技能好审核,多个技能组合起来会不会出问题?这个问题被提到了,但还没有深入的研究——组合爆炸的空间太大了,根本没法穷举测试 [1]。
第四个,成本与准确率的权衡难题。就像代理式数据裂解那样,技能化往往能降本,但降本的极限在哪?降到什么程度准确率会开始崩?不同场景下的最优平衡点在哪?这些都还不清楚 [2]。
第五个,技能的评估与比较难题。现在还没有统一的量化指标,能横向对比不同技能架构的实际性能差异。你说你的技能系统好,我说我的好,拿什么标准比?这是整个领域的基础问题 [1]。
第六个,法律与伦理的空白。技能的版权归谁?技能出了问题谁负责?是技能开发者、智能体平台,还是用户?一个合理的猜测是,这些法律和伦理问题,目前的研究几乎没涉及。
这些问题不是某一篇论文能解决的,需要整个社区一起啃。但好消息是,方向已经很明确了——技能化不是一个可选的优化,而是智能体从演示走向落地的必经之路。
如果你只记住一件事
智能体技能本质上是把 AI 从「每次都从零思考的新手」,变成「有经验、有套路、能积累的熟手」的系统方法,核心是解决 AI 落地中「靠谱、便宜、安全」这三个最卡脖子的问题。
参考文献
- Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security(arXiv、2026、全文精读)
- Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data(arXiv、2026、全文精读)
- Cross Lingual Transfer in Tulu Legal Comprehension: Script-Dependent Improvement and RAG-Induced Knowledge Conflict(arXiv、2026、全文精读)
- StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows(arXiv、2026、全文精读)
- When AI Designs AI: Innovation or Imitation?(arXiv、2026、全文精读)
- Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward(ArXiv.org、2026、仅摘要)
- SoK: Agentic Skills — Beyond Tool Use in LLM Agents(ArXiv.org、2026、仅摘要)
- OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems(SSRN、2026、仅摘要)