Chunlin 的论文科普

AI 智能体真的会「越用越聪明」吗?

你可能见过这样的宣传:AI 智能体能从经验中学习,越用越强,还能沉淀可复用的技能库。用同一个智能体助手久了,你也可能有「它好像越来越懂我、越来越顺手」的感觉。但如果把「记笔记」和「真学会」分开看——它到底是靠提炼通用方法进步,还是只是记住了上次的答案?

这个问题不只是体感差异,它直接决定了智能体的能力天花板:如果进步只来自对历史上下文的记忆,那它永远跳不出「见过的题」;只有真正把经验抽象成可复用的技能,才算得上「越用越聪明」。

把「学会了」拆成两种:记答案 vs 提炼技能

要回答这个问题,我们得先把「经验带来的进步」拆成两种完全不同的机制。

你可以回想一下学生时代的两种备考方式:一种是「考前背题」,把做过的卷子和答案都记下来,考试时遇到类似的就直接套;另一种是「整理错题本」,把错题里的通用方法、解题套路提炼出来,下次遇到新题也能用上。前者靠的是记忆力和眼熟,后者靠的是抽象和归纳。

放到智能体身上也是一样。第一种叫上下文学习(In-Context Learning, ICL)——简单说就是把之前做过的任务、收到的反馈都放在对话上下文里,模型靠「回忆」最近的经验来调整输出。第二种叫显式技能沉淀——智能体主动把经验提炼成一条条独立的「技能」,存到专门的技能库里,遇到新任务时主动调用对应的技能 [1]。

你可能会觉得,显式建技能库怎么也比纯靠记忆强吧?毕竟「整理错题本」听着就比「背答案」更高级。但别急,我们得用实验数据说话——而要做公平的实验,首先得有一个靠谱的测试基准。

ContinualSkillBench:怎么公平地测「越用越强」?

为了系统回答这个问题,一篇最新的论文提出了名为 ContinualSkillBench 的评估基准,专门用来测 LLM 智能体的持续技能进化能力 [1]。

这个基准的设计很讲究。它覆盖了医疗、法律、数学、金融、办公 5 个领域,每个领域有 100 个子任务 [1]。这些任务不是随便堆在一起的,而是按难度和技能依赖关系排好序的——后面的任务会用到前面任务里的核心技能,这样才能测试「前面学的东西能不能帮到后面」。为了保证这一点,研究人员还用核心技能语义相似度做了验证,结果显示 69.5% 的任务会复用至少一个先前的核心技能 [1]。

更关键的是它的对照设计。研究人员设置了三种执行模式来分离不同机制的作用:

通过对比这三种模式的表现,我们就能清楚地知道:进步有多少来自「记住了之前的题」,又有多少来自「真的学会了方法」。

反直觉的结果:技能库未必比「凭记忆」强

实验结果多少有点反直觉。

首先,顺序执行确实普遍提升了性能。在 15 个模型-领域组合中,有 13 个的原始奖励、14 个的归一化奖励得到了提升,整体归一化奖励的相对增益约为 16.9% [1]。这说明「经验」本身是有用的——不管是靠记忆还是靠技能,做过类似的任务总比从零开始强。

但提升的幅度在不同模型和领域之间差异很大。模型方面,GPT-5.3-Codex 的平均归一化提升是 +0.098,GPT-4o 是 +0.077,Claude 4.7 Opus 只有 +0.058 [1]。领域方面,医疗领域的平均提升最大(+0.149),金融、法律、办公、数学依次递减,其中 Claude 4.7 Opus 在数学领域甚至出现了轻微下降 [1]。

更有意思的是显式技能和纯上下文学习的对比。在法律、金融、医疗三个领域的测试中,独立执行、纯 ICL、带技能顺序执行的平均归一化奖励分别是 0.466、0.605、0.602——后两者相比独立执行都有显著提升,但显式技能和纯 ICL 几乎打了个平手 [1]。

换句话说,你以为智能体建了个「技能笔记本」会更厉害,但很多时候它只是把之前的反馈记在了脑子里,效果居然差不多。这说明目前智能体从经验中获得的提升,大部分来自对历史上下文的适应,而不是真正的、可复用的技能抽象 [1]。

当然,显式技能也不是完全没用。在那些需要重复使用固定流程、或者对输出精度要求高的任务上,技能库还是有选择性优势的 [1]。

还有一个很有意思的发现:能力越弱的模型,生成的技能越多越碎。比如 GPT-4o 在五个领域一共生成了 384 个技能,平均质量分只有 5.68;而更强的 GPT-5.3-Codex 只生成了 205 个技能,但平均质量分高达 7.94 [1]。这就像学习差的学生错题本写了满满一本,但都是零散的题目;学习好的学生错题本薄,但每一条都是通用方法。

之前的研究怎么看「技能进化」?

其实在这篇论文之前,已经有不少工作在探索智能体的技能学习了,我们可以简单梳理一下脉络。

最早的思路是「自动建技能库」。比如 SkillX 提出了一个全自动框架,能把智能体的执行轨迹提炼成战略层、功能层、原子层三级分层的技能知识库,还能通过执行反馈迭代优化、主动探索扩展技能覆盖范围 [6]。它的核心想法是:与其让每个智能体自己从头学,不如把经验提炼成可插拔的技能库,让弱模型也能直接用。

再后来,有人把视角从「单个智能体」扩展到了「多用户集体进化」。SkillClaw 就是这样一个框架,它把不同用户的交互轨迹聚合起来,用一个自主进化器从中识别反复出现的行为模式,然后更新共享的技能库 [7]。这样一来,一个用户发现的技巧可以同步给所有用户,实现集体层面的能力累积。

但这些工作大多只证明了「技能库有用」,却没回答「技能库到底怎么起作用」以及「和纯记忆比好在哪」。于是就有了 SkillLearnBench——第一个专门评估智能体持续技能学习的基准 [8]。它包含 20 个经过验证的技能依赖任务,从技能质量、执行轨迹、任务结果三个层面评估。它的一个重要发现是:外部反馈对真正的进步至关重要,而纯自反馈反而会导致「递归漂移」——也就是自己瞎改,越改越偏 [8]。

这篇往前走了哪一步?

那 ContinualSkillBench 相比之前的工作,又往前走了哪一步呢?

最核心的贡献是,它第一次系统地把「上下文适应」和「技能抽象」的作用给分开了 [1]。之前的工作大多只对比「有技能库」和「没技能库」,但技能库里的技能和上下文里的历史经验混在一起,你说不清提升到底来自哪。而这篇论文通过设置「纯 ICL」基线,把两者的贡献拆解开了——结果发现大部分提升其实是前者带来的。

其次,它揭示了技能库质量和模型能力的强相关关系 [1]。弱模型生成的技能又多又碎,质量还低;强模型生成的技能少而精,复用价值更高。这其实也解释了为什么「显式技能」没有普遍比纯 ICL 强——如果技能本身质量不高,那建了还不如不建。

另外,它的基准规模和覆盖领域也比 SkillLearnBench 更大——从 20 个任务扩展到了 5 个领域各 100 个任务,而且每个领域内部都有清晰的技能依赖关系 [1][8]。

当然,实际情况比这个比喻更复杂。技能库的价值可能在更长时间尺度、更多任务积累后才会显现,而这篇论文只测试了 100 步的短期学习。

还没解决的问题:离真正的「持续进化」有多远?

看完这些结果,我们得清醒地认识到:现在的智能体离真正的「越用越聪明」还有不小的距离。还有很多开放问题等着解决。

第一个问题是长期技能遗忘与库膨胀。这篇论文只测了 100 个任务的短期持续学习,那如果是 1000 个、10000 个任务呢?技能库会不会越来越臃肿,找有用的技能反而更慢?旧的、过时的技能会不会干扰新任务?这些长期问题目前还没有答案。

第二个问题是技能质量的人类验证。论文里的技能质量是用 LLM 裁判打分的,但 LLM 觉得质量高,不代表人类实际用起来真的有用。技能的实际复用价值、可迁移性,还需要更直接的人类验证。

第三个问题是跨领域迁移。现在的实验都是在同一个领域内做的——医疗领域学的技能只能帮医疗领域的任务。那能不能把一个领域学到的通用方法迁移到另一个领域?比如从数学推理里学到的「分步骤验证」能不能用到法律分析里?这也是真正的「通用智能」需要解决的问题。

第四个问题是开源模型的表现。这篇论文只测试了 GPT-4o、GPT-5.3-Codex、Claude 4.7 Opus 三个闭源模型,没有覆盖开源模型 [1]。开源模型在技能生成和沉淀上的表现如何?是不是也符合「弱模型技能多而碎」的规律?这些都还不清楚。

最后,论文自己也提到,技能提升在结构化任务(比如精确匹配、数值、编程类)上更明显,在开放类任务上效果就不稳定了 [1]。而现实世界里的很多任务恰恰是开放的、没有标准答案的。

如果你只记住一件事

AI 智能体确实会因为经验而变强,但目前大部分「变强」来自对历史上下文的记忆和适应,而不是真正提炼出了可复用的通用技能。


参考文献

  1. ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?(arXiv、2026、全文精读)
  2. AI Agent Economics: Can Autonomous Economic Behavior Emerge among AI Agents under Minimal External Conditions?(arXiv、2026、全文精读)
  3. Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks(arXiv、2026、全文精读)
  4. AgentPanel: Toward a New Paradigm for Human—AI Collaboration in Exploring Scientific Questions(arXiv、2026、全文精读)
  5. The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems(arXiv、2026、全文精读)
  6. SkillX: Automatically Constructing Skill Knowledge Bases for Agents(ArXiv.org、2026、仅摘要)
  7. SkillClaw: Let Skills Evolve Collectively with Agentic Evolver(arXiv (Cornell University)、2026、仅摘要)
  8. SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks(arXiv (Cornell University)、2026、仅摘要)