AI 科学家能自己改模型代码了?从 AgentFold 看智能体做科研的三层能力
你可能见过 AI 帮写代码、查文献,但如果让 AI 接手一个 2000 多行的蛋白质折叠模型代码库,自己改架构、调 bug、跑 5000 GPU 小时的实验,最后还真把效果提升了——这靠谱吗?
最近的 AgentFold 工作就做了这么一件事。它不是在那里空泛地「提出研究思路」,而是真的钻进代码库里,从提出假设、写代码、调 bug 到跑训练评估,走了一个完整的闭环 [1]。
这背后其实是一个更大的问题:要让智能体真正做得了科研,需要跨过哪几道坎,现在又走到了哪一步?
从一个反直觉的实验说起:AI 自己改模型,效果还更好
先给你一个直观印象。AgentFold 从一个精简版的 ESMFold 蛋白质折叠模型出发,这个代码库有 2000 多行代码,包含序列、配对、结构等多个高度耦合的模块 [1]。
它干了什么呢?在总共约 5000 GPU 小时的计算预算下,它前前后后探索了大约 80 个模型变体,消耗了 1.7 亿 LLM tokens [1]。每一个变体,都是它自己改代码、自己调试、自己训练评估出来的。
结果怎么样?在匹配计算预算的对比中(各 36 次评估),AgentFold 找到的最佳模型在 lDDT(一种衡量局部结构预测精度的指标)上比独立的 Codex 提案高出 7.5% [1]。更有意思的是参数变化:表现最好的变体只比基线多了约 1.1% 的参数,有的变体参数更少却更强 [1]。
它还发现了一个反直觉的设计规律:稳定的性能提升往往来自在坐标生成前加入可学习的软偏置,而直接在结构形成后做几何扰动反而容易让训练崩溃 [1]。打个比方,就像折纸时先轻轻引导折痕比硬掰更不容易折坏。当然,实际情况比这个比喻更复杂,涉及到折叠模型中不同模块的耦合方式。
这说明什么?说明科研智能体已经不只是「会用工具的助手」了,它已经能在一定程度上闭环完成「假设-实现-验证-分析」的研究循环。但要做到这一步,光靠一个会写代码的 LLM 远远不够,背后需要三层关键能力。
第一层能力:别把草稿当记忆——长任务怎么不跑偏还省钱
科研任务的第一个特点是:步骤多、周期长。改模型不是一问一答就能搞定的,要经历提出想法、写代码、编译报错、调试、跑训练、看曲线、分析原因等几十个步骤,每一步还有大量中间信息。
传统的对话式智能体怎么处理长任务?它把所有历史都堆在对话里,就像把每一步的草稿纸都钉在一起,越钉越厚。这样做有两个问题:第一,token 消耗是平方级增长的,越到后面越贵;第二,历史信息太多反而会干扰当前决策,也就是所谓的「上下文中毒」 [3]。
SKILL.state 这篇工作提出了一个很朴素但很有效的思路:用**结构化状态(structured state)**替代对话历史 [3]。
你可以这么理解:传统智能体是「攒草稿纸」,每一步的思考过程、观测结果、动作记录全都留着,后面做决策时全部翻一遍;而 SKILL.state 是「记状态卡片」,每一步打完草稿后,只把真正需要记住的结论抄到一张固定的小卡片上,草稿纸直接扔掉 [3]。这张卡片上的字段是预先定义好的,比如当前假设、已做实验、失败记录等等。
效果有多明显?在仓库管理环境中,当任务执行到 100 步时,SKILL.state 的总 token 消耗只有传统带状态基线的 1/16,准确率还更高(0.94 vs 0.91)[3]。如果有噪声干扰(比如每步塞 50 条无关日志),传统智能体的准确率直接掉到 0.53,而 SKILL.state 还能保持 0.98——因为无关信息在更新状态时就被过滤掉了,根本不会进入下一轮的「视野」 [3]。
当然,实际情况比这个比喻更复杂:状态 schema 需要人工设计,而且这套方法假设「状态是未来决策的充分统计量」,对于需要追溯完整历史的任务(比如审计)就不适用 [3]。但对于科研这种有明确目标、中间过程可以被结构化总结的任务,这几乎是刚需——不然跑了几十步实验,智能体自己先记混了。
第二层能力:别死磕也别偷懒——推理资源怎么自适应分配
光省 token 还不够。科研还有一个特点:每一步的难度差异极大。有的 bug 看一眼报错就知道怎么改,有的架构问题需要反复权衡利弊。如果给每一步都分配同样多的思考预算,要么是简单问题上浪费算力,要么是复杂问题上想不透就行动。
「Don’t Overthink, Don’t Underthink」这篇论文就系统研究了这个问题。他们在 LangGraph 搭建的智能体框架上,用三个主流模型在 MATH-500(数学题)和 GAIA(真实多步任务)两个基准上做了定量实验,发现当前智能体普遍存在两种资源错配:过度推理(over-reasoning)和推理不足(under-reasoning) [2]。
什么叫过度推理?比如 Phi-4-reasoning 模型在 500 道数学题里,有 482 道都直接写到了 token 上限才停,相当于每道题都要写到纸的最后一行才肯交卷 [2]。它花了近 3 倍的时间、写了快 2 倍的字,但准确率只比更轻量的 Qwen 模型高 4.8 个百分点 [2]。更夸张的是在 GAIA 真实任务上,Phi-4-reasoning 花了几乎 3 倍时间,准确率反而比 Qwen 还略低一点 [2]——就像考试时死磕一道题想太多,反而把正确答案改错了。
什么叫推理不足?更简单:所有被判定为「想太少」的案例,没有一个是答对的,要么错了,要么干脆没做完 [2]。AI 要是提前停止思考,后果基本都是翻车。
所以问题的关键不是「让 AI 多想一点」,而是「让 AI 知道什么时候该多想,什么时候该行动」。这就是论文提出的自适应推理(adaptive reasoning):根据任务的复杂度和不确定性,动态分配推理资源 [2]。
这一点对科研智能体尤其重要,因为科研中的实验是真的花钱的——一次训练可能就是几百上千 GPU 小时。在行动之前,如果不确定性很高,就应该多推理、多做文献调研、多做小规模验证;如果已经有充分把握,就应该果断执行。固定的推理预算,要么在关键决策上想不清楚浪费实验资源,要么在简单问题上磨洋工浪费 token。
当然,这篇论文也有它的局限:只测了一种智能体架构和三个模型,而且 GAIA 基准的整体准确率很低(最高才 12.12%),结论的稳定性还有待验证 [2]。但它指出的方向是明确的:智能体的效率,不是比谁想得少,而是比谁想得准。
第三层能力:别只做执行者——怎么从「用工具」到「做研究」
有了稳定的记忆和合理的推理分配,智能体就能做科研了吗?还不够。普通的工具调用智能体是「给任务,找工具,完成任务」,而科研的本质是搜索——在巨大的可能性空间里,找到那些能让效果变好的改动。
AgentFold 的核心洞见就在这里:它把蛋白质折叠模型的开发,建模成了一个在可执行代码空间上的闭环搜索问题 [1]。
这是什么意思?普通智能体改代码,可能是「用户说改什么就改什么」,或者「想到什么改什么」。而 AgentFold 用的是一种类似 MCTS(蒙特卡洛树搜索,Monte Carlo Tree Search,一种通过随机采样来在巨大搜索空间中寻找最优解的算法)的策略,把昂贵的计算资源分配给那些最有希望的搜索分支 [1]。
它有内外两个循环:内循环负责「采样-演化-实验-分析」,持续生成和验证新的代码变体;外循环每 10 次迭代做一次批量更新,用综合评分函数重排搜索树的节点,调整后续搜索方向 [1]。这个评分函数不只是看损失函数,还包括一个 Critic 代理对干预合理性和风险的评估 [1]——说白了,就是在花大钱跑实验之前,先掂量掂量这个靠不靠谱。
它还有多智能体分工:去重代理避免重复实验,统一规划代理同时负责架构设计和代码实现(减少设计和实现之间的接口错配),调试代理实时监控训练并修复错误,分析代理做归因和模式挖掘,搜索代理补充文献证据 [1]。
这和普通工具调用智能体的本质区别是什么?普通智能体是「执行者」——给它一个明确的任务,它用工具完成。而 AgentFold 是「探索者」——它自己提出假设、自己验证、自己根据结果调整方向,在没有人告诉它「该改什么」的情况下,主动去搜索更好的答案 [1]。
当然,这个「搜索」还是有边界的。它是从一个已经工作的基线模型出发做局部改进,而不是从零开始发明一个全新的架构。而且提升主要集中在局部结构精度(比如 lDDT、环区质量),全局折叠质量的改善有限 [1]。
这条路之前没人走过吗?科研智能体的进化脉络
AgentFold 不是突然冒出来的,它站在一系列前人工作的肩膀上。我们可以把科研智能体的进化粗略分成三代。
第一代:调用专业工具的「操作者」。 代表是 Agent Rosetta,它把 LLM 和 Rosetta(一个经典的基于物理的蛋白质设计软件)结合起来,让智能体通过结构化环境来操作 Rosetta,完成蛋白质设计任务 [6]。这一代的特点是:智能体本身不做核心计算,而是充当「翻译官」和「操作员」,把人类的需求翻译成专业软件的指令,再把结果反馈回来。它的价值在于降低了专业软件的使用门槛,但核心能力还是软件本身的。
第二代:编排工作流的「组织者」。 代表是 BioDesignBench 这类工作中评估的智能体。它们不再只调用单一工具,而是能组合多个工具形成工作流——比如先生成候选序列,再用结构预测工具评估,再用物理工具打分 [7]。但研究发现,这一代智能体有个通病:评估太浅,很少比较不同方案,而且经常过早停止探索 [7]。它们知道用什么工具,但不知道怎么深入地做研究。强制要求它们做多指标深度评估,性能会显著提升 [7]——说明问题不是能力不够,而是行为模式不对。
第三代:闭环搜索的「探索者」。 代表是 AutoScientists 和 AgentFold。AutoScientists 用去中心化的多智能体团队,让智能体自己围绕有希望的假设组队、互相批判、共享成败经验,在生物医学和语言模型优化等任务上超过了单智能体和固定规划器的基线 [8]。而 AgentFold 更进一步,直接深入到模型代码层面,把整个开发过程变成一个闭环的代码搜索 [1]。
从「用工具」到「组工作流」再到「改代码做架构搜索」,智能体正在一步步往科研的核心环节走。
离真正的「AI 研究员」还差几步?当前边界与开放问题
说了这么多进展,也该泼泼冷水。现在的科研智能体,离真正的「AI 研究员」还差得远。我们来看看几条明确的边界。
第一,提升集中在局部,还没触及真正的范式突破。AgentFold 的提升主要在局部结构精度(lDDT、环区质量),全局折叠质量的改善有限甚至有波动 [1]。它是在一个已经工作的模型上做局部优化,而不是提出 AlphaFold 那种级别的全新范式。这就像一个优秀的工程师,能把现有系统调得更好,但还不是那个能开创新领域的科学家。
第二,依赖人工定义的状态和 schema。无论是 SKILL.state 的结构化状态,还是 AgentFold 的多智能体分工和评分函数,都需要人来精心设计 [1][3]。状态 schema 设计得好不好,直接决定了智能体的上限。现在还没有办法让智能体自己发现应该记录什么、应该怎么组织自己的记忆和工作流程。而且小模型在结构化输出上还经常出问题,比如提前覆盖状态、JSON 格式错误等等 [3]。
第三,推理的自适应还是个开放问题。我们知道了固定推理预算不好,但怎么让智能体自己判断「这一步该想多久」?现在还没有很好的答案 [2]。什么时候该停下来?什么时候该调用工具?什么时候该再多想一会儿?这些决策本身就需要智能,而这层元智能目前还很初级。
第四,还没和人类专家正面比较。AgentFold 的对比基线是独立的 Codex 提案和随机搜索,而不是人类专家的迭代改进 [1]。BioDesignBench 的研究也发现,当前最强的 LLM 智能体还是 consistently 不如专家实践 [7]。AI 改代码的速度可能很快,但在洞察力、审美、对问题本质的把握上,和人类研究员还有多大差距?我们还不知道。
还有一些更根本的开放问题:这种代码层面的闭环搜索,能不能推广到蛋白质折叠以外的其他科学 ML 系统?[1] 自我组织的多智能体团队,能不能走出计算科学,用到需要真实世界实验的领域?[8] 甚至,当智能体发现了一个有趣的现象,它能不能自己提出一个好的科学问题?
这些都还没有答案。
如果你只记住一件事
科研智能体正在从「会用工具的助手」进化成「能闭环探索的研究者」,而这个进化的核心是把科研过程建模成可执行的闭环搜索,而非简单的工具调用。
现在的它,已经能在 2000 多行的代码库里、5000 GPU 小时的预算下,找到比基线更好的模型变体 [1]。但它还只是在已知的山头上微调高度,还没能发现新的山峰。真正的「AI 科学家」?路还长,但第一步已经迈出去了。
参考文献
- AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design(arXiv、2026、全文精读)
- Don t Overthink, Don t Underthink: Toward Adaptive Reasoning in Agentic AI(arXiv、2026、全文精读)
- SKILL.state: Scalable Long-Horizon Agent Skills(arXiv、2026、全文精读)
- Reasoning about In-Context Samples for Machine-Translation(arXiv、2026、全文精读)
- SPT: Skills as Pre-Training Data for Agentic Language Models(arXiv、2026、全文精读)
- Protein Design with Agent Rosetta: A Case Study for Specialized Scientific Agents(ArXiv.org、2026、仅摘要)
- Benchmarking and behavioral characterization of LLM agents for protein design(bioRxiv (Cold Spring Harbor Laboratory)、2026、仅摘要)
- AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation(arXiv、2026、仅摘要)