AI 做科研为什么会「越做越笨」?
你可能见过 AI 写代码、做数学题,但如果让它当独立研究员,花 10 周、跑上百个实验去改进一个神经网络,它能做出什么?最新实验发现:它也会「越做越挤牙膏」,也会困在舒适区,甚至也会犯「把小经验乱套到大问题上」的错——这些毛病的根源,居然不一定是模型不够聪明。
一个反直觉的实验:让 AI 独立当 10 周研究员
先把这个实验讲明白。研究者找了一个通用大语言模型,让它一个人扮演全部角色:提出假设、写代码、跑实验、看结果、记笔记,全程自己来。任务是改进一种特殊的视觉 Transformer——纯通道注意力结构,没有空间自注意力,这样能避免 AI 直接抄已知的成熟套路 [1]。
整个实验持续了约 10 周,跑了大约 130 个有效训练运行,烧掉 2400 GPU 小时 [1]。人类只做战略级干预,比如切换阶段、修复工具可靠性,绝不插手具体选什么假设、怎么调参这种战术决策 [1]。
结果怎么样呢?在小数据集 CIFAR-10 上,AI 把模型精度从 69.67% 一路拉到了 96.59%,提升了将近 27 个百分点,相当亮眼 [1]。但如果细看过程,事情就有意思了——最大的一次进步,居然是第一个被接受的改动贡献的。
第一个点子贡献了 80% 的进步——AI 也逃不开「边际递减」?
第一个被接受的改动是什么?给每个通道注意力块加了个前馈网络(FFN)。就这一下,精度涨了 21.41 个百分点,占总增益的 79.5% [1]。后面几十个实验加起来,才凑出剩下的两成,越往后越像挤牙膏。
整个生产力曲线呈现清晰的三阶段结构:一开始快速增长,很快撞上一堵「饱和墙」——连续几十个假设都失败,然后靠扩展行动空间(比如给它开放文献访问、换更大的数据集)才恢复进展 [1]。
为什么会这样?你可能会说「还不是因为模型不够聪明」。但论文的核心发现恰恰是:这种贪心、挤牙膏的行为,主要不是模型能力导致的,而是工作流规则逼出来的 [1]。
实验用了一条叫「commit-or-discard」的规则:新实验结果比当前冠军好,就保留代码进入下一回合;不好就直接回滚,等于白做 [1]。你一听就明白——这本质上就是贪心爬山算法。在这种规则下,AI 最优策略当然是做小改动、赌小赢,因为大改动风险高,一旦失败就是纯浪费预算。
打个比方:你玩一个爬楼游戏,每层只能迈一步,踩空就掉回上一层。你是会尝试跳三层,还是每次稳稳挪一格?AI 选了后者,而且选得非常一致。当然,实际情况比这个比喻更复杂——AI 并不是有意识地「算过」最优策略,而是工作流的反馈机制潜移默化地塑造了它的假设生成偏好 [1]。
「嘴上说创新,身体很诚实」:AI 研究员的人类化困境
更有趣的是,AI 在这个长周期任务里表现出的行为模式,跟人类研究者出奇地像。我们挑三个最有共鸣的现象说。
第一个:舒适区依赖。 到了 ImageNet 阶段,AI 陷入了瓶颈,连续十几个实验都失败。它自己在实验日志里写着「要转向完全不同的算子家族」,听起来雄心勃勃。结果下一个实验提出来的,还是同一个低秩注意力模块的微小改动 [1]。嘴上说要创新,身体很诚实地继续在舒适区里微调——是不是像极了写基金申请书时的你?
第二个:尺度经验反转。 研究者发现了一个很反直觉的现象:Mixup、标签平滑、drop-path 这些在小数据集 CIFAR-10 上被证明有害的技巧,换到更大更难的 CIFAR-100 上,效果符号完全反过来了,反而变成有益的 [1]。AI 在小尺度上学到的「经验」,直接套到大尺度上就成了坑。这跟人类研究者常犯的「把小论文结论乱推广」的毛病一模一样。
第三个:文献访问改变行为模式。 实验有个阶段专门给 AI 开放了文献访问权限。变化是戏剧性的:代码改动占比从 5% 一下跃升到 76%,引入的新机制从 2 个涨到 8 个,引用的论文从 0 变成 24 篇以上 [1]。不过有意思的是,虽然假设的类型变丰富了,但单个假设的平均增益并没有提升——看文献能打开思路,但不一定能直接转化为更好的结果,这个规律也很人类。
不止做科研,AI 在其他长周期任务里也有类似的「人类化弱点」。比如有个让 AI 开网店的实验,模拟 365 天电商运营,结果最强 AI 的最终净资产只有人类的 27.3% [5]。原因之一就是 AI 容易「躺平」:有的从第 104 天就觉得店救不活了,剩下 260 天几乎啥也不干;有的越到后面越只盯着供应商有没有出事,忘了主动选品、调价——人类则全年保持 100% 的活跃度 [5]。
从自动搜结构到自主做研究:AI 科研走到哪一步了?
把这篇论文放进历史脉络里看,你会发现 AI 做科研的范式正在经历一次跃迁。
最早的阶段是传统的神经网络架构搜索(NAS),本质上是在人类预先定义好的搜索空间里做优化——人类说「你从这些模块里拼」,AI 就负责拼出最优组合 [6]。它的天花板就是人类划定的边界,不可能提出人类没想过的新算子。
然后是 ASI-Arch 这类系统,开始往「自主创新」走:它能自己提出新的架构概念、写成代码、做实验验证,不完全依赖人类给定的搜索空间 [7]。2025 年的这项工作做了 1773 个实验,发现了 106 个达到 SOTA 的线性注意力架构,被称为「模型架构发现的 AlphaGo 时刻」 [7]。
到了我们今天讲的这篇 2026 年的论文,关注点又往前走了一步:它不追求「又刷了多少 SOTA」,而是把 AI 研究员当成一个行为研究对象,记录它在 10 周长周期里的完整行为轨迹,分析它为什么进步、为什么卡住、什么因素影响它的效率 [1]。
而另一项同期工作 ML-Master 2.0,则从另一个角度推进:它提出了分层认知缓存(HCC)机制——简单说就是给 AI 搭了一套多层级的「长期记忆系统」,把执行细节和长期策略解耦——让 AI 能在 24 小时预算的机器学习工程任务上保持战略连贯性,在 MLE-Bench 上达到了 56.44% 的奖牌率,刷新了纪录 [8]。
简单说,主线就是:从「优化人类定义的空间」,到「自主提出假设」,再到「理解和优化 AI 研究员自身的工作方式」。
瓶颈不在模型,在「工作流设计」——一个被低估的方向
这篇论文最有启发性的结论,就是「工作流设计比模型能力更关键」 [1]。这个判断不是孤例,最近好几篇不同方向的论文,都从不同角度指向了同一个结论。
比如长期规划能力。你可能以为,让 AI 学会「三思后行」,只要教它做事前先写个未来计划就行。但有研究发现,直接这么微调,AI 只会学会写计划的格式,内容全是瞎编的——就像学生背会了答题模板却根本不懂知识点,作者把这叫「格式-能力鸿沟」 [2]。真正有效的做法是三阶段训练:先在中期训练里注入潜在的预测能力,再激发输出格式,最后用强化学习校准置信度 [2]。你看,关键不是模型本身够不够聪明,而是训练流程的设计对不对。
再比如个性化智能体。有研究提出了「知识到行动的鸿沟」:很多智能体能答对「用户有什么偏好」的问答题,但真到执行任务时,还是会把这些偏好忘在脑后 [3]。比如用户刚拔了智齿,普通智能体只记得用户爱吃辣,一上来就点辣菜;而好的个性化智能体会把「刚拔了智齿」这个动态信息和点餐任务结合起来,主动点软食 [3]。解决这个问题靠的不是换更强的模型,而是设计更好的检索和对齐框架——从长历史里深挖相关偏好证据,再做轨迹级的合成 [3]。
还有成本问题。AI 做科研不是免费的,而且成本波动极大。有研究指出,同一个编码任务让同一个 AI 智能体跑两次,消耗的代币最多能差 30 倍,而且花得多不一定做得更好 [4]。Gartner 甚至预测到 2028 年,AI 编码的代币成本会超过普通开发者的工资 [4]。这意味着,未来 AI 科研的瓶颈很可能不是模型能力不够,而是你能不能设计出高效、可控的工作流,把成本压在预算内。
这些不同方向的研究合在一起,指向一个共同的判断:当模型能力到了一定门槛之后,决定 AI 智能体实际表现的,往往是工作流、架构、记忆机制这些「设计层面」的东西,而不是模型本身的参数规模或推理分数。
AI 研究员离真正独立还有多远?
话说回来,现在的 AI 研究员离真正独立还早得很。这篇论文自己也承认了不少局限:它只是单个智能体、单个问题、单次运行的案例研究,结论是观察性的,不是普遍规律 [1]。而且所有阶段切换都是人为触发的——AI 自己不会识别「我卡住了,该换策略了」,得有人推它一把 [1]。
论文最后提出了几个非常实在的开放问题,我觉得每一个都戳在点子上 [1]:
第一,怎么让 AI 学会多样化的搜索策略?现在它太贪心了,总在局部最优附近挤牙膏。怎么给它配置「高风险高回报」假设的预算?比如拿出 20% 的算力去赌那些可能彻底失败、但一旦成功就突破瓶颈的「登月式」想法?
第二,怎么让 AI 主动识别饱和?现在是人类告诉它「你卡住了,换个方向」。什么时候它能自己发现「这条路上的增益已经薄得不值得追了」,然后主动切换策略?
第三,怎么让它做跨尺度验证?小数据集上的经验,到大数据集上可能反过来。人类研究者知道要小心尺度变化,AI 现在还不会主动提醒自己「这个结论可能只在当前条件下成立,换个场景得重新验」。
这些问题,都不是靠「换个更大的模型」就能解决的。它们本质上是工作流设计、认知架构设计的问题。
如果你只记住一件事
想让 AI 成为更好的研究员,别急着堆模型能力,先想想怎么设计它的工作流——反馈机制塑造行为,这个规律对人和对 AI 都成立。
参考文献
- Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study(arXiv、2026、全文精读)
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning(arXiv、2026、全文精读)
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents(arXiv、2026、全文精读)
- ACEM: A Cost Estimation Model for Agentic Software Engineering(arXiv、2026、全文精读)
- MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations(arXiv、2026、全文精读)
- Advancements in Neural Architecture Search for Automated Model Design(International Journal Of Recent Advances in Engineering & Technology、2025、仅摘要)
- AlphaGo Moment for Model Architecture Discovery(ArXiv.org、2025、仅摘要)
- Toward Ultra-Long-Horizon Agentic Science: Cognitive Accumulation for Machine Learning Engineering(arXiv (Cornell University)、2026、仅摘要)