AI科学家做科研,我们能信吗?——从「黑箱干活」到「可审计推理」还差几步
你让AI帮你做个材料科学实验,它跑了三天三夜,最后告诉你「我发现了一个新规律,置信度97%」。可你翻遍了它的日志,也没搞清楚它到底提了哪些假设、做了哪些实验、为什么信这个结论——它到底是真的做了科研,还是在一本正经地胡说八道?
这个问题不是杞人忧天。随着大语言模型(Large Language Model, LLM)驱动的科研智能体越来越能干,从帮着跑模拟到自己提假设,AI正在从「科研工具」变成「科研伙伴」[6]。但伙伴的前提是可信:你得知道它脑子里在想什么,它的结论是怎么来的。
一、AI会做实验,但不会「改主意」?
先来看一个反直觉的实验结果。
最近一项研究让同样的GPT-5.5智能体去解决材料科学问题,一组用普通的「规划-执行-重规划」模式,另一组装了一套叫假设演化协议(Hypothesis Evolution Protocol, HEP)的特殊框架。结果发现,普通规划式智能体把83%的循环步骤花在做测试上,却0%的时间花在更新信念上——它忙忙碌碌做了一堆实验,却从来没有显式地说「我现在相信什么」「这个实验改变了我的什么想法」[1]。
这不是模型笨,而是当前AI科研智能体的通病:所有的假设、证据、信念都藏在杂乱的对话日志里,连AI自己都不一定能说清自己为什么得出某个结论。它可能上一秒说A假设很有希望,下一秒就去测B了,中间没有任何记录说明它为什么改了方向——是A被证伪了?还是它忘了?还是它随机选的?没人知道。
更麻烦的是,这种「黑箱干活」模式下,AI很容易陷入「自我感动式科研」:做了很多实验,走了很多弯路,但没有一条清晰的证据链把实验和结论连起来。你看到的最终结论可能是对的,也可能是它碰巧蒙到的,甚至可能是它在一堆实验里挑了符合自己直觉的结果——就像一个不写实验记录本的学生,你敢信他的毕业论文吗?
二、给AI装个「科研账本」:假设演化协议是怎么工作的
HEP的思路很朴素:既然人类科研靠实验记录本保证可追溯,那给AI也装一本「科研账本」不就行了?但这本账本不是随便写的,它有严格的格式和规则,逼着AI把脑子里的推理一步步外化出来。
这套账本的核心是HEP注册表(Registry)——一个只追加、不可篡改的事件溯源存储。你可以把它想象成科研界的「区块链账本」:每个假设都是一个带唯一ID的独立条目,记录着它的自然语言描述、智能体给它的信念值(就是AI觉得它有多大概率是对的)、当前生命周期状态,以及它是从哪来的。任何改动都只能追加新记录,不能涂改历史[1]。
光有账本还不够,还得有规矩。HEP给AI配了7个专用工具,分成三组,AI只能用这些工具来操作账本,不能随便改:
- 提出与演化组:全新提出一个假设、细化一个已有假设(相当于「子假设」)、合并多个假设、记录灵感来源(不算正式谱系);
- 测试与判定组:给假设附上证据并更新信念、流转假设状态;
- 读取组:列出所有假设、查看某个假设的完整历史[1]。
你可能会问:AI会不会乱改信念值?比如觉得哪个假设顺眼就给高分?HEP有两条铁律管住它: 第一,信念只能由通过验证门的证据改变,不能拍脑袋改。没有证据支持的想法,只能记下来,不能动信念值; 第二,状态流转有硬阈值:信念值≥0.8才能标「支持」,≤0.2才能标「反驳」,实在没法验证的就标「搁置」并写清楚原因[1]。
还有一个有意思的设计:假设也有「辈分」。细化和合并操作只能对已经有结论、或者至少有一条证据的「父假设」做,防止AI乱开脑洞、提出一堆没根没据的新假设[1]。实验结果也印证了这个设计的合理性:AI自己给不同「出身」的假设的先验置信度完全不一样——全新拍脑袋想出来的平均只有0.35,受已有假设启发的有0.56,从已验证假设细化出来的有0.70,而把多个已验证假设合并出来的,平均置信度高达0.81[1]。AI自己也知道「站在巨人肩膀上」的假设更靠谱。
当然,实际情况比这个比喻更复杂。这里的信念值本质上还是LLM自报的主观置信度,不是客观计算的贝叶斯后验——AI说自己有97%的把握,不代表这个结论真的有97%的概率是对的[1]。
三、光有账本还不够:可审计AI的三条技术路径
HEP是从「过程管理」的角度让AI的推理显式化,但可审计AI不是只有这一条路。最近的研究至少展示了三条不同的技术路径,分别从过程、评估、重构三个维度切入。
第一条路径就是HEP代表的「过程显式化」:给AI套上一个结构化的操作框架,把原本隐式的推理步骤变成显式的、可记录的操作。这就像要求科学家必须按规范写实验记录本,每一步都留痕。它的好处是实时、原生,AI每走一步你都能看见;但缺点是需要改造智能体的工作流,而且只能管框架内的操作——AI如果在框架外「心里嘀咕」,你还是看不见。
第二条路径是「实验设计量化」:把AI智能体本身当作研究对象,用严格的实验设计方法来测量它的行为规律。比如另一项研究把LLM编码智能体看作「随机模型发现算子」,用六因素全因子实验系统测量「推理努力」等因素如何同时影响输出质量、金钱成本、时间成本和过程复杂度[2]。
他们发现了一个很反常识的结果:给AI开更高的推理档位,token消耗和代码长度会翻倍甚至更多,但模型质量未必提升——在某些指标上几乎原地踏步,相当于花更多钱办一样的事[2]。更有意思的是,AI还会「自我感觉良好」:在预测任务上它对自己的打分还挺准,但在生成仿真任务上普遍严重高估自己的水平,甚至有一个花了15美元的模型,900次仿真里只有1次是符合规则的[2]。
这条路径的思路是:就算我看不到AI脑子里在想什么,我可以通过控制变量、反复实验,搞清楚它在各种条件下的行为规律和可信度边界。这就像评估一个科学家,不用读他的脑,只要看他在不同问题上的表现、成本和失败模式,就能建立对他能力的信任。
第三条路径是「事后语法重构」:不用管AI内部怎么想的,只要它输出了文本或代码,我就用语法框架把它的输出重新解析成结构化的逻辑推导,然后检查这个推导的一致性和正确性。比如最近的一项研究提出用组合范畴语法(Combinatory Categorial Grammar, CCG)把LLM的输出「提升」为带类型的组合性推导[3]。
为什么选CCG?因为CCG天生支持「前缀驱动、类型补全」的增量处理——LLM生成到「John loves」的时候,下一个词大概率是名词;而在CCG眼里,「John loves」正好是一个「还差一个名词短语就能成句」的合法片段(类型S/NP),就像一个函数等着填参数[3]。一个是统计规律,一个是语法规则,却在每一步前缀上都「想一块儿去了」。
基于这个框架,你可以做两层检查:组合层检查类型匹配和结构完整性,内容层把结构化对象对接外部知识库检查事实正确性。而且因为CCG是增量的,错误可以在句子没说完时就被抓住——比如LLM刚说到「阿兹特克神宙斯……」,系统已经能提取出「宙斯是阿兹特克的」这个断言,立刻去查知识库报错[3]。更妙的是,通过Curry-Howard对应(简单说就是「证明即程序、类型即命题」),同一个框架换一套类型系统,就能从检查英语句子变成检查智能合约代码[3]。
当然,这条路径目前还只是理论框架,还没有完整的实证评估,实际效果如何还得打个问号[3]。
四、从「能用」到「可信」:AI科研的进化之路
把HEP放进AI科研的发展脉络里看,会更清楚它的位置和意义。
AI for Science已经走过了好几代。最早的AI是纯粹的工具——你给它数据,它帮你算,比如用机器学习预测分子性质。然后有了能自主探索的智能体:给它一个黑箱系统,它能自己去试错、去发现规律,比如在原子层处理模拟中自主探索化学相互作用[7]。再后来有了端到端的自主研究引擎,能从假设生成一路做到统计验证,甚至还设计了「设计Agent」和「评估Agent」分离的架构来防止p-hacking等科研不端[8]。
但这些系统有一个共同的问题:它们的「相信什么」和「为什么相信」是隐式的。你能看到它做了什么实验、得出了什么结论,但你看不到它的信念是怎么一步步更新的,看不到假设之间的谱系关系,也看不到它为什么放弃了A而选择了B。综述里总结的「自主科学发现」五大能力和四阶段工作流[6],更多是从外部观察者的角度描述AI能做什么,而不是从内部让AI的推理过程本身变得可审计。
HEP往前迈的一步,就是把「信念管理」从隐式的黑箱操作,变成了显式的、有规则的、可追溯的一等公民。之前的AI科研智能体是「我做了,我得出结论了」;HEP智能体是「我先提出了这些假设,然后做了这些实验,根据这些证据,我把A假设的置信度从0.5调到了0.9,把B假设从0.6打到了0.1,最后合并出这个结论,置信度0.97——每一步都有记录,你可以查」[1]。
在材料科学的三个任务上,HEP智能体都走完了完整的「假设-测试-证据-信念」循环,每个任务生成10到20个假设,最大演化深度3到5代,所有假设最终都有明确结论(支持/反驳/搁置),没有悬而未决的[1]。而且基础LLM越强,HEP的优势越明显:GPT-5.5平均能生成14.7个假设、演化4.7代,而GPT-4.1只能生成4个假设、0.7代,甚至有一次运行提了3个假设全放弃了[1]。
但这一步也只是开始。作者自己也承认了好几个关键局限:证据的有效性目前靠智能体自我评估,还没有独立验证;只在机器学习原子间势的精度下做了实验,没上更准确的第一性原理计算;发现的规律是MLIP的行为,是否符合真实物理化学还没验证;而且HEP只是个脚手架,科研推理的质量主要还是由基础LLM决定的[1]。此外,目前只测了材料科学里的结构预测这一类问题,能不能推广到其他学科、其他类型的科研问题,还是未知数[1]。
五、为什么「可审计」是AI科学家的必答题
读到这里你可能会问:AI能干活不就行了,为什么非要追求可审计?
因为科学的本质不是「得出正确结论」,而是「通过可验证的过程得出结论」。一个结论哪怕是对的,如果没人能说清它是怎么来的,那它就不是科学知识——它只是个幸运的猜测。科学共同体的信任建立在可重复性、可检验性之上,AI要真正进入科学共同体,成为科学家的伙伴而不是黑箱工具,它的推理过程就必须能被人类审计、验证、质疑和建立在其上[1]。
这不是锦上添花,而是必要条件。试想一下:如果AI发现了一个新材料,但没人知道它是怎么发现的,你敢用这个材料造飞机吗?如果AI提出了一个新的医学假说,但没人能追溯它的证据链,你敢拿病人做临床试验吗?
更现实的问题是,没有可审计性,我们甚至没法判断AI到底是在做科研,还是在玩「高级过家家」——它看起来在做实验、在分析数据,但实际上可能只是在confirmation bias(确认偏误)的驱动下,找各种证据来支持自己第一个想到的假设,就像那个83%时间在做测试却0%时间更新信念的规划式智能体一样[1]。
当然,离真正可信的AI科学家,我们还有很长的路要走。HEP解决了「记录下来」的问题,但记录下来的东西对不对、质量高不高,还得靠别的方法;实验设计量化解决了「外部评估」的问题,但它只能告诉你AI在统计意义上靠不靠谱,没法告诉你某一次具体推理的细节;语法重构解决了「事后检查」的问题,但它只能检查输出的逻辑结构和事实一致性,没法管AI的探索过程[1][2][3]。
这三条路径也许最终会汇合:过程显式化让AI的推理能被看见,实验设计量化让我们知道AI能力的边界在哪里,语法重构让我们能自动检查输出的正确性。三者结合,才有可能构建出真正可信的AI科学家——它不仅能干,而且干的每一步都能被审视、被验证、被传承。
如果你只记住一件事
对科学来说,「怎么得出结论」和「结论是什么」同样重要——没有可审计性,AI永远只是工具,成不了真正的科研伙伴。
参考文献
- Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents(arXiv、2026、全文精读)
- An Experimental Design Approach to Evaluating Agentic AI s Autonomous Model Discovery(arXiv、2026、全文精读)
- From Dependency to Compositionality: A Neurosymbolic Lifting of LLM Outputs via Combinatory Categorial Grammar(arXiv、2026、全文精读)
- The JEPA Paradox in Language: The Geometry of Linguistic Alternatives(arXiv、2026、全文精读)
- Contrastive ESA: Human Evaluation of Multiple Translations at Once(arXiv、2026、全文精读)
- From AI for Science to Agentic Science: A Survey on Autonomous Scientific Discovery(ArXiv.org、2025、仅摘要)
- LLM Agents for Knowledge Discovery in Atomic Layer Processing(ArXiv.org、2025、仅摘要)
- Epsilon: An Autonomous Research Engine with Epistemic Integrity for Scientific Discovery(Zenodo (CERN European Organization for Nuclear Research)、2026、仅摘要)