大模型「幻觉」真的是缺陷吗?当我们把它当成灵感来用
你用大模型查资料时,一定遇到过它一本正经编瞎话——我们叫「幻觉」(hallucination),人人都想把它消灭。但如果反过来:幻觉其实是大模型的「创造力来源」,只要管得住,反而能用来搞科研?
一、为什么我们总想把幻觉赶尽杀绝?
先别急着反驳——觉得幻觉是坏事,完全是正常直觉。你问它一个学术问题,它给你编个不存在的论文、虚构一个实验结果,轻则浪费时间,重则误导决策。所以过去几年,整个领域的主流方向都是「消幻觉」:从检索增强生成(RAG)到事实核查,从对齐训练到解码策略,目标都是让大模型说真话、少说瞎话 [6]。
研究者甚至给幻觉做了精细分类:事实性错误、忠实性偏差、逻辑矛盾,还有多模态里的跨模态不一致、视觉过度解读等等 [6]。2024年的一篇综述把幻觉的成因追溯到了模型的整个生命周期:数据层面的知识缺口和错误信息,训练阶段的分布模仿和奖励偏差,推理时的置信度失调和提示诱导 [6]。一句话:幻觉是个系统性问题,得从根上治。
但这里藏着一个很少被追问的前提:幻觉一定是坏事吗?
2024年那篇综述其实已经摸到了这个问题的边缘——它提到,缓解策略必须结合具体场景,在可靠性和创造力之间找平衡,医疗领域容错率低,创意领域就可以松一点 [6]。但它还是把幻觉放在「需要被控制的缺陷」这个框架里。
那如果我们换个思路:大模型之所以能产生新奇的组合,恰恰是因为它不那么「老实」?如果把那种天马行空的发散能力,从「错误」重新定义成「未经筛选的灵感」呢?
二、反常识思路:把幻觉当「白日梦」,再用「执行官」管起来
2026年的一篇论文 Hallucination as a Feature, not a Defect 直接把这个反常识思路做成了系统 [1]。作者的核心直觉很简单:大模型的高熵生成(也就是我们说的「胡说八道」)就像人的白日梦——单独拿出来不靠谱,但如果后面跟着一个挑剔的「执行官」反复打磨,就能从一堆胡思乱想里淘出真东西。
当然,实际情况比这个比喻更复杂。作者明确说这只是功能类比,不是神经科学主张 [1]。他们真的搭了一套多智能体(multi-agent)架构来实现这个想法,核心叫「认识论摩擦」(Epistemological Friction)循环——说白了就是让「发散的生成者」和「 grounded 的评估者」互相对抗、互相打磨。
这套系统的流水线分三步 [1]:
第一步,领域配置:用一个低温度(也就是保守、不爱瞎编)的模型先把问题边界和「横向视角」(比如TRIZ创新方法这类跨学科思路)定下来,相当于先给白日梦画个圈,不能跑得太偏。
第二步,认识论摩擦循环(8轮):这是核心。一个高熵生成代理(温度设为1.0,属于特别能瞎编的档位)负责天马行空地提猜想;然后一个基于网络搜索的经验批判代理(温度0.5,比较务实)去查资料、挑毛病;最后还有一个低熵语义过滤代理(温度0.2,极度保守)把讨论提炼成6个核心概念,减少重复和噪音。三个角色来回迭代8次,就像一个脑洞很大的创意人员、一个爱抬杠的事实核查员、一个极度冷静的编辑,开了8轮头脑风暴会。
第三步,提取与评估:最后由一个分析型评估代理把结果整理成结构化的科学假设,并打分。
为什么要这么折腾?作者说,现在的大模型对齐做得太狠了,导致「语义过拟合与多样性坍塌」——模型越来越会说正确的话,但也越来越不敢说新奇的话 [1]。你要搞科研探索,本来就是要去找现有知识边界之外的东西,全是正确的废话反而没用。所以得把「发散探索」和「评估约束」明确拆开:生成的时候就让它使劲发散,评估的时候再用现实约束往回拉。
三、这套系统真的有用吗?——从海水淡化的三个脑洞看效果
光说架构太虚,我们来看一个具体例子:海水淡化。
论文里对比了三种条件下模型给出的方案 [1]:
第一种是直接提示——你就直接问大模型「给我想个海水淡化的新方法」。它给的答案是「固态海水电磁泵送」,听起来很酷,但仔细一想,根本没解决盐怎么分离的问题,纯纯炫技。数据也印证了这点:直接提示的结构有效性只有0.411,原创性0.389,在几乎所有维度上都是最弱的 [1]。
第二种是自我反思——让模型自己先出方案,再自己批判一遍、改进一遍。这次的方案变成了「共振声学冷冻淡化」,像样多了,至少机制上是说得通,但还是很依赖精密的主动声场设备。数据上,自我反思的结构有效性冲到了0.656,可行率0.950,甚至「结构有效且高新颖假设率」是所有条件里最高的 [1]。
第三种是完整多智能体系统——也就是刚才说的「白日梦+执行官」8轮循环。最后出来的方案是「用环戊烷包合物在7℃下排盐、靠浮力分离、再耦合LNG再气化的冷源供冷」。你不用完全搞懂这个技术细节,只要感觉到:这明显更像一个真正的工程师会认真考虑的路线——它用到了已知的物理化学机制,还结合了工业上现成的冷源,不是空中楼阁。
数据上,完整系统的原创性达到0.652,组合稀有度0.848,是所有条件里最高的;但结构有效性只有0.444,可行率0.944,反而略输自我反思 [1]。
这就引出了一个很有意思的结论:完整系统并没有全面碾压简单的自我反思 [1]。它的优势是有领域性的——在物理、工程这种有硬约束(热力学定律、材料特性、成本现实)的领域,多智能体的外部搜索和批判能把那些听起来很酷但一碰现实就碎的想法筛掉,把发散的脑洞推向更可辩护的机制。但在议会僵局这种社会科学的「软问题」上,简单的自我反思反而更有竞争力,还便宜得多 [1]。
论文还做了消融实验,把系统里的模块一个个拆掉看效果:去掉横向视角,可行率升到了1.000(最高),但组合稀有度下降了0.178——说明跨学科视角确实能带来新奇想法,但也会降低即时可行性;去掉搜索,生成的假设数量最多,但质量就下来了;去掉语义过滤,重复和噪音就多了 [1]。每个模块都对应着「原创性」和「可行性」之间的一笔交易。
四、不是只有科研:「发散+约束」思路正在多个领域生效
你可能会说,这只是科研假设生成这个特定场景的玩法吧?还真不是。「不让大模型直接出答案,而是让它在约束下做裁决/探索」,正在变成很多领域的共通模式。
比如AI危机准备领域。2026年的另一篇论文 Capability-Based Planning for AI Crisis Preparedness 提出,AI危机根本没法预测——专家对发展时间表的估计差了好几个数量级,你按「最可能发生的风险」去准备,大概率会押错宝 [2]。所以他们换了个思路:不猜哪只黑天鹅会飞来,而是系统地构建一个场景库,覆盖各种可能性(故意的/意外的、合法的/非法的、自主的/人控的等等组合),然后评估政府的每一项能力在各个场景下够不够用,最后找出不管哪种情况都得会干的「无悔能力」 [2]。
你看,这和「用幻觉搞科研」的逻辑是不是异曲同工?先最大程度地发散(穷尽各种可能的场景),再用约束来收敛(找跨场景都成立的能力)。大模型不是直接给你一个「正确答案」,而是帮你把可能性空间铺开,再用结构化的评估帮你筛选。这篇论文的试点就发现,「机构动员」和「国际联合行动」这种协调类能力,在几乎所有决策策略下都排前两位——哪怕大家对AI风险有多严重吵翻天,先把「出事了谁牵头、找谁合作」定下来,永远不会错 [2]。
再看一个更落地的领域:快递配送。2026年的 ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery 这篇论文,思路更绝 [3]。
最后一公里配送里,快递员下一单选哪个,是个非常复杂的时空决策。以前的做法要么是规则,要么是机器学习模型直接预测。那大模型能不能干?直接让大模型猜的话,效果很差——甚至还不如简单的启发式规则 [3]。
ORBITER的做法是:不让大模型直接预测,而是让它当「裁判」。先用好多个不同思路的预测模型(启发式的、机器学习的、深度学习的)分别给候选订单排序,生成一份「分歧报告」——哪些订单在争、争在哪(比如距离近但截止时间紧,还是距离远但时间充裕)。大模型只盯着这些有分歧的地方,调用专门的工具(查时空距离、查历史数据、查鲁棒性)收集证据,然后做裁决 [3]。
效果怎么样?在四个城市的快递数据上,ORBITER平均比最好的基线方法高出9.2%的ACC@1(Top-1预测准确率) [3]。而且消融实验显示:如果把提议模型去掉,让大模型直接猜,准确率暴跌近38%;但如果去掉证据推理、只做简单的分数融合,准确率也会降6%多 [3]。也就是说,专业模型打底提供靠谱候选,大模型在分歧点上用证据做仲裁,两者结合才是最优解。
你看,从科研假设生成,到公共政策规划,再到物流调度——领域差得很远,但底层模式是一样的:大模型最有价值的用法,可能不是直接给你一个正确答案,而是帮你探索可能性空间,再在约束下做筛选。它的「不靠谱」(发散、联想、组合)反而是探索的动力,只要你有办法把它拉回现实。
五、这条路之前走到了哪?——从「消幻觉」到「用幻觉」的脉络
当然,「把幻觉当特性用」不是突然冒出来的想法,它是整个领域对幻觉的理解一步步深化的结果。
最早大家对幻觉的态度就是「消灭它」。2024年那篇全面评估幻觉的综述可以作为代表:它把幻觉分成事实性、忠实性、逻辑性等几大类,从数据、训练、推理三个层面分析成因,然后梳理各种检测和缓解方法 [6]。这个阶段的默认假设是:幻觉是缺陷,越少越好。
但很快就有人意识到,事情没这么简单——你不能为了消灭幻觉把创造力也一起掐死。2025年的 Suppressing Hallucination for Trustworthy LLMs (Part IV) 提出了一个叫「层结框架」(Layer-Knot Framework)的东西,核心思路是:不用靠加数据、加对齐来硬压幻觉,而是在网络层里嵌入「语义结」来稳定含义,这样既能降低幻觉率,又不损失生成自主性和创造力 [7]。他们的实验说,幻觉率降了50%,但创造力指标保持稳定 [7]。
这篇论文的重要性在于,它明确提出了「准确性和创造力不是互斥的」 [7]——以前大家默认消幻觉就一定会牺牲创造力,但它说不对,只要方法对,两者可以兼得。这就为后来「主动利用幻觉」打开了门缝。
再往后,就开始有人尝试更激进的思路。比如2025年的 Resonant Semantic Architectures - LLM 提出了一个叫「语义压力」(Semantic Pressure)的概念,把幻觉看成是语义复杂度的一种动态表现,不是要消灭它,而是要调节它——让它在需要创造力的时候高一点,需要可靠性的时候低一点 [8]。虽然这个框架还比较偏愿景,但方向已经很明确了:幻觉不是洪水猛兽,是可以被调控的资源。
到了2026年的这篇「幻觉即特性」的论文,就直接把这个思路推到了极致:既然幻觉是高熵生成,那我们就主动用它来做发散探索,再用外部约束把它驯化成有用的东西 [1]。从「消灭幻觉」到「平衡幻觉与创造力」,再到「主动利用幻觉」——这条脉络其实反映了整个领域对大模型能力的认知升级:我们不再只把它当成一个「知识检索器」,而是开始把它当成一个「创意探索引擎」。
六、还远没到「能用」的时候:三个绕不开的问题
讲了这么多好处,得泼盆冷水——这套东西离真正实用还差得远。论文自己也承认了好几个严重的局限 [1]。
第一个问题是成本高。完整的多智能体系统要跑8轮循环,每轮都要调用好几个不同的模型,还要做网络搜索,计算量和花费比直接提示高得多。论文甚至没测每token效率、经济成本和延迟——因为肯定不好看 [1]。自我反思为什么在很多场景下能打?就是因为它便宜啊。如果多智能体系统的收益赶不上成本的增加,那就只有少数高价值场景(比如新药研发、新材料探索)才用得起。
第二个问题是验证弱。论文里的「可行性」「原创性」这些指标,其实都是另一个大模型打的分,不是领域专家评估的,更不是真的做实验验证的 [1]。说白了就是「AI说这个想法靠谱」,但AI自己也可能产生幻觉啊?这就有循环论证的味道。至于「结构有效性」,更不等于科学有效性——一个假设逻辑上自洽、有经验依据,不代表它就是对的。科学史上有太多听起来完美的理论,最后被实验证伪了。
第三个问题是泛化未知。论文只测了3个问题-种子块:两个海水淡化的,一个议会僵局的,样本量小得可怜,连作者自己都说统计效力不够,配对比较只是探索性的,不是强统计推断 [1]。物理工程领域有效,社会科学领域就不一定;这两个问题有效,换个学科(比如生物、医学、数学)还能不能行?完全不知道。
更深层的难题是:创造力到底怎么衡量? 论文用了一个复合的FCCY指数,但它也承认这只是个代理指标,不是对科学假设的最终验证 [1]。你说一个想法「原创」,到底是真的有科学价值,还是只是词汇上的新奇组合?你说它「可行」,到底是真的能做实验,还是只是听起来合理?这些问题到现在也没有公认的答案。
所以客观地说,这篇论文更像是一个「概念验证」——它证明了「把幻觉当特性用」这条路不是完全瞎想,确实能在某些场景下产出比直接提问更好的结果。但要说它能真的帮科学家做科研,还早得很。
如果你只记住一件事
真正有价值的思路,可能不是「消除大模型的幻觉」,而是「管理幻觉」——把高熵的发散生成和严格的外部约束分开,让脑洞使劲开,再用事实、逻辑和经验把它拉回地面。
参考文献
- Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses(arXiv、2026、全文精读)
- Capability-Based Planning for AI Crisis Preparedness(arXiv、2026、全文精读)
- ORBITER: Conflict-Aware Decision-Making for Agentic Last-Mile Delivery(arXiv、2026、全文精读)
- ASTELD: A Six-Axis Classification Framework for Autonomous AI Agents - Design, Evaluation, and an OpenClaw Case Study(arXiv、2026、全文精读)
- When More Becomes Less: Position-Dependent Repetition Effects in Language Models(arXiv、2026、全文精读)
- Comprehensive Evaluation of AI Hallucination and Novel UV-Oriented Framework toward Safe and Trustworthy AI(2024、仅摘要)
- Suppressing Hallucination for Trustworthy LLMs (Part IV): Semantic Integrity and Autonomous Meaning Flow(PhilPapers (PhilPapers Foundation)、2025、仅摘要)
- Resonant Semantic Archictures - LLM(Zenodo (CERN European Organization for Nuclear Research)、2025、仅摘要)