多智能体系统真的越强越好吗?——从「认知细胞」看集体智能的反直觉规律
你可能听过「三个臭皮匠顶个诸葛亮」,但在AI世界里,把三个大模型凑一起辩论、投票、写共享黑板,真的就能比单个模型更聪明吗?最新研究给出的答案,可能和你想的正好相反。
一个反直觉的实验:为什么「聪明模型组队反而更差」
先给你讲一个有点反常识的发现:在一组实验里,能力更强的30亿参数模型,组队投票的效果反而不如能力更弱的15亿参数模型 [1]。
这听起来像公司里的团队现象——一个全是顶尖学霸的团队,想法高度一致,反而凑不出新视角;而一群水平普通但思路各异的人,七嘴八舌反而能碰出正确答案。
当然,实际情况比这个比喻更复杂。这里的关键不是模型「聪不聪明」,而是另一个隐藏的变量:它们犯的错是不是一样的。如果十个模型都在同一道题上栽跟头,那投票十次也没用;但如果它们错在不同的地方,多数票反而能把正确答案筛出来。
问题来了:为什么以前我们总觉得多智能体一定更强?那些「辩论提升准确率」「共享黑板解决复杂问题」的说法又是怎么来的?
把「集体智能」变成可测量的物理问题:认知细胞框架
为了回答这个问题,一篇最新论文提出了一个叫**认知细胞(cognitive cell)**的研究框架,核心思路是:别再每次都换模型、调prompt、改角色设定了,我们把基本单元固定住,只改变群体的组织方式,看看集体智能到底怎么来的 [1]。
什么是认知细胞?简单说就是一个「冻结」的小语言模型——参数不动、prompt不动、接口不动,像一个物理实验里的标准粒子。研究者给每个细胞测了6个可量化的参数,组成一张「数据表」:
- 能力p:单个细胞答对题的概率
- 输出多样性D:答案的离散程度
- 错误相关性ρ(读作「rho」):两个细胞犯同样错误的概率
- 通信保真度φ(读作「phi」):传递信息时的准确率
- 可说服性η(读作「eta」):被别人说服改变答案的概率
- 记忆跨度w:能同时记住多少条信息 [1]
这个方法叫固定细胞原则(fixed-cell principle):细胞本身全程不变,只调整四个东西——群体大小、通信拓扑、消息带宽、协调协议。这样一来,集体表现的变化就真的是「组织方式」带来的,而不是因为你偷偷换了个更强的模型 [1]。
你可能会问:为什么要用小模型?因为大模型太复杂了,像一个黑箱,你分不清增益到底来自模型本身的能力还是群体交互。用小的、可控的单元,就像物理学家先研究原子再研究分子——从最简单的组合规律入手。
投票为什么有用、为什么没用:错误相关性才是隐藏变量
有了这个框架,第一个被搞清楚的规律就是:投票的增益几乎完全由**错误相关性(error correlation)**决定 [1]。
这个结论其实有个经典的理论原型——孔多塞陪审团定理(Condorcet’s jury theorem):如果每个陪审员独立判断、正确率高于50%,那么人越多,多数票正确的概率越高。但现实里没有完全独立的判断,大家总会犯类似的错。
认知细胞的研究把这个定理推广到了带相关性的情况:有效群体大小 Neff = N / [1+(N-1)ρ]。翻译成人话就是:如果错误相关性ρ是0.5,那10个细胞的投票效果只相当于约2个独立细胞;如果ρ升到0.9,10个细胞的有效数量还不到2个——基本等于白加 [1]。
这就解释了开头那个反直觉的现象:3B模型虽然单体能力更强(p=0.43 vs 0.37),但它的输出多样性骤降(D从1.27 bits降到0.38 bits),错误相关性飙升(ρ从0.58升到0.92)。按公式算,它的投票饱和点只有约1.1个有效细胞——加第二个模型几乎没增益 [1]。
更有意思的是一个反常识的发现:当温度调到1.3,单个模型答对率只有47%(低于50%的及格线),按经典投票理论人越多应该越错。但实际投票后准确率反而升到了63%。为什么?因为错误答案五花八门,正确答案反而成了最多的那一个 [1]。
另一项跨尺度研究也验证了这个规律:在8B到120B的多种模型上,投票聚合都是最稳健的默认选择,不会像其他协议那样引入系统性失败 [7]。
辩论还不如投票?交互协议的成本幻觉
那更复杂的协议呢?比如让模型互相辩论、写共享黑板、轮流修改答案——这些听起来更「智能」的方法,效果怎么样?
认知细胞的实验给出了一个有点扎心的结论:在匹配总计算成本的前提下,辩论、共享黑板、链式修订三种流行协议,都没赢过简单投票,准确率差约−0.02;如果把同样的预算花在更多独立投票上,三种协议反而差约−0.09 [1]。
什么叫「匹配成本」?就是你别让辩论用10000个token,投票只用1000个,这不公平。要比就比花同样多的计算资源,哪种方式得到的答案更准。结果是:花同样的钱,多投几次票比让模型吵架更划算 [1]。
这听起来反直觉,但仔细想想也合理——辩论过程中,模型可能会被错误的论证说服,把原本答对的答案改错了。这种「越辩越错」的现象在另一项跨尺度研究中也被观察到:基线辩论协议经常不稳定,尤其在算术任务和需要审慎验证的场景下 [7]。
当然,这个结论有它的边界。认知细胞的实验用的是小模型、封闭答案任务,而且协议实现都比较简单。在有外部可执行反馈的任务(比如写代码跑测试)里,辩论或串行验证可能反而更有用 [7]。但它至少戳破了一个流行的幻觉:不是交互越多、协议越复杂,系统就越聪明。很多时候,复杂只是贵,不是好。
什么时候多智能体真的有用:从封闭任务到开放世界
读到这里你可能会问:那多智能体系统是不是都是噱头?当然不是。关键在于:你的任务是什么类型?
在有标准答案、答案离散的封闭任务里(比如算术、多选),投票是王者,复杂协议没啥用。但在另一些任务里,多智能体的价值就显现出来了。
比如跨学科文化推理。一张艺术品的图片,你要解读它的文化象征意义——这里面视觉感知、知识库检索、网络搜索三个信息源经常打架。测试集里54%左右的题目,不同来源的答案不一致,简单投票解决不了,得靠「谁更有根据听谁的」加权机制。CM2框架就是干这个的:把人类审美认知的五个阶段拆成五个模块,各司其职再融合,弱模型用了之后准确率直接翻倍(从23.5%到50.7%),强模型也有显著提升 [2]。
再比如长周期动态决策。像电商经营这种任务,要连续做365天的决策:进货、谈判、定价、处理退货、管理现金流。这不是一道题有标准答案,而是一个持续演化的环境,你得从经验里学习、平衡短期收益和长期风险。E-Commerce Bench的测试显示,连最强的模型都有明显短板——最会赚钱的GPT-5.6 Sol,防欺诈能力排倒数第三;18个模型里有16个都不会从重复采购中学习砍价 [5]。
这种任务里,多智能体的价值不在于「投票更准」,而在于分工和专业化:一个管采购谈判,一个管销售运营,一个管风险控制,各自专注一块,再协同起来。这和人类社会的组织逻辑是一样的——你不会让三个会计投票决定产品设计,你需要不同专业的人干不同的事。
从「凑模型」到「设计社会」:多智能体研究的下一步
多智能体系统的研究正在经历一个转向:从「把几个模型凑在一起试试」,走向「像设计社会制度一样设计集体智能」。
有研究者提出,大语言模型的下一个 scaling 前沿,不是「更大的模型+更多的数据」,而是「结构化的模型社会」——性能不再只取决于参数和算力,而是团队构成、交互拓扑、制度记忆 [6]。这就像软件工程从「写小程序」到「建大系统」的跃迁:单体能力重要,但架构和组织方式更重要 [3]。
但这条路还很早期,有一堆没解决的问题。比如:
- 多智能体系统存在整合瓶颈:系统越大,协调扩张越快,但信息整合跟不上,最后变成一堆松散的思考,还容易出现极端事件。有人提出了「赤字触发整合」的方法,在整合不足时选择性加强,但这只是初步尝试 [8]。
- 现有的大多数研究都集中在短期、封闭任务上,长期、开放环境中的多智能体协作还缺乏系统研究 [4]。
- 我们甚至还没有一套统一的方法来评估持久化的AI代理——它们要在几个月、几年的尺度上持续适应和服务,而不是完成一道题就结束 [3]。
认知细胞框架的价值就在这里:它把「集体智能」从一个工程玄学,变成了可以测量、可以复现、可以预测的科学问题。就像当年化学从炼金术走向元素周期表——先搞清楚基本单元的性质,再研究它们怎么组合。
如果你只记住一件事
多智能体系统不是「韩信点兵,多多益善」,集体增益的关键从来不是模型数量,也不是协议有多复杂,而是错误的相关性和任务的类型。
参考文献
- Cognitive Cells: A Compositional Framework for Populations of Small Language Models(arXiv、2026、全文精读)
- CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework(arXiv、2026、全文精读)
- Agents in the Large: Perception-Centered Architecture for Persistent Agents(arXiv、2026、全文精读)
- A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives(arXiv、2026、全文精读)
- E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation(arXiv、2026、全文精读)
- Multi-Agent LLM Systems: From Emergent Collaboration to Structured Collective Intelligence(Preprints.org、2025、仅摘要)
- Stability Regimes in Multi-Agent Large Language Model Coordination: A Cross-Scale Empirical Benchmark(Open MIND、2026、仅摘要)
- Do Agent Societies Develop Intellectual Elites? The Hidden Power Laws of Collective Cognition in LLM Multi-Agent Systems(arXiv、2026、仅摘要)