AI 也会「想太多」?为什么给模型一个「选项菜单」反而更聪明
你有没有过这种经历:一道开放题你想了半天写了一堆,结果参考答案给了个简单结论,你才发现自己想复杂了。AI 居然也会犯同样的错——而且这可能是它很多任务做不好的真正原因。
我们通常觉得,AI 表现差是因为”能力不够”:参数不够多、训练数据不够大、推理不够深。但最近一系列研究发现,很多时候问题出在另一个地方:我们没有给 AI 一把清晰的”标尺”。它不知道该用多细的粒度判断问题,不知道任务的边界在哪里,于是要么”想太多”,要么”做太杂”,空有一身力气用错了地方。
一个反直觉的发现:给 AI 选项,它反而变聪明了
先从一个很生活化的例子说起。
请看两个句子:
- 她加入了网球 club。
- club 投票决定涨会费。
请问这两个 “club” 是同一个意思吗?
你大概率会说”是”——都是”俱乐部/协会”的意思。但大语言模型(Large Language Model,LLM,即基于 Transformer 架构、在大规模文本上预训练的语言模型)很可能会说”不是”:一个是”运动俱乐部”,一个是”作为决策机构的俱乐部”,怎么能一样呢?
这不是模型不懂 “club” 这个词,而是它不知道词义要分到多细。这个任务叫做 WiC(Word-in-Context,语境词义判断):给两个句子,判断同一个词在两个语境里的意思是否相同。听起来很简单,但长期以来 LLM 在这个任务上的表现都不如人意 [1]。
一篇 2026 年的论文 WiC is Not WSD: A Study on LLMs and Lexical Ambiguity Resolution 发现了一个反直觉的现象:只要在题目里额外附上这个词的几个候选义项(比如 “club:1. 协会 2. 棍棒 3. 夜总会”),模型的准确率立刻就上去了 [1]。
就像考试做选择题比做主观题容易——不是因为你突然变聪明了,而是因为评判标准明确了。你不用再纠结”我这个答案算不算对”,只要从给定选项里挑就行。
当然,实际情况比这个比喻更复杂:模型不是真的”不会做”,而是它默认的细分粒度和人类标注者不一样。给了选项,相当于把它拉到了和人类同一个标尺上。
WiC 不是 WSD:差的不是难度,是「标尺」
你可能会问:传统的 WSD(Word Sense Disambiguation,词义消歧)任务不也是判断词义吗?为什么模型在 WSD 上表现挺好,一到 WiC 就不行?
这正是这篇论文的核心洞见:WiC 和 WSD 的难度差,主要不在歧义本身,而在有没有显式的义项清单 [1]。
WSD 是给你一个句子和一个词,再给你一堆候选义项,让你选哪个对。WiC 呢?不给义项,直接让你判断两个语境里的词义”同还是不同”。表面上看 WiC 更简单,其实它多了一层隐藏的困难:你得自己决定”分到多细才算不同”。
为了验证这个想法,研究者做了一组对照实验:在同样的词义和同样的模型下,给 WiC 任务加上候选义项,看看会发生什么 [1]。
结果非常明确:
- 粗粒度 WiC 任务(使用思维链提示)上,提供候选义项后,模型平均准确率从 78.5% 升到了 84.9%,涨了 6.4 个百分点 [1]。
- 细粒度 WiC(不使用思维链提示)上也有 4.2 个百分点的提升 [1]。
- 更有意思的是,同样义项下的 WSD 任务准确率高达 92.7%,比加了选项的 WiC 还高——说明 WiC 确实比 WSD 多了一层”粒度对齐”的额外难度 [1]。
研究者还做了一个”WiC-through-WSD”的分解实验:不让模型直接判同异,而是让它先分别给两个句子做 WSD(选义项),再比较选出来的义项是否一样。这个简单的改动对小模型帮助巨大——Mistral 小模型带思维链时的准确率直接从 61.5% 飙到 82.3%,涨了超过 20 个百分点 [1]。
为什么会这样?因为模型有一种”过度思考”(overthink)的倾向:它特别喜欢说”词义不同”。数据显示,模型在粗粒度 WiC 上预测 “False”(不同)的比例高达 60.8%–69.1%,对”其实是同一个意思”的样本召回率只有 55.8%–73.8%,而对”真的不同”的样本召回率却有 93.5%–95.4% [1]。
人工错误分析更说明问题:在被判定为”模型答错了”的粗粒度样本里,有 32.5% 其实是模型有道理——它只是把词义切得比标注者更细而已。细粒度任务里这个比例更高,达到 54.3% [1]。
换句话说,很多所谓的”错误”,根本不是模型不懂词义,而是模型和人类对”词义边界该划在哪里”没有达成共识。
「想太多」不是个例:AI 世界里的「标尺缺失病」
词义判断里的”粒度问题”,其实是一个更普遍现象的缩影:AI 在很多任务上表现不佳,不是因为能力不够,而是因为判断标准或边界不明确,导致能力错位。
我们来看两个完全不同的场景。
第一个场景是多智能体协作中的”断言偏差”。论文 Message capacity and claim wording set the transition points of collective truth-finding in language-model networks 研究了一群 LLM 智能体讨论一个主张时,最后会达成什么共识 [2]。
按说讨论嘛,应该是越辩越明,真理越占上风。但实验发现了一个离谱的现象:8B 模型的集体判断,居然是跟着句子的”措辞方向”走,而不是跟着事实走。把一个错误主张加个否定词改成正确的,集体就会从一致错变成一致对;反过来也一样 [2]。
为什么?因为模型对”什么程度算成立”没有一个稳定的标尺。句子的肯定/否定措辞,相当于给了它一个默认的锚点,它就顺着这个锚点走了。研究者把这个叫做”断言偏差”(assertion bias)——主张本身的措辞设定了一个内在阈值,这个阈值甚至能压过网络讨论的动态 [2]。
更有趣的是,70B 模型身上没有检测到这种偏差 [2]。这和词义任务里的发现一致:大模型对”边界”的把握更接近人类,小模型更容易”走极端”。
第二个场景是单 Transformer 的”长序列失焦”。论文 On the Turing Completeness of Transformers and Agents 从理论上证明了:单个固定 Transformer 在输入长度无界时,是不具备图灵完备性的 [3]。
图灵完备(Turing completeness)是指一个系统能模拟任意图灵机的计算,换句话说,理论上能解决任何可计算问题。
为什么单个 Transformer 做不到?原因之一就是”标尺”的问题:序列越长,注意力的影响越分散,改中间一个 token 对末尾输出的影响会以 (log n)^层数 / n 的速度衰减 [3]。相当于一杯水滴进大海,越长大越没波澜。模型不是不会算,而是序列太长时,它”看不见”远处的信息,也不知道该把注意力的边界划在哪里。
解决办法是什么?给它一个明确的”分步标尺”——Agent(智能体)架构。把一个长任务拆成一步步来,每步只处理当前需要的信息,把结果写在内存里,再进行下一步。实验显示,同样的模型,Agent 模式做 30 步算术题,准确率比单模型高 20~35 个百分点 [3]。
你看,从词义判断到群体讨论再到长序列推理,问题的根子是一样的:没有明确的边界和标尺,再强的模型也会”失焦”。
从「想太多」到「做太杂」:多智能体的协作边界
单模型的”想太多”,到了多智能体系统里,就变成了”做太杂”——不知道哪些该分工、哪些不该分工,结果人越多越乱。
论文 Rethinking Multi-Agent Collaboration: When More Is Less 直接把这个问题做成了一个定理:多智能体协作不是万能的,它只在长程、依赖稀疏的任务上有系统优势;在紧密耦合的串行任务上,反而不如单智能体 [4]。
研究者用图论把任务建模成一个有向无环依赖图,然后提出了一个关键概念:桥边(bridge edge)——就是那些”移除后整个图会断开成两部分”的边。桥边就是任务的”天然切割线”:沿着这些线切,两个子任务几乎互不依赖,可以交给两个智能体独立做;如果乱切,每块都沾着别的块的奶油,反而更麻烦 [4]。
这个结论和词义任务的”粒度问题”简直是同一个逻辑的翻版:
- 词义任务:找对义项粒度,模型就准;
- 多智能体:找对任务切割线,协作就高效。
都是”标尺”的问题。
实验也验证了这个想法:在命令行工具链、代码仓库生成这种”一环扣一环”的紧密耦合任务上,多智能体方法普遍不如单智能体;而在深度调研、日常多步骤指令这种依赖稀疏的任务上,多智能体才有明显优势 [4]。
更反直觉的是,把智能体数量从 4 个增加到 6 个、允许更深的递归分工,任务表现不仅没变好,反而普遍下降,token 消耗却大幅上涨 [4]。这不就是我们常说的”人多瞎捣乱,鸡多不下蛋”吗?
论文 From Process Loss to Assembly Bonus: Human-Grounded Diagnosis of Multi-Agent LLM Collaboration 从另一个角度印证了这一点:AI 群体协作时,从众性比人类强得多——改答案时受同伴影响的强度几乎是人类的 1.7 倍,而且收敛得更早,少数派的正确声音很难传出来 [5]。
这背后还是”标尺缺失”:当每个智能体自己的判断标准不稳固时,就更容易被多数带偏。
回到源头:词义粒度的老问题和新挑战
说到这里,你可能会觉得”粒度”是个新问题。其实不然——词义粒度的困惑,在 NLP 领域已经折腾了几十年。
传统 WSD 任务用的是离散义项清单,比如 WordNet 把每个词的意思拆成一个个独立的”义项”,任务就是从给定清单里选正确的义项 [6]。但很早就有人觉得这不自然:现实中词义哪有那么泾渭分明?一个词在不同语境里的意思,往往是”你中有我、我中有你”的连续变化。
于是就有了 GWSA(Graded Word Sense Assignment,分级词义赋值)的思路:不再非黑即白地说”就是这个义项”,而是给每个义项打一个适用程度的分,允许多个义项同时适用 [6]。2013 年的 SemEval 任务还专门设置了分级和非分级两种词义的赛道 [8]。
也有研究尝试从用法中自动归纳词义,而不是依赖人工定义的义项清单——这样既能缓解数据稀疏问题,也能更灵活地适应不同粒度的需求 [7]。
那这次的新论文推进了什么呢?它把”粒度”从一个”词义表示”的问题,变成了一个**“任务对齐”的问题**:问题的关键不是”词义到底是离散的还是连续的”,而是”做这个任务的时候,我们到底需要多细的粒度” [1]。
模型本身可能掌握了丰富的词义信息——它知道”运动俱乐部”和”决策机构”的区别,也知道”苹果手机”和”苹果电脑”的不同。但 WiC 任务没告诉它:这些区别算不算”不同的词义”?是算呢,还是不算呢?
这就留下了两个开放问题:
- 怎么让人类标注者和 LLM 的义项边界对齐? 现在的情况是,各说各话,你觉得我错了,我觉得我对的 [1]。
- WiC 任务的最优语义粒度到底是什么? 是 WordNet 那么细,还是更粗?有没有一个”黄金标准” [1]?
这些问题现在还没有答案。
尾声:AI 的「能力」和「边界感」
我们总在谈论 AI 的”能力”:参数多少、榜单几分、能不能通过图灵测试。但这一系列研究提醒我们,能力的发挥,离不开边界感。
一个模型再聪明,如果不知道判断的标尺在哪里,它就会”想太多”——把词义切得太细、把注意力散得太开、把分工做得太杂,最后反而做不好任务。
这给了我们一个很不一样的思路:提升 AI 表现,不一定非要堆参数、加算力。有时候,只要给它一把清晰的”标尺”——一个明确的义项清单、一个分步的执行框架、一条天然的任务切割线——它的表现就能上一个台阶。
从词义判断到多智能体协作,从单模型推理到群体共识,我们看到的是同一个主题的变奏:
- 给模型选项,它就不纠结粒度了;
- 给任务分步,它就不迷失在长序列里了;
- 给协作找边界,它就不会人多瞎捣乱了。
AI 的”聪明”,不只是知道很多东西,更是知道在什么尺度上思考问题。
如果你只记住一件事
很多时候我们以为 AI 能力不足,其实是没有给它明确的判断边界。与其一味堆参数,不如学会给 AI 一把清晰的”标尺”。
参考文献
- WiC is Not WSD: A Study on LLMs and Lexical Ambiguity Resolution(arXiv、2026、全文精读)
- Message capacity and claim wording set the transition points of collective truth-finding in language-model networks(arXiv、2026、全文精读)
- On the Turing Completeness of Transformers and Agents(arXiv、2026、全文精读)
- Rethinking Multi-Agent Collaboration: When More Is Less(arXiv、2026、全文精读)
- From Process Loss to Assembly Bonus: Human-Grounded Diagnosis of Multi-Agent LLM Collaboration(arXiv、2026、全文精读)
- A Comparison of Knowledge-based Algorithms for Graded Word Sense Assignment(OPUS (Augsburg University)、2012、仅摘要)
- Making the Most of It: Word Sense Annotation and Disambiguation in the Face of Data Sparsity and Ambiguity(eScholarship (California Digital Library)、2014、仅摘要)
- Errata for SemEval-2013 Task 13: Word Sense Induction for Graded and Non-Graded Senses(2015、仅摘要)