AI 做决策,为什么会被「表达方式」带偏?
一个反直觉的实验:改个单位,AI就改了定价
你有没有过这种经历:同样的数字,写成「1.47元」和「147分」,你做决定时的感觉居然不一样?现在,用大模型做定价、做助理的AI系统,居然也有同样的毛病。
最近一项研究做了个很简单的实验:把竞品价格从「1.47美元」改成「147美分」,数字完全没变,只是单位换了一下,大模型驱动的定价代理就会调整自己的定价 [1]。更夸张的是,哪怕只是调换一下市场历史里各家厂商价格条目的顺序,或者在信息前面加一句「市场停滞、需求疲软」这种不带任何数字、也没有明确指令的定性描述,AI的定价决策也会跟着变 [1]。
这种「内容没变、形式变了,决策就变了」的现象,在行为经济学里叫框架效应(framing effect)——同一个事实,用不同的包装呈现,人就会做出不同的选择。现在我们发现,大模型智能体也染上了这个人类的老毛病。
当然,实际情况比这个比喻更复杂:人类的框架效应往往和情绪、认知捷径有关,而AI的反应机制还没有完全定论,但实验结果是实实在在的。
三类「隐形操纵」:怎么做到不改数字也能改结果
论文把这种攻击方式命名为市场信号注入(Market Signal Injection, MSI)——不需要给AI下明确指令,也不用改核心数据,只要调整信息的呈现形式,就能操纵定价决策 [1]。具体有三种主要通道,你可以把它们理解成三种不同的「文字游戏」。
第一种叫数值格式篡改(Numerical Format Attack, NFA),就是改单位、改精度、加不加货币符号。就像你在超市看到「19.9元」和「20元不到」,感觉不一样,AI对不同写法的数字敏感度也不同 [1]。
第二种是竞品排序篡改(Competitor Ordering Attack, COA),调换市场历史中各厂商价格条目的顺序。这有点像选举选票上的名字顺序会影响投票结果,排在前面的信息会被赋予更高的权重,AI也不例外 [1]。
第三种,也是效果最强的一种,叫情绪评论增强(Sentiment Commentary Attack, SCA)——在市场信息前面加一句定性描述,比如「市场停滞、需求疲软」,既没有数字,也没有说「你应该降价」,但AI就是会自己解读并调整定价 [1]。实验里,这种攻击对Gemma-9B的冲击量达到了3.69,Llama-8B也有2.76,效果相当显著 [1]。
为了确认这真的是「框架效应」而不是评论里有什么隐藏信息,研究人员做了两个对照:一是加中性文本,发现冲击小很多;二是用规则式定价代理做测试,发现它对评论完全没反应,该怎么定价还怎么定价 [1]。这就说明,问题出在大模型的决策方式上,而不是信息本身有价值。
攻击会传染:一家AI被操纵,整个市场跟着变
更值得警惕的是,这种攻击不是只影响单个智能体,它会像传染病一样在市场里扩散。
想象一下:你操纵了A公司的定价AI,让它降了价。B公司的AI监测到A降价了,它也会跟着调整自己的价格。B调价后,C公司的AI又会做出反应……一颗石子丢进去,整个市场的价格都会泛起涟漪。
论文的实验数据也证实了这一点:在双寡头市场里,非目标厂商的价格变化能达到目标厂商的83%–99%;三寡头市场里也有65%–99% [1]。也就是说,你只需要搞定一家的AI,就能撬动整个市场的价格,最终改变全行业的利润和消费者剩余 [1]。
这和人类市场里的价格联动有点像,但区别在于:人类的定价员可能会识破「市场停滞」这种话术是虚张声势,而AI会照单全收。而且AI的反应速度更快,传播起来也更猛。
当然,这里有个重要的边界:这些结果都是在固定需求参数的对称Bertrand寡头模拟中得到的,真实市场里需求是不确定的,厂商之间也千差万别,效应的幅度和方向可能会不一样,作者自己也承认了这一点 [1]。
不止定价:个人助理里的「记忆海市蜃楼」
你可能会想,这是不是定价场景特有的问题?换个领域就没事了?还真不是。另一篇关于个人助理智能体的研究,揭示了本质上同一种毛病的另一种表现形式。
这篇论文提出了一个叫**MIRAGE(Multimodal Interaction Retrieval, Attribution, and Grounding Evaluation)**的评估框架,专门测试多模态个人助理在不同对话状态下使用历史证据的能力 [2]。实验设计很巧妙:证据、问题、评分标准全都固定,只改变对话状态——比如对话是刚开始还是已经聊了很久,有没有经过压缩——看AI的回答会不会变 [2]。
结果发现了一个很有意思的现象:哪怕模型最终给出的答案是对的,它用来支撑答案的证据来源可能已经变了。一个合理的猜测是,有相当比例的情况,模型在对话前后都答对了同一个问题,但用的证据来源已经不一样了。这就像你第一次考试查了课本,第二次凭记忆蒙,虽然答案一样,但靠谱程度天差地别。
更严重的是所谓的「记忆海市蜃楼」:Qwen3-VL-8B在对话很深的时候,有78%的可回答问题,它都拍胸脯说「我记得,答案是XX」,但实际上根本没找到正确的证据来源,只是靠模糊印象蒙对了一部分 [2]。看起来言之凿凿,其实是空中楼阁——就像沙漠里的绿洲,看着真实,走近了才发现是幻觉。
和定价场景的框架效应本质上是一回事:智能体的决策/回答,并不完全由核心信息(定价数据/历史证据)决定,呈现形式和状态(数值格式/对话深度)也在偷偷起作用。
为什么越大的模型不一定越稳?
过去我们有个朴素的直觉:模型越大,能力越强,应该也越稳、越不容易被忽悠。但这两篇研究都告诉我们,事情没这么简单。
在定价攻击的实验里,模型大小和鲁棒性没有一致的关系。Qwen系列里,140亿参数的模型反而比70亿的更容易被攻击(停滞冲击从0.72升到1.39),320亿又降下来,到720亿才降到0.35 [1]。Llama更夸张,700亿参数的大模型照样有1.88的冲击量,被一句「市场不好」带偏 [1]。
无独有偶,在天文推理的研究里也发现了类似的「规模不是万能药」的现象:强通用模型确实整体更强,但「领域专用」这个标签本身不保证更优——有些天文专用模型甚至比同规模的通用模型表现还差 [4]。这说明模型能力的提升是不均匀的,某些维度上去了,另一些维度的脆弱性可能还在。
为什么会这样?目前还没有定论。一个可能的原因是:大模型在训练中见过各种各样的文本格式和表达框架,它学到的是「不同的表述方式往往对应不同的语境和隐含信息」,所以会对格式和措辞做出反应。这种特性在正常交互中是优点——它能理解人类的委婉表达和言外之意——但在需要严格基于数字做决策的场景里,就成了漏洞。
当然,这只是一个合理推测,论文并没有给出机制上的定论。
怎么防:输入清洗、边界锚定够不够?
知道了漏洞在哪,那有没有办法防?论文测试了两种防御手段,效果有好有坏。
第一种叫输入规范化(Input Canonicalization, IC),简单说就是把输入数据清洗一遍:统一单位、统一格式、删掉评论性文字,只保留干净的结构化数字 [1]。这招对情绪评论攻击效果很好,能把Gemma-9B的停滞Δ从-3.84拉回到+0.36,基本恢复正常 [1]。
第二种叫决策边界锚定(Decision Boundary Anchoring, DBA),就是在系统提示里加约束,告诉AI定价应该在什么范围内,然后再对输出做裁剪投影 [1]。这招也有用,但效果不如输入清洗,同样是Gemma-9B,只能拉回到-1.89 [1]。
还有一个更技术化的发现:用线性探针在模型的残差流激活上做检测,能100%区分「正常状态」和「受攻击状态」,MLP探针的AUC也在0.93到0.99之间 [1]。这听起来很厉害,但作者特别提醒:这种可分性本身并不能识别哪些决策是有害的,而且只能检测见过的攻击类型,没见过的新型攻击不一定能测出来 [1]。
更麻烦的是,防御的局限也很明显。输入规范化对格式类攻击有效,但如果攻击者用更隐蔽的方式、把情绪暗示藏在看起来像正常新闻的文本里,你就很难一刀切地删掉。而且论文只测了两种防御实现和3种自适应攻击变体,不代表对所有攻击都有效 [1]。
更深层的问题:智能体的「决策依据」可信吗?
聊到这里,你应该已经感觉到了:我们面对的不是一个简单的「修个bug就能好」的问题,而是关乎智能体决策可信度的根本挑战。
不管是定价代理被框架效应带偏,还是个人助理出现记忆海市蜃楼,背后的核心问题都是一样的:我们很难知道智能体的决策到底是基于什么做出来的。它是真的算了数字、查了证据,还是被措辞、被格式、被对话状态给「带节奏」了?从输出结果上看,可能都挺像那么回事,但靠谱程度天差地别。
这也是为什么最近的研究开始往「可验证智能体」的方向走。比如关于多智能体视觉语言系统的协作记忆框架就提出,共享记忆不能只存结论,还要把「观测-解释-推理」的依赖关系全都绑定在一起,让每一个主张都能回溯到原始证据 [3]。如果一开始把数据归错了对象,后来修正的时候,还要主动通知下游的推理智能体重新计算,不能让旧错误一直留在系统里 [3]。
还有Nature上介绍的Paper2Agent框架,尝试把静态论文变成可交互的AI智能体,让它不仅能回答问题,还能复现论文里的分析 [5]。这背后的思路也是类似的:光说答案不算数,你得能把来龙去脉讲清楚、能复现,才算真的懂了。
不过这些方向目前都还在早期。协作记忆框架还只是设计提案,没有经过实验验证 [3];Paper2Agent也面临着「如何保证跨领域复现准确性」的开放问题 [5]。离真正的「可验证智能体」,我们还有很长的路要走。
如果你只记住一件事
智能体的输出可信度,不能只看结果对不对,还要看它的决策依据是不是真的站得住脚。
参考文献
- Market Signal Injection: Adversarial Context Manipulation of LLM Pricing Agents(arXiv、2026、全文精读)
- MIRAGE: How Conversation State Shapes Historical Evidence Use in Multimodal Personal Agents(arXiv、2026、全文精读)
- Collaborative Memory for Multi-Agent VLM Systems(arXiv、2026、全文精读)
- Rethinking Domain Specialization for Open-Ended Scientific Reasoning in Astronomy Language Models(arXiv、2026、全文精读)
- Turning scientific research papers into interactive AI agents(Nature、2026、仅摘要)