Chunlin 的论文科普

AI交易员为何谈不拢价格?

当AI走进经济学实验室:一场关于讨价还价的实验

想象一个热闹的菜市场:买家想压低价格,卖家想抬高价格,双方一次次地报价、还价,最终在一个双方都能接受的价格上成交。经济学里有个经典理论——在充分竞争的市场中,这种反复博弈会推动价格趋向一个”均衡点”:在这个价格上,愿意买的人数恰好等于愿意卖的人数,市场资源得到最有效率的配置。

1962年,经济学家 Vernon Smith 设计了一个精巧的实验来验证这个理论。他把一群人关进实验室,随机分配成买家和卖家,每人发一张”底牌”——买家手里的卡写着”你最多愿意花多少钱买”,卖家手里的卡写着”你最少愿意卖多少钱”。然后让他们自由报价、自由交易。结果令人惊叹:仅仅经过几轮交易,市场价格就稳定地收敛到了理论预测的均衡点附近。这个实验后来成为行为经济学的地基,Smith 也因此获得了诺贝尔经济学奖。

现在,想象这个市场里的交易员不再是人类,而是一群大语言模型(Large Language Model,LLM)——就是 ChatGPT 背后的那种 AI。它们会怎样讨价还价?会像人类一样达成均衡价格吗?还是会陷入僵局、各说各话?

这正是 2026 年一篇名为 Competitive Market Behavior of LLMs 的论文试图回答的问题 [1]。研究者用 LLM 智能体完整复刻了 Smith 的双向拍卖(double auction)实验:11 个 AI 买家、11 个 AI 卖家,每人拿着自己的保留价格,在一个持续开放的订单簿上反复报价。每个智能体只知道自己的底牌、当前市场最优报价和自己的交易历史,不知道均衡价格在哪里,也不知道全局供需关系——和当年的人类被试知道得一样多。

结果出乎意料:AI 交易员们远没有人类那么擅长做生意。人类被试在 5 轮交易后,成交价格的标准差(衡量价格离散度的指标,叫 α)从 11.8 稳步下降到 3.5,价格几乎贴住了均衡点。而 LLM 市场的价格离散度始终居高不下,甚至逐轮震荡、毫无收敛趋势 [1]。换句话说,AI 们吵了半天,始终谈不拢一个大家都能接受的价格。

更耐人寻味的是,研究者测试了三个不同规模的模型——一个”大号”、一个”小号”、外加 Google 家的一个大模型——结果发现,最小的那个模型反而表现得最好。

AI交易员的困境:大模型为何”想太多”而小模型更靠谱?

先交代一下实验的细节,因为这直接关系到结论的可信度。

研究者用的是”持续双向拍卖”(Continuous Double Auction,CDA)机制——这是全球股票交易所实际使用的撮合方式。规则很简单:买单和卖单挂在订单簿上,新报价必须比现有最优报价更有竞争力才能挂上去;如果新报价直接穿越了买卖价差(比如买家报价高于卖家最低要价),就立即成交 [1]。每个模型在 10 个随机种子下独立跑了 10 次实验,每次最多迭代 300 轮,温度参数设为 1(意味着输出有一定随机性,不是每次都选最确定的答案)。

衡量市场好坏有两个关键指标:价格离散度 α(成交价围绕均衡价波动的程度)和配置效率(实际达成的总盈余占理论上最大盈余的比例)。人类市场的配置效率很高,且逐轮提升。而 LLM 市场的表现,可以用三个词概括:不收敛、不对称、反直觉。

最反常的发现是”规模悖论”:最小的模型 GPT Small(gpt-5.4-mini)反而最接近人类行为。它的市场平均成交价从第一轮的 $2.33 逐步降至第五轮的 $2.13(均衡价是 $2.00),配置效率从 0.79 升至 0.91——虽然仍达不到人类水平(人类第五轮的 α 是 3.5,GPT Small 是 11.7,约为人类的 3 倍),但至少表现出了人类式的”逐轮学习、逐步收敛”趋势 [1]。

而最大的模型 GPT Large(gpt-5.4)表现最差:每轮只有 2.2 到 3.8 笔交易(理论均衡应有 6 笔),配置效率低至 0.36 到 0.67——这意味着市场上超过一半的”互利交易机会”被白白浪费了。为什么?因为 GPT Large 的智能体太”死守利润”了。它们每次只肯把报价改善 $0.01,像挤牙膏一样一点点让步,死活不愿一步到位穿越价差去成交,结果一轮结束还没谈拢 [1]。

第二种反常是”锚定效应”的极端表现。在 GPT Large 的市场里,研究者发现一个有趣的现象:第二个行动的一方(比如第一个报价是买方出的,卖方接着出价),几乎总是把自己的报价直接钉在保留价格上——也就是利润为零的底价。仅仅因为第一个报价”锚定”了它的心理预期,它就放弃了所有谈判空间 [1]。这像极了行为经济学里著名的锚定效应(anchoring effect)——人类也会被第一个出现的数字影响判断——但 LLM 把它发挥到了极致,几乎完全丧失了议价能力。

第三种反常是”角色不对称”。在 GPT Small 的市场里,卖方 90% 以上的挂单改进都是 $0.01 的微小让步,而买方近 40% 的改进幅度超过 $0.25;卖方提交的订单数量是买方的约 3 倍,但成交率却低得多 [1]。也就是说,AI 卖家在疯狂地”刷单”却不肯真正让利,AI 买家反而更愿意一步到位。这种系统性偏差在人类实验中从未出现过——人类买卖双方的行为基本是对称的。

为什么会这样? 论文提供了一个”窥探 AI 内心”的窗口。只有 Gemini Large 模型会暴露内部的推理痕迹(Chain-of-Thought,思维链),研究者对这些文字做了词频分析,发现了一个精准的模式:当智能体还在犹豫、决定”继续小幅调价”时,它的推理里充满了”策略”(strategic)、“优化”(maximize)、“增量”(increment)这类词;而当它决定”穿越价差、立即成交”时,词汇切换成了”立刻”(immediate)、“锁定”(secure)、“执行”(execute)、“确保”(lock)[1]。

这个发现给了我们一个非常直观的画面:大模型之所以谈不拢价格,是因为它们陷入了”过度思考”的困境——满脑子都是博弈论式的精算,反复权衡”我该不该让步""对方会不会得寸进尺”,结果在犹豫中错失了成交窗口。而小模型可能因为”脑子不够用”,反而更凭直觉行事,更接近人类的实际谈判行为。当然,这只是一种合理的推测——论文只在一个模型上观察到了这种词汇转变,它是否普遍成立、是否真的是”过度思考”导致交易失败,还需要更多证据。

论文作者自己也谨慎地指出,实验设计并不能直接证明”模型越小越会交易”——因为 GPT Large 和 GPT Small 之间不仅规模不同,训练数据、对齐方式也可能有差异,这些变量没有被单独隔离。要确证规模效应,需要专门的对照实验 [1]。

从实验室到真实世界:AI经济行为的研究脉络与未解之谜

Competitive Market Behavior of LLMs 并非第一个让 AI 进入经济实验室的研究。把它放在时间轴上,能看到一条清晰的研究脉络。

早在 2024 年,一项题为 An Experimental Study of Competitive Market Behavior Through LLMs 的研究就发现,当时的 LLM 在模拟市场中完全无法达成竞争均衡,缺乏人类交易者的动态决策能力 [6]。那篇论文更像是一个”可行性测试”——证明 LLM 可以用来跑市场模拟,但也暴露了它们的根本短板。同年提出的 GLEE 框架则更进一步,把 LLM 放入一系列两人顺序博弈(如讨价还价、最后通牒游戏)中,系统性地测量它们的理性程度、效率与公平性,发现模型选择和游戏参数会以复杂的方式交互影响经济结果 [7]。到了 2025 年,TraderTalk 用 LLM 构建了一个”生成式智能体模型”,模拟英国国债市场的双边交易对话——它成功复现了真实市场中”交易意图多、实际成交少”的比率(约 4.61%),但也坦承 LLM 在数值推理和理解隐含交易规则方面有明显短板 [8]。

Competitive Market Behavior of LLMs 的独特贡献在于:它复刻的是经济学史上最经典、最干净的市场实验(Smith 的双向拍卖),并且揭示了此前研究未曾注意到的规模悖论——不是模型越强越好,而是小模型反而更接近人类行为 [1]。

但这项研究也留下了一连串未解之谜。作者自己明确承认了几个局限:

第一,为什么小模型更好? 论文无法回答。GPT Small 表现更好可能源于规模、训练数据、对齐方式等多重因素,实验设计无法隔离这些变量 [1]。

第二,这是双向拍卖独有的现象吗? 论文只测试了这一种市场机制。在单边拍卖、议价博弈或其他市场制度下,LLM 的行为模式可能完全不同。作者甚至指出,他们的结果与 2024 年另一项研究(Jia and Yuan)的”完全不收敛”结论存在差异,他们推测是订单簿实现方式的不同导致的,但没有做同模型下的消融实验来验证 [1]。

第三,更长的模拟时间能救大模型吗? 实验中每轮最多迭代 300 次,5 轮交易。GPT Large 的收敛速度如此之慢,也许给它更多时间、更多轮次,它最终也能学会交易?作者承认这有可能,但认为”收敛速度慢”本身就是重要的负面结果——毕竟真实市场的交易机会稍纵即逝,没有谁会等你思考 300 轮 [1]。

第四,推理痕迹分析只覆盖了一个模型。 只有 Gemini Large 暴露了内部思维链,GPT 系列默认隐藏推理过程。词频分析发现的”从策略到紧迫”的词汇转变,是否适用于其他模型,无从得知 [1]。

还有一个值得注意的盲区:论文只测试了一种提示词模板。提示措辞对 LLM 行为的影响是巨大的——比如研究者告诉智能体”任何条件下都不得高于保留价买入”,这句指令本身就可能极大地压缩了谈判空间。但论文没有做提示词的消融实验。

这些开放问题指向一个更深层的思考:LLM 作为经济主体的”错位”到底出在哪里? 从行为经济学的视角看,人类在市场中的成功谈判依赖的不仅是理性计算,还有一系列社会直觉——何时该让步、何时该强硬、如何通过小幅试探传递信号。LLM 经过大规模文本训练,理论上”知道”这些社会规范,但一旦进入真实的策略性互动,它们要么过度精算(GPT Large 的 $0.01 挤牙膏),要么被锚定效应绑架(第二个出价者直接放弃利润),无法像人类那样在”理性”与”直觉”之间找到平衡。

当然,我们也要对这项研究的适用范围保持清醒。它只测试了三个模型、一种市场机制、一种供需结构(对称设计),样本量有限。作者自己强调,结论是”早期的一步”,不收敛究竟反映了 LLM 的根本局限还是只是收敛速度慢,仍需进一步研究 [1]。

如果你只记住一件事

把 AI 放进经济学实验室,它们会暴露一个有趣的”性格缺陷”:大模型在谈判中过度精算、死守利润,反而谈不成生意;小模型凭直觉行事,更接近人类的交易行为。这提醒我们——在模拟人类经济行为这件事上,“模型越大越聪明”的直觉不一定成立。AI 的谈判能力短板,可能不在于它不够”聪明”,而在于它太会”算计”了。


参考文献

  1. Competitive Market Behavior of LLMs(arXiv、2026、全文精读)
  2. The Interlingua Hypothesis: LLMs Translate via a Latent Task-agnostic Feature Space(arXiv、2026、全文精读)
  3. A Tri-Agent Framework for Evaluating and Aligning Question Clarification Capabilities of Large Language Models(arXiv、2026、全文精读)
  4. Separating Syntax from Language: A Mechanistic Account of Translation in Multilingual LLMs(arXiv、2026、全文精读)
  5. Scientific Agent Skills: A Library of Procedural Knowledge for Research Agents(arXiv、2026、全文精读)
  6. An Experimental Study of Competitive Market Behavior Through LLMs(arXiv (Cornell University)、2024、仅摘要)
  7. GLEE: A Unified Framework and Benchmark for Language-based Economic Environments(ArXiv.org、2024、仅摘要)
  8. TraderTalk: An LLM Behavioural ABM applied to Simulating Human Bilateral Trading Interactions(2025、仅摘要)