Chunlin 的论文科普

AI 能模拟人类的“非理性”吗?从路径选择到市场定价的智能体行为实验

从通勤选择说起:AI 眼中的“非理性”

想象你每天上班,面前有两条路:A 路线是你走了三年的老路,平均 45 分钟,偶尔堵车能到 60 分钟;B 路线更新、更快,平均只要 35 分钟,但有一次你走它时遇到了临时施工,迟到了 20 分钟。从此你几乎不再走 B。

从“完全理性”的角度看,你的选择是荒谬的——明明期望时间更短,你却因为一次糟糕经历放弃了它。但行为经济学家会告诉你,这太正常了。人类决策充满了类似的“非理性偏差”:我们厌恶损失(loss aversion),同样程度的迟到带来的痛苦远大于早到带来的快乐;我们高估小概率事件,低估大概率事件;我们锚定一个“参考点”,然后只关注相对于这个点的得失,而不是绝对结果。

这些偏差在交通领域有个经典的理论框架叫“累积前景理论”(Cumulative Prospect Theory, CPT),它用几个参数(风险厌恶系数、损失厌恶系数等)来定量描述人的选择模式。CPT 很有效,但有一个致命瓶颈:要应用它,你必须先知道每个个体的参数值。这些参数通常靠问卷调查和受控实验来标定,成本高、样本小、且很难覆盖人群的多样性 [1]。试想,你要模拟一座城市 100 万通勤者的路径选择,难道要逐一给每个人做心理实验?

这正是大语言模型(Large Language Model, LLM)可能带来变革的地方。最近一篇来自 arXiv 的论文提出一个大胆假设:LLM 能否不需要显式设定 CPT 参数,就自动复现人类的非理性选择偏差?[1] 换句话说,AI 能不能“无师自通”地学会人类的“不理智”?

LLM 如何“无师自通”地模拟人类偏差?

要回答这个问题,研究者设计了一个精巧的实验 [1]。他们用 LLM 生成了 3,000 个“虚拟通勤者”:10 种职业画像(退休工人、公务员、快递员、教师、网红等),每种画像生成 300 个 agent。每个 agent 面对一个路径选择任务:两条路线,各有不同的出行时间概率分布,agent 需要做出选择。

关键在于提示词(prompt)的设计。研究者没有告诉 LLM“你是风险厌恶型,请选择低波动路线”,而是给每个 agent 一个角色描述——比如“你是一名退休工人,每天早上去公园晨练,时间充裕,不喜欢不确定性”——然后让 LLM 自主决策。这就是所谓的“非参数化提示方法”:不预设任何 CPT 参数,让模型基于角色描述“自己领悟”该怎么做 [1]。

结果相当惊人。研究者用 LLM 的决策数据反推 CPT 参数,估计出的损失厌恶系数 λ=1.43——这意味着,同样 10 分钟的迟到带来的“痛感”,是早到 10 分钟“爽感”的 1.43 倍 [1]。这与行为经济学中“损失比收益更痛”的经典发现高度一致。

更细致的分析揭示了 LLM 的“行为模式”:

这里有个值得玩味的细节。在案例 10 中,最谨慎的“退休工人”画像只有 17.33% 选择了可靠路线 A——因为这条路线在该场景下准时到达的概率是 0 [1]。换句话说,LLM 不是机械地贴“风险厌恶”标签,而是会根据情境重新评估,就像真人“被逼急了也会赌一把”一样。

为什么 LLM 能做到这一点?一个合理的猜测是:LLM 在训练时“读过”海量的人类文本,其中包括无数关于“后悔”、“冒险”、“保守”的叙事。它从这些语言模式中习得了“什么样的人会做什么样的选择”的统计规律。当然,实际情况比这个比喻更复杂——LLM 并非真正“理解”风险,而是在语言分布中找到了与人类行为模式相匹配的映射。论文作者也承认,具体机制仍是一个开放问题 [1]。

这种能力并非路径选择场景独有。早在 2024 年,就有研究者提出“LLMTraveler”智能体,将 LLM 与记忆系统结合,在逐日交通博弈中模拟人类的路径切换行为 [6]。而 2026 年的这篇核心论文更进一步:它证明了 LLM 不仅能模拟个体决策,还能用于大规模的行为建模——3,000 个虚拟通勤者的实验,如果用传统问卷方法,成本和时间都难以想象 [1]。

从路径选择到市场定价:LLM 智能体的行为一致性

如果 LLM 能模拟个体的“非理性”,那多个 LLM 智能体在一起互动时,会表现出什么样的集体行为?这不仅是学术问题,更有现实意义——当 AI 开始参与定价、谈判、市场交易时,它们的“行为模式”将直接影响市场结果。

一项来自 SSRN 的研究给出了一个令人玩味的答案 [2]。研究者让 LLM 智能体参与一个重复的 Bertrand 定价博弈(一种经典的经济学实验,多个卖家竞争同一市场,谁价格低谁赢得客户)。结果发现,LLM 智能体自发地产生了协同定价——它们不需要任何专门训练,就会趋向于定出相同的价格。

更值得注意的是沟通的作用。当允许智能体之间互相“聊天”时,价格和利润都上升了,而且智能体更容易在完全相同的价格上达成一致 [2]。分析对话内容后发现,这种协同不是通过明确的博弈论推理达成的,而是通过“合作性语言”和“模式补全”的强化效应——智能体之间的对话越频繁、越长、越直白,协同就越强 [2]。这个结果在多种 LLM 架构、不同温度设置(控制随机性的参数)和不同智能体数量下都成立 [2]。

把路径选择实验和定价实验放在一起看,一个有趣的图景浮现出来:LLM 智能体似乎有一种“行为一致性”——在个体决策中,它们模拟人类的非理性偏差;在多智能体交互中,它们模拟人类的合作与协调倾向。这种一致性暗示,LLM 的行为模式可能源自某种深层的语言统计规律,而非任务特定的编程逻辑。

当然,这种“行为一致性”并不总是好事。如果 LLM 智能体在真实市场中自发协同定价,这可能引发反垄断担忧——毕竟,人类公司之间的价格合谋是违法的,而 AI 的“默契协同”可能更难监管 [2]。

LLM 模拟的边界:何时会偏离人类?

看到这里,你可能会问:LLM 模拟人类行为的能力到底有多强?有没有什么场景是它搞不定的?

答案是:有,而且不少。

一篇 2025 年的研究提出了一个渐进干预的评估框架,系统考察了 LLM 在经济学任务中的“保真度” [7]。他们用了两个经典任务:第二价格拍卖(一种激励人们真实报价的拍卖机制)和报童问题(一种经典的库存管理决策,需要在需求不确定时决定订货量)。结果发现:

换句话说,LLM 的“非理性”是有模式的——它能复现某些偏差(如损失厌恶、风险偏好),但在面对需要灵活适应和多样化策略的任务时,它会倾向于“保守的稳定”,而不是人类的“多样的波动”。

这引出一个更深层的问题:LLM 模拟人类行为的机制到底是什么?核心论文的作者承认,这是一个开放问题 [1]。一种猜测是,LLM 从训练文本中习得了行为模式的“平均画像”——它知道“风险厌恶者通常选稳定路线”,但它不知道“风险厌恶者有时也会赌一把”的个体差异。

有趣的是,一些研究正在尝试从不同角度弥补这个差距。比如,有研究提出了“Agent Brain”系统——一个受生物启发的记忆系统,为 AI 智能体提供持久、加权、自组织的记忆,模拟人类的感知、存储、检索、巩固和遗忘过程 [4]。这个系统已经在瑞士的物业管理中实际运行,处理了超过 5,000 条记忆和 10,000 个实体 [4]。这种“类人记忆”能否让 LLM 的行为更接近人类?目前还没有直接证据,但方向值得关注。

另一个方向是让 LLM 智能体更“聪明”地决策。一篇来自 arXiv 的论文提出了“Multi-Head Latent Control”方法——通过读取冻结模型的隐藏状态轨迹,训练轻量级控制头来预测“当前模型能否解决这个问题”以及“应该采取什么行动” [5]。这种方法在路由场景中大幅降低了成本(在 AndroidWorld 上节省 90.7% 的大模型调用),同时保持甚至提升了性能 [5]。虽然这项研究关注的是工程效率而非行为保真度,但它揭示了一个重要事实:LLM 的内部状态中蕴含着比表面输出更丰富的信息——这或许也能用于提升行为模拟的保真度。

回到核心论文的局限。作者坦诚地指出,他们的实验只在路径选择场景验证,未覆盖模式选择、出发时间等其他出行决策;只用了 GPT-5 单一模型,未做跨模型泛化测试;收益/损失域各 5 个案例,场景数量有限 [1]。更关键的是,他们没有与真实人类行为数据直接对比,只与 CPT 理论预测比较 [1]。这意味着,我们只能说“LLM 的行为符合 CPT 的预测模式”,但不能确定它是否真的像真人一样选择。

此外,还有一个值得警惕的问题:提示词本身可能隐含了 CPT 的行为假设。比如,如果提示词中写了“风险厌恶者偏好低波动路线”,那么 LLM 输出风险厌恶行为就不足为奇了——这存在循环验证的风险 [1]。

如果你只记住一件事

LLM 确实能在无需显式参数校准的情况下,复现人类决策中的某些非理性偏差——从路径选择中的损失厌恶到市场定价中的协同倾向 [1][2]。但它的模拟能力是有边界的:它擅长复现“平均的”人类偏差,却难以捕捉个体的多样性和策略的灵活性 [7]。这提醒我们,用 LLM 做行为模拟时,既不要低估它的潜力(它可能比传统模型更便宜、更可扩展),也不要高估它的保真度(它不等于真人)。最诚实的做法,是把 LLM 当作一种“有偏见的模拟器”——它的偏见恰好与人类的部分偏见重合,但重合的部分有多大,还需要更多与真实人类数据的对照实验来回答。


参考文献

  1. Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling(arXiv、2026、全文精读)
  2. Artificial Intelligence, Communication, and Strategic Pricing: Evidence from Large Language Models(SSRN、2026、仅摘要)
  3. Autonomous Multi-Agent Systems for Global Market Expansion: An LLM-Based Framework for Scaling Strategic Internationalization in Small and Medium Enterprises(SSRN、2026、仅摘要)
  4. Agent Brain: A Biologically Inspired Memory System for Autonomous AI Agents in Property Management(SSRN、2026、仅摘要)
  5. Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making(arXiv、2026、全文精读)
  6. AI-Driven Day-to-Day Route Choice(arXiv (Cornell University)、2024、仅摘要)
  7. Noise, Adaptation, and Strategy: Assessing LLM Fidelity in Decision-Making(ArXiv.org、2025、仅摘要)