AI 做决策,到底是「真聪明」还是「发挥稳」?
你可能听过 AI 能预测出行选择、管理足球俱乐部、甚至辅助医疗评估——但你有没有想过,这些看似厉害的决策,到底是 AI 真的「想明白了」,还是只是「碰巧答对」?大模型在各类决策任务中的表现,本质是能力的提升,还是稳定性、上下文管理等因素的结果?我们从几个最新研究里,能找到一些反直觉的线索。
一个反直觉发现:没训练的 AI,预测出行和训练过的模型一样准
先从一个最贴近生活的场景说起:预测一个人在某种天气下会选择什么出行方式。按常理,这得用专门在出行数据上训练过的模型才行吧?
但最近一项关于通勤出行选择的研究给出了反直觉的结果:在五分类(五种出行方式)预测任务中,专门用数据训练过的随机森林模型准确率是 69.6%,而一个完全没做过任务微调、只靠零样本提示的本地大模型,准确率达到了 69.9%——两者几乎打平 [1]。
这就很有意思了:一个「门外汉」模型,只是读了读问题描述,就能和专门训练的「专业选手」表现相当?那 AI 做决策到底靠的是什么?
当然,实际情况比这个比喻更复杂。研究里的零样本模型并不是什么都没给——提示词里包含了天气场景和出行选项的描述。但核心的反直觉点依然成立:任务特定的训练,未必是决策准确率的决定性因素 [1]。
研究还发现了另一个有趣的现象:给模型补充「这个人平时习惯怎么通勤」的信息,带来的准确率提升,远大于把提示框架从「角色扮演」改成「专家视角」的效果。比如 Gemma 3:4B 模型,加入习惯出行信息后,五分类精度从 41.3% 直接升到 64.2% [1]。换句话说,AI 预测得准不准,很多时候不是看它「会不会推理」,而是看你有没有给对关键上下文。
三智能体工作流:把「收集-处理-建模」变成流水线
那这项研究是怎么得到这些结论的?它的核心方法是一个三智能体工作流(three-agent workflow)——也就是把整个出行行为研究拆成「数据收集、数据处理、行为建模」三个各司其职的智能体,像流水线一样协作 [1]。
第一个是数据收集智能体:它本质是一个聊天机器人,用生成式天气图片(晴天、湿热、雨天、雾冷、雪天)配合问卷,让 92 名学生通勤者在五种出行方式里做选择,最终得到 454 条有效观测数据。和传统人工调查不同,这个聊天机器人用固定逻辑对话,保证了每个受访者接收到的信息完全一致 [1]。
第二个是数据处理智能体:它负责把聊天机器人输出的原始 JSON 数据,清洗、验证、重编码成结构化的数据集,排除掉缺失或不可解析的记录。这一步的关键是,三个智能体之间通过结构化数据对象交互,而不是自由的自然语言,这样整个流程是可审计、可追溯的 [1]。
第三个是数据建模智能体:它并行跑三类模型——传统的多项 logit 模型、机器学习基准(逻辑回归、随机森林),以及 9 个不同参数规模(20 亿到 350 亿)的本地大语言模型。LLM 部分还测试了四种零样本配置(两种提示框架 × 两种上下文丰富度),以及进阶的人格增强、少样本学习、视觉模型配置 [1]。
这个三智能体设计的价值,不在于某一个模型有多强,而在于它把「从收集数据到出预测结果」的整个链条自动化了。过去出行研究里,数据收集和建模往往是分开做的,而这个工作流把它们串成了一个闭环 [1]。
研究还验证了一个点:给视觉模型看和受访者一模一样的天气图片,最佳准确率能到 71.5%,比纯文本的最好成绩还高一点 [1]。这说明视觉上下文确实提供了文字描述之外的预测信息——就像人看到阴天的照片,比只读到「阴天」两个字,对天气的体感判断更具体一样。
出行预测的 AI 进化史:从传统模型到本地大模型
把这篇论文放到出行建模的发展脉络里看,会更清楚它的位置。
早在 2024 年,就有研究提出用模块化的 LLM 对话代理来做调查和访谈,解决传统人工调查成本高、扩展性差、一致性不足的问题,并且已经在出行偏好调查场景里验证了可行性 [6]。这可以看作是「数据收集端」的智能化尝试。
到了 2025 年,生成式 AI 在旅游业的应用已经覆盖了个性化推荐、动态定价、行程规划等多个环节,核心思路是用机器学习分析海量用户数据,实时预测偏好 [7]。但这时候的 LLM 更多是作为「交互界面」或「推荐工具」,还没有直接承担出行行为建模的核心任务。
同样是 2025 年,出现了专门针对出行方式选择微调的本地因果大模型 LiTransMC——这是第一个为这个任务微调的因果 LLM,在精度和分布校准上都超过了传统离散选择模型和机器学习分类器,甚至比更大的闭源模型(如 GPT-4o)表现还好 [8]。这标志着 LLM 开始从「辅助工具」变成「预测模型本身」。
而我们前面讲的三智能体工作流,则把这个趋势往前推了一步:它不仅用 LLM 做预测,还把数据收集、处理的环节也用智能体串起来,形成端到端的研究流程 [1]。更有意思的是,它证明了哪怕不做微调,零样本 LLM 也能和传统机器学习基准打平——这说明 LLM 自带的世界知识和推理能力,在出行选择这种常识性决策任务里,已经能替代相当一部分任务特定训练的作用。
当然,这个方向还远没成熟。比如目前的研究样本主要是学生群体,能不能推广到更广泛的人群和不同城市?聊天机器人调查的数据质量和受访者参与度的长期效果如何?智能体工作流能不能扩展到更复杂的出行场景?这些都是悬而未决的问题 [1]。
再看另一种决策:AI 经营足球俱乐部,越贵的模型越强吗?
如果说出行预测还是单次决策,那长期决策里 AI 的表现又由什么决定?我们来看一个更复杂的场景:让 AI 经营一家足球俱乐部 20 年。
FM-Bench 是一个专门测长期决策能力的基准:大模型代理要在 20 个游戏年、约 340–400 个决策点里,通过 26 个工具管理一家足球俱乐部——选阵容、买卖球员、谈合同、投资青训和设施,还要应对董事会的考核,搞不好会被解雇 [2]。
这个基准最特别的地方有两个:第一,评分完全由确定性引擎计算,不用 LLM 裁判也不用人类打分,结果可复现;第二,每个决策点都是全新对话,模型不能直接带历史上下文,只能靠自己写的「笔记本」跨决策点记忆——相当于把「记忆管理」本身变成了被测能力 [2]。
研究测了 15 个前沿大模型,得到了一个非常反直觉的结论:模型的表现和规模、价格、token 消耗几乎没关系。token 消耗和最终成绩的相关系数只有 -0.19,基本可以说不相关。花钱最多的模型反而排在后面,而排名第一的 claude-fable-5 反而是最便宜的三个之一 [2]。
那什么决定了成绩?是具体的管理行为。高分模型有几个共同特点:越接近 20 年终点,越少投慢回报的项目(比如青训);手里尽量不留闲置现金;合同提前续约,而不是等到期了再谈 [2]。这些都是人类管理者也懂的常识,但不是每个模型都能稳定做到。
更有意思的是「知行不一」的现象:有个模型在自己的笔记本里清清楚楚写着「闲置现金会贬值,应该拿去买年轻球员」,但到第 19 年还是攥着约 21 亿现金不动,最后排名靠后 [2]。这像极了人类知道要运动却总躺平——AI 也会「知道但做不到」。
还有一个发现:在单人赛道(对脚本对手)里,领先的模型会一直领先;但在 15 个模型直接竞争的 Arena 赛道里,联赛冠军在 10 个不同模型之间轮换,19 次赛季交接只有 2 次卫冕成功 [2]。这说明一旦对手是会自适应的智能体,「常胜将军」就不存在了——决策能力的高低,很大程度上取决于环境的复杂度。
决策的「隐形陷阱」:AI 也会复刻人类的偏见和不一致
聊完准确率和行为,我们得看看决策的另一面:AI 会不会也有人类那样的认知偏差?
一项关于神经发育障碍评估的研究,对比了 35 名人类专家(18 名医生、17 名心理学家)和 7 个主流大模型在残疾支持资格判定中的表现 [3]。
研究发现了一个比「准确率」更根本的问题:不管是人类专家还是大模型,功能水平评分和支持资格决策之间都没有显著关联。按常理,一个人功能越差,越应该拿到长期照护支持,但实际情况是,功能水平差不多的人,可能得到完全不同的资格判定——这种「说一套做一套」的不一致性,比大家常担心的锚定效应、刻板印象这类偏差更根本 [3]。
更值得注意的是 AI 的「还原主义偏见」:在解释「基本生活需求」时,多数心理学家会考虑沟通、社交、情感这些维度,而多数医生和大模型只想到吃饭、穿衣、走路这些生理自理能力 [3]。换句话说,AI 把医学界主流的窄化理解直接「继承」了下来,反而没法提供不同视角的第二意见。
还有一个反直觉的点:大模型在「智识谦逊」(也就是承认自己可能错)的问卷上得分比人类专家高很多(平均分 41 vs 29),但这种「嘴上的谦虚」完全没转化为更一致的决策——它们照样会出现前后矛盾的判定 [3]。这说明「声明层面的态度」和「实际的决策行为」之间,可能隔着一条巨大的鸿沟。
当然,这个研究也有它的局限:样本量不大,案例是虚构的,LLM 只用了默认温度和三次迭代,没有用上下文学习或角色提示——这些因素都可能改变结果 [3]。但它提出的问题很重要:评估 AI 决策,不能只看对不对,还要看它的决策逻辑和人类的价值观是否一致,有没有把人类社会里的偏见也一并学过来。
「会思考」的 AI 到底强在哪?鲁棒性,而非新能力
前面几个例子都指向一个猜测:AI 决策能力的提升,可能不是因为它「变聪明了」,而是因为它「变稳了」。这个猜测在一项关于心智理论的研究里得到了直接验证。
心智理论(Theory of Mind, ToM) 是指理解他人信念、意图、情绪的能力,是人类社会认知的核心。最近推理型大模型在 ToM 测试上表现很好,有人就说 AI 获得了新的认知能力 [4]。
但这项研究通过提示扰动实验发现:推理模型的优势,主要来自**鲁棒性(robustness)**的增强——也就是面对提示词的微小变化、任务表述的调整,它更不容易翻车,而不是获得了什么全新的、专属的 ToM 能力 [4]。
打个比方:同一个学生,以前考试一换题型就发挥失常,现在学会了先在草稿纸上理清楚思路再答题,分数就稳定多了——但他脑子里的知识总量其实没怎么变 [4]。推理模型的「思考过程」,起的就是这个「草稿纸」的作用。
研究里有个很有意思的反直觉例子:儿子打扫厨房碰翻面粉弄得一团糟,父亲进门说「哇,现在可真干净啊」——人类一眼就能看出是讽刺,但多个 AI 却认真认为父亲只看到了干净的那半边,因为它们没法在脑子里「看见」整个厨房的混乱场面 [4]。这说明 AI 的「心理表象」能力还有明显短板,鲁棒性的提升也有边界。
还有一个证据:推理模型和非推理模型的差距,在那些严重惩罚不一致性的基准上最大 [4]。换句话说,推理模型赢在「少犯低级错误」,而不是「能解决更难的新问题」。
这其实和我们前面看到的出行预测、足球管理的现象是串得起来的:零样本 LLM 能和训练过的模型打平,是因为它已经有了足够的常识知识,只是需要稳定地提取出来;高分足球经理模型赢在行为一致性,而不是掌握了什么别人不知道的秘籍;医疗评估里的问题,本质也是一致性不足——功能评估和资格判定之间没有稳定的对应关系。
长决策的新解法:让 AI 「刷新状态」接力思考
既然鲁棒性和一致性这么重要,那有没有办法主动提升?一个思路是从「状态管理」入手——不要让 AI 带着一长串历史记忆一口气跑完,而是让它分段接力,每次都以「全新状态」上阵。
这就是链式递归语言模型(Chained Recursive Language Models, Chained RLM) 的核心想法 [5]。
常规的长上下文推理,是让一个模型单次处理所有信息,这就像你读一本超长小说,读到结尾时已经忘了开头的细节,或者一开始记错了一个人物,后面越错越离谱——这个问题叫「上下文腐烂(context rot)」[5]。
而 Chained RLM 的做法是:把任务拆成一串「根(root)」调用,每个根都是同一个模型的全新实例,都能看到原始问题和全文,但不继承之前的完整对话历史。它们之间只通过四类纯文本状态传递信息:黑板(紧凑工作记忆)、工件集(任务特定的详细证据文件,比如事件台账、提取表)、前任交接摘要、近期工作摘录 [5]。
这个设计有点像接力赛:不是一个人跑完全程,而是同一个模型「刷新状态」后接棒跑下一段,每棒之间只交一张小纸条、一块白板和几本台账,避免带着前面的混乱记忆继续跑 [5]。
效果怎么样?在四个长上下文基准上,Chained RLM 比常规单次推理平均提升了 13.75 个百分点的准确率。尤其是在最难的 OOLONG-real 基准上,常规方法准确率只有 14%(几乎瞎猜),而链式方法能到 38%——翻了近三倍 [5]。
当然,代价也是有的:平均每个任务要调用 2.6 次模型,输入 token 量翻了一倍,成本涨到约 2.5 倍 [5]。这是一个典型的「用计算换准确率」的权衡。
而且这个方法也不是完美的:比如系统不强制根在最终回答前必须读取工件,可能出现过早提交;如果第一个根写了错误的初始工件,后续根可能保留错误而不是纠正;整个链条还可能「漂移」——后期根忽略前面的好工作,重启到更差的状态 [5]。
但它的思路和前面的三智能体工作流是呼应的:把复杂决策拆成多个专门化的步骤,通过结构化的状态传递来管理信息,减少单次推理的认知负荷,从而提升整体的稳定性和准确性。
回到最初的问题:AI 决策的「实力」该怎么衡量?
聊了这么多研究,我们可以回到开头那个问题了:AI 做决策,到底是「真聪明」还是「发挥稳」?
从目前的证据来看,答案更偏向后者——至少在我们讨论的这些任务里,决策表现的差异,更多来自鲁棒性、记忆管理、上下文利用、行为一致性这些「稳定性因素」,而不是知识量或推理能力的本质飞跃。
出行预测里,零样本 LLM 能和训练过的随机森林打平,说明模型已经有足够的常识,关键是能不能稳定地用对上下文 [1];足球管理里,越贵的模型不一定越强,赢的那些是因为能坚持做正确的事,不犯低级错误 [2];医疗评估里,最大的问题不是准确率不够,而是决策不一致和价值偏见 [3];心智理论研究直接告诉我们,推理模型的提升主要是鲁棒性增强 [4];链式递归模型则用实验证明,通过更好的状态管理,就能大幅提升长决策的准确率 [5]。
这意味着,我们评估 AI 决策能力的时候,不能只看「准确率」这一个数字。至少还要看几个维度:
- 鲁棒性:换个问法、改点细节,还能答对吗?
- 一致性:同样的情况,前后决策一致吗?功能评估和最终决策对得上吗?
- 可解释性:它给出的理由和它的实际决策是一致的吗?还是「嘴上说一套,实际做一套」?
- 偏差与价值观:它的决策逻辑里有没有隐藏的偏见?和我们的社会价值取向一致吗?
- 成本效率:为了这点准确率提升,多花几倍的计算资源,值不值?
当然,现在下结论还为时过早。这些研究各自只覆盖了特定的任务和场景,样本量也有限。AI 决策能力的本质,还需要更多、更严谨的实验去揭示。但至少有一点是明确的:把 AI 决策的进步简单等同于「变聪明了」,是一种误导。很多时候,它只是「发挥更稳了」——而稳定,本身就是一种强大的能力。
如果你只记住一件事
评估 AI 的决策能力,别只盯着「准确率」。鲁棒性、一致性、记忆管理和价值对齐这些「看不见的素质」,往往才是决定 AI 在真实世界里能不能靠谱干活的关键。
参考文献
- An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction(arXiv、2026、全文精读)
- FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents(arXiv、2026、全文精读)
- Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment(arXiv、2026、全文精读)
- Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning(arXiv、2026、全文精读)
- Chained Recursive Language Models for Multi-Iteration Reasoning(arXiv、2026、全文精读)
- Modular Conversational Agents for Surveys and Interviews(arXiv (Cornell University)、2024、仅摘要)
- Transforming Travel Benefits through Generative AI: A Machine Learning Perspective on Enhancing Personalized Consumer Experiences(Journal of Artificial Intelligence & Cloud Computing、2025、仅摘要)
- Towards Locally Deployable Fine-Tuned Causal Large Language Models for Mode Choice Behaviour(ArXiv.org、2025、仅摘要)