Chunlin 的论文科普

让 LLM 当交易员,为什么越记笔记反而亏得越稳?

你见过新手股民吗?认准一个走势就死扛,越跌越补、越涨越不敢买,还总爱写交易笔记给自己的判断找理由。如果把大语言模型(Large Language Model, LLM,一种基于大规模文本训练、能理解和生成自然语言的深度学习模型)训练成交易员,它会不会也犯同样的错?最新的一组受控实验给出了反直觉的答案。

一个反直觉的实验:持有赚了钱,择时却烂透了

先问你一个问题:如果一个交易员持有股票的时候赚了钱,是不是说明他择时能力不错?

直觉上好像是。但 RetailAgent 实验里有个极端例子:某只股票日内涨了不少,LLM 交易员持有期间赚了 3.59%,看起来还不错?但它空仓的时候,股价居然涨了 14.04% [1]。

换句话说,它确实”持有赚了钱”,但它完美避开了大部分涨幅——真正涨得猛的时候它都在场外。如果用”持有区间收益减去空仓区间收益”来衡量择时质量,它的得分是惊人的 -8.67% [1]。

这里要区分两个概念:持有收益是你持仓期间赚了多少钱,择时质量是你选的入场出场时机好不好。一个人哪怕全程持有,持有收益也可能很高,但这说明他”拿得住”,不代表他”会择时”。

RetailAgent 实验的核心发现就是:LLM 交易员在纯价格决策的场景下,存在稳定的负择时——也就是系统性地在股价后续表现差的时候持有,在后续表现好的时候空仓 [1]。

当然,实际情况比这个比喻更复杂:负择时不代表一定亏钱,只是说它的时机选择在统计上是反向的。如果市场整体上涨,它可能还是赚的,只是赚得比”一直持有”少。

RetailAgent 实验:怎么证明 LLM 真的「择时烂」?

你可能会说:会不会只是刚好赶上市场下跌?或者模型总是空仓所以显得择时差?

为了排除这些干扰,论文设计了一套非常严谨的受控实验框架 RetailAgent [1]。

首先,实验给 LLM 看的是完全匿名化的日内股价路径——隐藏了股票名称、日期、绝对价格、新闻等所有外部信息,只留下价格走势本身(可以是文本描述、图表,或者两者都有)。模型每看一段历史,就要决定下一个时间区间是”long(持有)“还是”flat(空仓)“,决策之后才会揭示这段区间的实际收益 [1]。

这样做的好处是:模型只能基于价格形态做决策,不会受到任何基本面信息或品牌认知的干扰。

其次,论文用了一个关键度量:暴露匹配择时 alpha。简单说,就是先算出每个股票日里模型平均有多少时间在持有(也就是”暴露度”),然后再比较持有区间和空仓区间的收益差 [1]。这就排除了”模型总是持有”或”模型总是空仓”这种被动策略的影响,纯测”什么时候进什么时候出”的质量。

最关键的验证叫轨迹打乱测试:把模型的所有决策顺序随机打乱,但保持总持有时间不变,再重新计算择时 alpha。如果负择时只是因为”模型大部分时间空仓,而市场刚好上涨”,那打乱之后结果应该差不多。但实验发现,原始择时 alpha 是 -45.7 个基点/股日,全局打乱后只剩下 -3.5 个基点,同日打乱也只有 -8.7 个基点 [1]。

这说明什么?说明负择时真的是因为动作和收益的时序对齐出了问题——模型就是系统性地在错误的时间点做了错误的决定,而不是整体仓位偏向导致的。

而且这个现象非常稳定:14 种标准配置(不同时间尺度、不同输入模态、不同账户状态、不同模型家族)全部都是负择时,范围从 -30.5 到 -56.7 个基点不等 [1]。连传统的”涨了就卖、跌了就买”反转策略,也只能解释 LLM 择时模式的一小部分(相关性最高仅 +0.286),说明这是 LLM 自己独特的行为模式 [1]。

越记笔记越固执:自我记忆如何强化偏差

更有意思的是自我记忆实验。

研究人员给 LLM 加了一个功能:每轮决策前,先让它写一段”交易笔记”(自我记忆),下一轮决策时可以读取之前写的笔记。他们控制了可见的记忆条数 w(0 条、1 条、5 条、12 条),想看自我叙事会怎么影响决策 [1]。

结果非常反直觉:当模型能看到自己上一轮写的笔记(w=1)时,它的决策持续性变强了——每天仓位切换次数从 2.5 次降到了 1.7 次,减少了 32% [1]。听起来好像更”稳”了?但择时反而更差了:在同时使用了两种动作的股日里,择时 alpha 从 -62.8 个基点恶化到了 -74.1 个基点,多亏了 11.3 个基点 [1]。

这像极了人类的行为偏差:当你写下自己的判断和理由,你就会更倾向于坚持这个判断,哪怕新的证据已经在暗示你错了。笔记不是用来反思的,反而成了强化自己既有观点的工具。

不过这里有个有趣的细节作者没有充分解释:当记忆条数增加到 5 条或 12 条时,负择时反而略有改善,没有 w=1 时那么严重 [1]。一个合理的猜测是,更多的历史记忆让模型看到了自己之前的错误,起到了一定的纠正作用,但论文没有给出明确结论。

还要诚实说清楚这个实验的边界:它只测试了 long/flat 二选一的情况,不知道如果允许做空,会不会也有对称的错误;主要样本是中国中证 500 的股票,跨市场普遍性还没验证;不同模型的负择时幅度差异也挺大,比如 Granite 就比 Qwen 小很多,原因还不清楚 [1]。

LLM 交易员研究脉络:从「能不能赚钱」到「有没有套路」

LLM 做交易代理的研究,其实经历了几次转向。

早期(大概 2023 年左右)大家主要关心”能不能赚钱”,热衷于搭框架、加记忆、搞多智能体辩论。比如 TradingGPT 提出了分层记忆结构(长期、中期、短期)和个性化交易角色,想用更像人类的记忆方式来提升交易性能 [6]。这时候的研究更偏工程:怎么把 LLM 包装成一个能用的交易系统。

到了 2025 年左右,研究开始关注”怎么适应市场”。比如 ATLAS 框架提出了 Adaptive-OPRO 动态提示优化方法,用窗口化的反馈来动态调整提示词,比静态提示和单纯的反思机制效果更好 [7]。有意思的是,ATLAS 还发现一个现象:基于反思的反馈机制反而经常降低交易性能,因为会引入”叙事驱动的策略漂移”——模型给自己编了个故事,然后就沿着故事越走越偏 [7]。这和 RetailAgent 发现的”自我记忆强化偏差”其实是遥相呼应的。

再到最近一两年,研究开始转向”行为一致性”和”偏差分析”。比如 2026 年初的一篇研究就测试了 LLM 交易员在基本面和技术面风格之间的切换行为,发现和行为金融学理论只有部分吻合 [8]。大家不再只盯着收益率,而是开始问:LLM 交易员的行为模式到底是什么样的?它和人类交易者像不像?有没有稳定可预测的偏差?

RetailAgent 这篇论文的独特贡献,就是首次在严格受控的设置下,证明了 LLM 交易代理存在稳定的方向性负择时 [1]。不是偶尔亏钱,不是某只股票表现差,而是系统性地、可复现地在时机选择上犯方向性错误。而且这种错误还会被自我记忆强化。

更广泛的启示:序列决策代理的「行为可预测性」问题

这个研究的意义远不止于交易。

它指向了一个更根本的问题:当 LLM 作为序列决策代理时,它的行为是不是存在稳定可预测的模式?如果有,这些模式会不会被环境或对手方利用?

你想,如果一个交易员总是在错误的时间买卖,那对手方就可以反向操作赚他的钱。LLM 交易员的负择时越稳定、越可预测,它就越容易成为被收割的对象。RetailAgent 论文里也提到了这一点:在金融市场里,一个对价格变动有系统性反应的序列策略,可能会被其他市场参与者预测到 [1]。

这不是交易领域独有的问题。任何需要连续做决策的 LLM 代理——比如做搜索、做软件开发、做机器人控制——都可能有自己的行为偏差和固定套路。如果这些偏差是稳定的、方向性的,那就可能被环境”利用”,或者在长程任务中不断累积错误,最后彻底跑偏。

那有没有办法纠正这种偏差呢?一个可能的方向是类似 AEWM(Agent-Editing World Model,代理编辑世界模型)的思路:与其让代理自己反思,不如用一个外部的”世界模型”直接判断它的决策质量,修正有问题的推理和行动状态 [3]。AEWM 不预测环境会怎么变,而是直接编辑代理自身的状态——把无效的、错误的步骤替换掉,不让错误的思路留在历史里污染后续决策 [3]。

当然,这方面的研究还很初步。AEWM 目前只在搜索、终端、软件工程三类任务上验证了效果,还没用到金融交易场景 [3]。而且它需要额外跑一个大模型做判断,计算成本也不低。更根本的问题是:我们能不能从架构层面减少 LLM 代理的这种行为偏差?还是说,只要是基于序列预测的模型,就必然会有某种可预测的行为模式?

这些都还没有答案。但至少我们现在知道了:LLM 代理不是”理性的决策者”,它有自己的脾气和套路,甚至会像人类一样,越记笔记越固执。认识到这一点,比盲目相信”AI 炒股一定稳赚”要重要得多。

如果你只记住一件事

LLM 交易代理在受控实验中表现出稳定的负择时偏差——系统性地在股价后续表现差时持有、好时空仓——而自我生成的记忆会进一步强化这种偏差。


参考文献

  1. RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents(arXiv (Cornell University)、2026、全文精读)
  2. Scaling Attention Head Analysis via Gradient-Based Attribution in Context-Aware Machine Translation(arXiv、2026、全文精读)
  3. Agent-Editing World Model: Rethinking World Modeling for LLM Agents(arXiv、2026、全文精读)
  4. Building Socio-Affective Artificial Intelligence for Interactive Multi-Agent Simulations(arXiv、2026、全文精读)
  5. Fundamentals of Large Language Models(2026、仅摘要)
  6. TradingGPT: Multi-Agent System with Layered Memory and Distinct Characters for Enhanced Financial Trading Performance(2023、仅摘要)
  7. ATLAS: Adaptive Trading with LLM AgentS Through Dynamic Prompt Optimization and Multi-Agent Coordination(ArXiv.org、2025、仅摘要)
  8. Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation(arXiv (Cornell University)、2026、仅摘要)