机器人为什么会走错路?当环境状态本身成了LLM的攻击面
你给家里的服务机器人下了指令:「去厨房拿一瓶水」。它转身出门,却拐向了书房拿起了剪刀。你没说错话,机器人也没被黑客入侵——只是它「看到」的环境描述被改了一个字。
这不是科幻小说,而是最新研究证实的真实攻击路径。过去我们以为要骗机器人,就得给它下假命令、或者在提示里塞恶意指令;但最新研究发现,真正隐蔽且高效的攻击,根本不需要碰用户指令——只要篡改它用来理解环境的「状态文本」,就能让它心甘情愿地执行恶意任务 [1]。
为什么「环境状态文本」会成为 LLM 具身智能体最容易被忽视的安全漏洞?我们从最基础的直觉讲起。
一、你以为攻击是「下假命令」,其实是「造假证据」
提到大语言模型的安全,很多人第一反应是「提示注入」——在用户输入里塞一段隐藏指令,让模型跳过安全护栏做坏事。这种攻击针对的是指令层:攻击者要和用户抢「话语权」,让 AI 听自己的,不听用户的。
但你有没有想过另一种可能:攻击者根本不抢指挥权,只是偷偷改了 AI 用来做判断的「事实材料」?
打个比方:你让助理去仓库拿 A 箱子。提示注入攻击就像有人偷偷跟助理说「别听他的,拿 B 箱」;而我们今天说的攻击,是偷偷把仓库货架上的标签换了——A 箱的位置贴了 B 的标签,B 箱的位置贴了 A 的标签。助理完全信任你,也严格执行你的命令,只是他看到的「环境事实」是假的,结果自然就错了。
当然,实际情况比这个比喻更复杂,但核心逻辑是一致的:改事实比改指令更隐蔽,也更容易成功——因为 AI 天然会把环境状态当作「客观证据」来采信,而对额外的、和用户指令冲突的命令,反而会有戒心 [1]。
这种针对环境状态文本的攻击,在最新研究里被称为 ESTI(Environment State-Text Injection,环境状态文本注入)[1]。
二、ESTI 攻击:把恶意目标包装成「环境事实」
ESTI 的核心设计思路非常反直觉:不把攻击目标表达为一条与用户竞争的指令,而是把它编码成符合原生状态格式的假证据 [1]。
我们来拆解它的三步构造逻辑:
第一步,目标归一化与实体绑定。攻击者先确认攻击目标在当前场景里是可落地的——比如要让机器人去书房,那场景里得真有书房这个房间;要让机器人拿剪刀,书房里得真有剪刀。这个步骤保证假状态不是凭空捏造,而是和场景里已有的实体对应上,不容易露馅 [1]。
第二步,选择状态载体做语义改写。状态文本不是一段随便的话,而是有固定结构的——比如对象属性(「剪刀在书桌上」)、空间关系(「书房在走廊左手边」)、可供性(「剪刀可以被抓取」)、任务阶段规则、执行反馈等等。攻击者只改和攻击目标相关的字段,而且改完之后内部逻辑要自洽,不能出现矛盾 [1]。
第三步,按事件时机注入。可以在任务一开始就注入初始假状态,也可以等任务执行到某个阶段时,在反馈信息里掺假——比如机器人走到厨房门口时,突然收到「厨房门已锁」的假状态反馈,逼它改变路线 [1]。
为什么这种方法比直接塞恶意指令有效?因为它完全贴合规划器的正常工作模式。规划器的设计就是「基于用户指令 + 环境状态来制定计划」——状态本来就是它要采信的输入,不是外来的、可疑的额外指令。论文实验显示,在 DeepSeek-V4-Pro 模型上,ESTI 的规划层攻击成功率(P-ASR)平均达到 99.12%,而最强的提示注入基线 Vanilla IPI 只有 80.49%,相对提升最高接近 90% [1]。
三、骗过大脑≠骗得过身体:从规划到执行的损耗
如果只看规划层的数据,你可能会觉得这种攻击简直无解——几乎 100% 能骗过 LLM 的大脑。但一旦落到物理执行层面,成功率就掉下来了:同样是 DeepSeek-V4-Pro,执行层攻击成功率(E-ASR)平均只有 45.75%,规划和执行之间差了 53 个百分点 [1]。
这就是具身智能和纯文本 AI 最大的不同:物理世界本身就是一道天然防线。
你在脑子里想一个计划可以很完美,但真要动手做,会遇到各种现实约束——物体够不着、门打不开、路走不通、动作做不了。假状态能骗过规划器,却骗不过物理定律。论文里把这个现象叫「规划到执行的转移损耗」:规划层的攻击成功,只是让机器人在「脑子里」走偏了;但真正要在物理世界把恶意任务完成,还得过五关斩六将 [1]。
真实机器人实验更能说明问题。研究人员用人形机器人做了一个简单测试:原任务是沿预定路线走一圈再返回起点。他们没有改用户指令,只是修改了规划器看到的环境状态文本。结果机器人真的中途偏离了路线,走向了电脑的方向——但注意,这只是「走偏」,离完成恶意任务还有距离 [1]。
而且不同模型的表现差异很大。比如 GPT-5.6-luna 在 AI2-THOR 环境上的规划层成功率只有 47.62%,比 DeepSeek-V4-Pro 的 100% 低得多;但它的规划到执行转移率反而更高,gap 只有 13.33 个百分点 [1]。这说明模型越强、越容易在规划层被骗,但执行层的物理约束对所有模型都是公平的。
不过也别太乐观。45% 的执行成功率已经足够造成严重后果了——尤其是在一些容错率低的场景里,哪怕只有一半概率,风险也不可忽视。
四、从代码策略到状态攻击:具身 AI 安全走了多远?
ESTI 攻击的出现,其实是具身智能体安全研究逐步下沉的一个缩影。我们对风险的认知,正在沿着「指令层→代码层→状态层」一步步往下走。
早期的具身 AI 安全,关注的是指令理解本身。比如 Natural Language as Policies 这类工作,研究的是怎么让 LLM 直接从自然语言指令推理出坐标级控制指令,跳过中间代码,核心是「指令能不能被正确理解和执行」[6]。那时候大家默认,只要指令是对的,执行就不会出大问题。
后来人们发现,指令本身经常有歧义——比如「把杯子挂到杯架上」,有好几个杯子、好多根枝桠,挂哪个、挂哪根?于是有了 CodeDiffuser 这类工作,用视觉语言模型生成代码,再用代码构建注意力图来解决歧义 [7]。这时候风险关注点从「指令理解」下沉到了「代码策略」——代码写得对不对、有没有漏洞。
再往后,大家意识到光有初始规划不够,执行过程中还会出各种意外。于是有了 HyCodePolicy 这类闭环框架:视觉语言模型监控执行过程,发现失败就定位原因、修复代码,形成「生成-监控-修复」的闭环 [8]。这时候安全防线已经延伸到了执行反馈层。
而 ESTI 攻击的出现,把我们的认知又往下推了一层:连状态本身都是攻击面。你代码写得再严谨、闭环监控做得再好,如果输入给规划器的状态文本从根上就是假的,那整个系统越智能,错得就越坚决 [1]。
这是一个很重要的范式转变:过去我们把「环境状态」当作客观、可信的输入,就像人相信自己的眼睛一样;但现在我们发现,对于 LLM 驱动的具身智能体来说,状态文本只是另一种文本输入——只要是文本,就有被篡改的可能,就需要做安全校验。
五、当 AI 有了「认知」,风险从哪里来、到哪里去?
为什么状态注入这么有效?仅仅是因为 LLM 容易被骗吗?
如果把视角拉高一点,你会发现这背后有更深层的原因:LLM 已经发展出了相对独立的物理推理模块。最新的认知架构研究显示,高性能 LLM 自发形成了和人类大脑高度相似的模块化结构——语言、形式推理、社会推理、物理推理各自依赖相对独立的神经元群体。同认知域的任务会调用重叠的神经元,不同域的任务则调用不同的神经元,重叠率相差 4 倍以上 [3]。
这意味着什么?意味着当 LLM 做具身规划时,它不是在「瞎编」,而是在调用专门的物理推理能力,基于「事实证据」做判断。而状态文本,就是它眼中最硬核的「事实证据」——就像人类会基于自己看到的物理环境做决策一样 [3]。
这也正好对应了认知风险框架里的第一层:物理认知风险。当 AI 具备了对物理世界的推理能力,它就不再只是一个文本生成工具,而是一个能对物理环境产生认知、并基于认知采取行动的主体。这种能力带来的第一层风险,就是对人类能动性的侵蚀——如果 AI 对物理世界的认知被篡改,它的行动就会偏离人类的意图,而人类可能还蒙在鼓里 [2]。
当然,目前的 ESTI 攻击还有不少局限。论文作者自己也承认,真实机器人实验里的状态文本是手动喂给规划器的,没有走完整的视觉感知链路——也就是说,还不是真正的端到端闭环攻击 [1]。真要在现实中实现这种攻击,攻击者得先能接触到规划器输入前的状态文本接口,这个前提本身就不弱。
但它引出的开放问题非常值得深思:如果未来感知模块也被纳入攻击链呢?如果状态文本不是被手动篡改,而是通过视觉对抗样本间接生成的呢?如果在长周期、动态变化的任务里,攻击者能自适应地持续篡改状态呢?状态溯源和跨模态一致性检查,会不会成为未来具身安全的核心研究方向 [1]?
这些问题现在还没有答案。但有一点是确定的:当 AI 开始拥有「认知」,风险就不再只是「它会不会听我的话」,而是「它看到的世界,和我看到的是不是同一个」。
如果你只记住一件事
具身智能体的安全防线,正在从「指令层」下沉到「状态层」。 过去我们防的是别人给 AI 下假命令;现在要防的,是别人给 AI 看假的「环境事实」。
参考文献
- When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents(arXiv、2026、全文精读)
- Understanding Cognition-Induced Risks in Agentic AI Systems(arXiv、2026、全文精读)
- Modular Cognitive Architecture Emerges in Large Language Models(arXiv、2026、全文精读)
- Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback(arXiv、2026、全文精读)
- CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents(arXiv、2026、全文精读)
- Natural Language as Policies: Reasoning for Coordinate-Level Embodied Control with LLMs(arXiv (Cornell University)、2024、仅摘要)
- CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity(ArXiv.org、2025、仅摘要)
- HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents(ArXiv.org、2025、仅摘要)