AI 智能体换个语言就变笨?扒一扒跨语言能力差距的真相
你有没有过这种经历:用中文让AI助手订机票、整理日程,它总比英文版本笨一点——要么理解错需求,要么工具调用乱套?这不是你的错觉,最新研究证实了这种普遍的跨语言能力差。
从一个日常场景说起:中文AI助手为什么总差点意思
你可能已经隐约感觉到了:同样的需求,用英文说给AI助手听,它往往能干脆利落地完成;换成中文,就容易出现各种”差一口气”的状况——让它找”标题里带Research的活动”,它可能跑去按职位头衔筛选;让它”删掉我那个美国的联系人”,它可能把所有美国联系人都删了。
这些小毛病看起来像是翻译的问题,或者中文语料不够多。但如果我告诉你,就算把翻译做到完美、把模型参数翻几倍,这个差距可能依然存在呢?最近的一项系统性研究,把这件事从”个人体感”变成了可量化的科学结论。
测出来的差距:10种语言、7款智能体的统一考试
为了公平测量AI智能体的跨语言能力,研究者构建了一个叫 OmnilingualGAIA2 的多语言基准测试集 [1]。简单说,就是把原本只有英文的智能体”统考”题目,翻译成了10种语言、覆盖5种书写系统(拉丁、汉字、假名、天城文等),然后用统一的评判标准给不同智能体打分。
这里稍微解释一下:AI智能体(AI Agent) 指的是不只是聊天、还能调用工具、执行多步骤任务的AI系统,比如帮你管理日历、发邮件、查资料的助手。
这个测试的特别之处在于,它不是简单把题目翻译完就完事。研究者做了三层保障:先翻译应用界面等环境文本,再建立统一的术语表保证人名、地名等实体在所有题目里译名一致,最后用术语表约束任务描述和验证规则的翻译 [1]。评判用的”AI裁判”也做了多语言校准,避免因为裁判本身的语言偏见影响结果 [1]。
测下来的结果很明确:7款前沿和开源智能体,在非英语环境下的表现普遍比英语低 8.8到18.4个百分点(pass@3指标,也就是给三次机会能通过的比例)[1]。表现最好的 Gemini 3.1 Pro 差距最小(8.8分),开源的 Qwen-3.6-35B-A3B 差距最大(18.4分)[1]。而且这个差距不是某一种语言的特例,从西班牙语到印地语,从中文到日语,普遍存在。
有意思的是,差距不是均匀分布在所有能力上的。定量推理(比如算个数、分个类)的跨语言差异不大,真正拉开差距的是**工具编排(tool orchestration)**能力——也就是智能体能不能选对工具、按正确顺序调用、在出错时调整策略 [1]。换句话说,语言切换影响的主要不是”脑子”,而是”动手能力”。
差距从哪来:是翻译的锅,还是模型本身不行?
看到这里你可能会想:会不会是翻译质量不行?题目翻错了,智能体当然做不对。
研究者也想到了这一点,所以他们做了一个精细的误差归因分析,把所有失败案例分成了几大类:智能体自身的问题、翻译缺陷、验证器偏差等等 [1]。
结果有点反直觉:55%的差距是模型自身导致的,只有6.4%的场景-语言对是因为翻译缺陷而根本不可解 [1]。也就是说,翻译问题确实存在,但它只是个”下限”,大部分失败并不是因为题目翻错了,而是智能体在非英语环境下自己”发挥失常”。
两个具体案例能很好地说明这一点 [1]。
第一个是”标题歧义案”。英文任务是”找标题以Research开头的活动”,翻译成西班牙语、中文、日语时,“titles”被误译成了”职位头衔”,按说这是翻译的锅对吧?但同样面对这个错误翻译,印尼语版的智能体居然自己”猜”对了意思,顺利完成了任务。这说明翻译缺陷不一定导致失败,智能体自身的歧义处理能力也很关键。
第二个是”单复数陷阱”。任务是”删除我那个美国的联系人”——实际上有两个美国联系人,英文里单数冠词”that”会让智能体意识到有歧义,主动询问用户指的是哪一个。但中文、日语、印尼语没有冠词和单复数变化,智能体直接理解成了”所有美国联系人”,一次性全删了。这就完全不是翻译的问题了,而是智能体对不同语言的形态线索不敏感。
当然,实际情况比这个比喻更复杂。误差归因是一个分层抽样加人工复核的过程,研究者还特别注意了避免只分析完全失败案例带来的选择偏差,人工复核的一致率达到了91.4% [1]。
反直觉:模型越大,跨语言差距反而越大?
那是不是把模型做大一点,这个问题就解决了?毕竟大模型在很多任务上都是”大力出奇迹”。
研究者做了一个规模消融实验,用同一系列的Qwen-3.5模型,从3B到17B活跃参数逐级对比 [1]。结果出乎意料:模型越大,整体能力确实越强,但英语和其他语言的差距不仅没有缩小,反而从8.1分扩大到了12.7分 [1]。
一个合理的猜测是:工具编排是一种更”高级”的能力,它需要把语言理解、规划、工具调用、错误恢复整合在一起。大模型在英语上把这种能力练得很强,但在其他语言上,这种整合能力并没有同步跟上——基础的语言理解可能跟上了,但复杂的多步推理和工具调用反而拉开了差距。
这也呼应了前面的发现:差距主要集中在工具编排而不是定量推理。简单任务上,大模型的多语言能力还能hold住;一旦涉及多步骤、多工具的复杂协作,非英语环境下的短板就暴露出来了。
不过这里也要诚实说明:这个规模消融实验只用了Qwen-3.5一个系列,而且和主实验的Qwen-3.6不是同一代,结论的普适性还有待更多模型验证 [1]。
这件事之前我们知道多少:多语言智能体评测的来路
其实这不是第一个关注多语言智能体的评测。早在2025年,就有研究者提出了MAPS基准,把GAIA、SWE-Bench、MATH等四个主流智能体基准翻译成11种语言,发现从英语切换到其他语言时,智能体的性能和安全性都会下降,而且下降程度和翻译输入的量相关 [7]。
但MAPS更像是一个”拼盘”——把现有的单语言基准翻译过来拼在一起,而OmnilingualGAIA2做了更细致的工作:统一的术语表、本地化的验证器、系统的误差归因 [1]。它不仅告诉我们”有差距”,还进一步回答了”差距有多大、从哪来、为什么堆参数没用”。
在翻译质量这个侧面,也有研究给出了参照:法律和新闻领域的测试显示,AI智能体翻译虽然在人类评估中表现不错,但成本是传统神经机器翻译的5到15倍,而且自动指标反而落后 [6]。这也从另一个角度说明,简单靠智能体做翻译来解决跨语言问题,可能既不经济也不可靠。
不止是语言:智能体能力评估的深层困境
跨语言差距这件事,往大了看,其实是当前智能体评估体系缺陷的一个缩影。
最近的一项研究系统分析了2572个智能体应用的测试用例,发现了一个普遍问题:61.8%的测试都是单元测试——也就是单独测某个工具、某个组件能不能用,只有很少的测试会测多个工具配合起来的复杂场景 [3]。这就像造机器人只测每个零件能不能转,却很少测组装起来能不能走路。
更有意思的是,近四成测试用的是test1、test2这种”假得离谱”的占位符数据 [3]。用这种数据测出来的智能体,遇到真实世界里的歧义、不规范输入、多语言混杂,当然容易翻车。
还有研究指出,当前智能体在复杂环境下的鲁棒性普遍不足——工具之间的依赖关系、隐藏在长上下文中的关键信息、动态变化的决策路径,都会让智能体表现显著下降 [8]。跨语言差距,本质上就是给智能体增加了一层”语言噪声”,把这些本来就存在的鲁棒性问题放大了。
从这个角度看,“中文AI助手笨一点”不只是中文的问题,也不只是语言的问题——它是智能体在面对非理想环境时整体脆弱性的一种表现。
接下来的路:怎么才能让AI智能体真正”懂”所有语言
那这个问题有解吗?目前的研究还停留在”诊断”阶段,研究者提出了几个开放问题 [1]:
第一,更低资源的语言会怎么样?现在的测试覆盖了10种语言,但世界上有几千种语言,那些语料更少、更小众的语言,差距会不会大到根本没法用?
第二,能不能把翻译缺陷的下限再压低?现在6.4%的场景因为翻译问题不可解,虽然比例不高,但对于实际产品来说,每一个失败案例都是用户体验的硬伤。
第三,也是最根本的:需要什么样的架构改进,才能补上工具编排的跨语言缺口?既然堆参数没用,那就得从设计上找办法——比如专门的多语言工具调用模块、跨语言的状态表示、或者更好的歧义处理机制。
回到我们最开始的日常体验:你用中文AI助手时遇到的那些”差点意思”,不是你的问题,也不是翻译的问题,而是当前AI智能体的一个系统性短板。它提醒我们,AI的全球化不能只靠把英文系统翻译一下就完事——真正的多语言智能,需要从模型能力、架构设计到评估体系的全方位重构。
如果你只记住一件事
AI智能体的跨语言能力差距是真实存在的,而且主要不是翻译的锅,而是模型自身在非英语环境下工具编排能力下降导致的。
参考文献
- OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents(arXiv、2026、全文精读)
- Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration(arXiv、2026、全文精读)
- Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications(arXiv、2026、全文精读)
- Human-Simulation Interaction: From Prediction to Exploration in LLM Agent Simulations for Policy(arXiv、2026、全文精读)
- Muscle Memory for Agents: Compile not Merely Retrieve(arXiv、2026、全文精读)
- AI agents may be worth the hype but not the resources (yet): An initial exploration of machine translation quality and costs in three language pairs in the legal and news domains(ArXiv.org、2025、仅摘要)
- MAPS: A Multilingual Benchmark for Agent Performance and Security(2025、仅摘要)
- C^3 -Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking(ArXiv.org、2025、仅摘要)