模型越大,跨语言能力真的越强吗?我们可能被准确率骗了
你有没有过这种体验:用大模型做英语题很准,换成小语种就翻车——于是直觉觉得「模型越大,跨语言能力肯定越强」。但如果我告诉你,很多时候非英语分数上涨,只是模型整体变聪明了,根本不是跨语言迁移能力在进步?
跨语言迁移(cross-lingual transfer,指模型把在高资源源语言上学到的能力,泛化到低资源目标语言上的能力)一直是多语言模型研究的核心命题。可我们该如何剥离模型整体能力的干扰,看清跨语言迁移的真实进展?2026年的一篇论文提出了一种叫HAT的新指标,戳破了过去我们对「分数涨=迁移强」的误判 [1]。
一个反直觉的发现:分数涨了,迁移能力可能没动
先给你讲个真实的实验结果:GPT-OSS系列模型从200亿参数扩大到1200亿参数,在一个叫ECLeKTic的多语言事实问答基准上,非英语语言的平均准确率从18.0%升到了25.4%,涨了7个多百分点 [1]。
看起来很美对不对?规模果然就是正义,模型越大跨语言能力越强。
但等一下——如果我告诉你,这些模型的英语准确率也同步涨了呢?你怎么知道这7个点的进步,是模型更擅长「把英语知识迁移到其他语言」,还是它单纯「整体变聪明了,不管什么语言的题都更会做了」?
打个生活化的比方:你给一个学生补数学,发现他不仅数学选择题分涨了,连英语选择题的分也涨了。你会觉得他的「跨学科迁移能力」提升了吗?大概率不会——你会觉得他只是更会做选择题了,或者整体应试能力变强了,顺带把英语的分也带上去了。
跨语言评估过去就犯了这个错误:我们把「目标语言准确率」直接等同于「迁移能力」,但实际上这里面混进了模型整体能力提升的水分。论文作者统计了20个不同模型在三个基准上的表现,发现源语言和目标语言的准确率强线性相关,R²超过0.94——也就是说,目标语言分数的变化里,94%以上都可以被源语言的分数解释 [1]。
当然,实际情况比这个比喻更复杂:跨语言迁移确实存在,只是它的真实贡献被整体能力的提升给掩盖了。我们缺的,是一把能把两者分开的尺子。
为什么传统指标会「撒谎」?HAT分数的设计思路
过去大家不是没意识到这个问题。传统上衡量跨语言迁移有几种常见做法:直接看目标准确率、算源语言和目标语言的准确率差(gap)、或者用各种比值做transfer score。但这些方法都有同一个病根——它们都没有剥离源语言本身准确率的影响 [1]。
举个极端例子:一个模型英语准确率从60%涨到90%,目标语言从30%涨到45%。你看目标准确率,涨了15个点,好像进步很大;你看gap,从30个点变成45个点,反而变差了;你看比值,一直是0.5,好像又没变化。到底哪个是对的?
都不对。因为你不知道「在英语准确率相同的情况下」,目标语言的表现到底怎么样。
论文提出的硬度调整迁移分数(Hardness Adjusted Transfer Score,简称HAT),核心思路就是做这件事:先画出一条「转移剖面」(transfer profile)曲线——横轴是源语言的准确率(也就是题目的难度,越难的题源语言准确率越低),纵轴是对应难度下目标语言的准确率。然后把这条曲线下的面积归一化到0到1之间,就是HAT分数 [1]。
HAT=1代表完美迁移:不管题目多难,目标语言和源语言表现一模一样;HAT=0代表完全没有迁移:目标语言全靠蒙。
你可以把它理解成「考试公平性调整」:两个学生英语水平不一样,直接比他们的法语分数不公平。得先把他们拉到同一个英语水平线上,再比法语能考多少——这才是真实的「从英语到法语的迁移能力」。
具体怎么算呢?论文的做法是对每个测试样本做10次采样,得到这个样本在源语言和目标语言上的通过率,然后用带原点约束的线性回归拟合出转移剖面,斜率就是HAT分数 [1]。
回到开头那个反直觉的例子:GPT-OSS从20B到120B,ECLeKTic的目标准确率涨了7个点,但HAT分数都在0.82左右,几乎没动 [1]。说白了就是:模型确实变聪明了,但它把知识从英语搬到其他语言的能力,一点长进都没有。
三个被重新定义的结论:小模型、缩放定律与脚本差异
用HAT这把新尺子重新量一遍,过去我们对跨语言迁移的很多认知都得改写。论文给出了三个最关键的反常识结论 [1]。
第一个:小模型的迁移能力没你想的那么差。
过去大家觉得小模型跨语言不行,非英语分数惨不忍睹。但HAT显示,1B到4B的小模型,迁移能力能达到源语言的50%到80%——它们只是整体准确率低,显得非英语表现差而已。换句话说,小模型不是「不会迁移」,是「本身会的就不多,但会的那部分里,相当比例都能迁移过去」 [1]。
第二个:模型规模带来的迁移提升,远慢于预期。
这是最扎心的一个结论。比如Gemma-3系列从1B涨到27B,在MMLU-ProX-Lite概念推理基准上,HAT从58.4升到77.2,确实有提升;但在ECLeKTic事实问答上,刚才说了,GPT-OSS从20B到120B,HAT几乎纹丝不动 [1]。
这意味着什么?过去我们以为「堆参数就能自然提升跨语言能力」,其实很大程度上是被整体准确率的上涨给骗了。规模能带来迁移提升,但提升的速度和幅度,都比我们以为的要慢得多、小得多。
第三个:脚本差异的影响,只存在于记忆类任务。
直觉上我们会觉得,两种语言用的字母不一样(比如英语和阿拉伯语),迁移肯定比同脚本(比如英语和法语)难。但HAT告诉我们,这得看任务类型:在事实记忆类任务(ECLeKTic)上,同脚本的HAT比不同脚本高17个百分点左右,影响确实大;但在数学推理(MGSMv2)和概念推理(MMLU-ProX-Lite)任务上,脚本差异的影响几乎可以忽略,只差0.5%和-1.9% [1]。
换句话说,脚本不同主要卡的是「记单词、记事实」这一关;一旦涉及推理能力,字母长什么样根本不重要——模型学到的是抽象的推理逻辑,跟用什么文字写的没关系。
从「看分数」到「测迁移」:跨语言评估的演进脉络
HAT不是凭空冒出来的,它其实是跨语言评估领域多年演进的必然结果。
最早的时候,大家的关注点是「迁移现象到底存不存在」——多语言模型是不是真的能把一种语言的能力用到另一种上?2023年的一篇综述总结了这个阶段的成果,把影响跨语言迁移的因素归成了五大类,包括预训练数据量、词汇重叠、训练策略等等 [7]。另一篇研究则专门针对X-MOD这类模块化多语言模型,量化了各种因素对下游表现的影响 [6]。
然后大家开始质疑:我们测出来的高分,真的是迁移能力吗?2024年的一篇论文直接挑战了现有基准的有效性,指出很多高表现其实来自数据偏差和表面线索,不是真正的语言知识迁移——尤其是低资源语言,模型学到的更多是数据里的人工痕迹和偏见,而不是真的懂这门语言 [8]。
到了2026年的这篇HAT论文,相当于把质疑推进了一步:就算没有数据污染,我们的指标本身也有问题——它把「模型整体变聪明」和「迁移能力变强」混在了一起 [1]。
从「证明迁移存在」,到「怀疑测出来的是不是真迁移」,再到「设计更干净的指标隔离真实迁移」,这条脉络其实很清晰:我们对跨语言能力的理解,正在从「看表面分数」一步步走向「测内在机制」。
还没解决的问题:为什么迁移进步这么慢?
当然,HAT不是终点,它也有自己的边界和局限。
首先,HAT的结论只覆盖了论文测试的三个基准——事实问答、数学推理、概念多选,都是相对标准化的任务。更复杂的多步推理、真实世界应用场景下是不是也成立,还不好说 [1]。而且其中两个基准(MGSMv2和MMLU-ProX-Lite)已经快被新模型「刷满」了,HAT接近1,再往后可能就不够敏感了 [1]。
其次,HAT和所有指标一样,区分不了「数据污染」和「真实算法进步」——如果模型在训练时见过测试题,不管什么指标都会虚高 [1]。这是整个NLP评估领域的老难题,HAT也没能解决。
第三,计算成本高。HAT需要对每个样本做10次前向传播来估计通过率,计算量是传统指标的10倍 [1]。对大模型来说,这可不是个小数目。
但最大的开放问题其实是:为什么跨语言迁移的进步这么慢?我们堆了这么多参数、这么多数据,模型整体能力涨了一大截,可真实的迁移能力却提升有限 [1]。这背后的机制是什么?是数据配比的问题,还是架构本身的瓶颈?我们能不能找到方法,让迁移能力的增长追上甚至超过模型规模的增长?
论文没有给出答案。它只是递给我们一副更干净的眼镜,让我们第一次看清了真实的进展——以及真实的停滞。
如果你只记住一件事
下次再看到「某某模型多语言能力又提升了」的新闻,别光看目标准确率涨了多少,先问问它的源语言准确率涨了多少——剥离了整体能力的提升之后,真正的迁移能力,才是衡量跨语言进步的核心标尺。
参考文献
- Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer(arXiv (Cornell University)、2026、全文精读)
- Width, Memory, and Delay: A Resource Accounting for the Limits of Flat Multi-Agent Systems(arXiv、2026、全文精读)
- Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems(arXiv、2026、全文精读)
- Rewriting or Reweighting? A Geometric Account in Language Models(arXiv (Cornell University)、2026、全文精读)
- Artificially intelligent agents in the social and behavioral sciences: A history and outlook(arXiv、2026、全文精读)
- Understanding cross-lingual abilities in large multilingual language models(Digital Repository (National Repository of Grey Literature)、2023、仅摘要)
- Towards a Common Understanding of Contributing Factors for Cross-Lingual Transfer in Multilingual Language Models: A Review(arXiv (Cornell University)、2023、仅摘要)
- Analyzing the Evaluation of Cross-Lingual Knowledge Transfer in Multilingual Language Models(2024、仅摘要)