Chunlin 的论文科普

让大模型翻译别

你有没有过这种体验:让大模型翻译一句简单的话,它偏要先加一句”好的,以下是翻译:“,有时候还附赠一段语法讲解,甚至突然开始自我介绍。你明明只想得到译文,结果收到了一篇小作文——这种画蛇添足的现象,在学术上有个专门的名字:翻译噪声(translation noise),指大模型输出里除了干净译文之外的所有额外内容。

为什么大模型翻译总爱”废话连篇”?这些废话有多少种花样?能不能自动把干净译文抠出来?最近一篇名为 TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs 的论文第一次系统研究了这个问题 [1]。我们今天就从日常痛点聊起,一直讲到这个领域的前沿难题。

一、你收到的”翻译废话”,比你想象的更普遍

先别急着觉得”只是我运气不好”。研究人员分析了来自 12 个大语言模型、覆盖 22 个语言对的 79 万多条翻译输出,发现噪声率从 3% 到 99% 不等——也就是说,有些模型几乎每一次翻译都会夹带私货 [1]。

一个反直觉的发现是:越大的模型反而越”话痨”。比如 gemma-3-27b-it 这样的大模型,在某种提示下噪声率高达 99.73%,几乎每次都要给你解释点什么;反而一些较小的模型更”干脆”,噪声率能低到 3% 左右 [1]。这就像职场里的实习生:能力强的总想多表现一下,反而容易画蛇添足;新手反而老老实实只做分内事。

当然,实际情况比这个比喻更复杂——模型大小不是唯一因素,提示词的影响也很大。即使你明确说”只输出翻译结果,不要任何额外文字”,噪声依然存在,只是比例会降低 [1]。换句话说,靠提示工程只能缓解,不能根治。

二、12种噪声模式:大模型的”画蛇添足”入门图鉴

这些”废话”到底长什么样?研究人员把它们归纳为 12 种反复出现的模式,分成两大类:格式噪声(formatting noise) 和 内容噪声(content noise) [1]。

格式噪声比较”规矩”,只是给译文套了个壳。比如加个语言标签(“英语:… 中文:…”)、把译文放进代码块里、加个标题或者编号。这就像你让同事帮你带杯咖啡,他用个礼品盒包装好再给你——东西没错,但包装是多余的。

内容噪声就花哨多了。最常见的是解释类,占了所有噪声的约 33%,比如”这句话的意思是…,因为里面有个习语…”;其次是备选翻译(约 15%),一口气给你三四个版本让你自己挑;还有跑题内容(约 12%),比如突然说”我是一个 AI 助手”或者问”你还需要翻译别的吗?” [1]。更奇葩的还有把原文再重复一遍的、加免责声明的、甚至开始讨论翻译理论的。

你可以把这些模式想象成 12 种不同的”赠品”:有的是包装盒,有的是说明书,有的是完全不相关的广告。它们的共同特点是:你都没要,但模型硬塞给了你。

三、TransClean基准:第一次把”去废话”变成可衡量的问题

既然噪声这么普遍,为什么之前没人好好研究?一个核心原因是:没有统一的基准测试集。你说你的去噪方法好,我说我的好,各说各话,没有公平的对比标准。

TransClean 就是为了解决这个问题而生的第一个专门基准 [1]。它的构建思路是”合成 + 人工精选”的混合策略:一共 9,900 对”噪声输出-干净译文”样本,其中 8,800 条是合成数据——按照真实噪声的分布比例,人为把各种噪声模式注入干净译文里;另外 1,100 条是人工精选的真实数据,从大模型的真实输出里挑出有噪声的例子,再由 3 个大模型投票产生”银标准”的干净译文 [1]。

为什么不全用真实数据?因为真实数据标注成本太高,而且噪声分布不均匀,有些罕见模式很难收集到足够的样本。合成数据的好处是可控——你可以精确控制每种噪声出现多少次,方便对比不同方法的优缺点。但合成数据也有局限:它没法完全还原真实世界里噪声的多样性和复杂性,所以才需要 1,100 条真实数据做补充 [1]。

这个基准的评估指标也很直接:一个是检测准确率——判断一段输出里有没有噪声;另一个是提取准确率——能不能精准地把干净译文从噪声里抠出来,采用归一化后的精确匹配标准 [1]。

说到翻译噪声研究的脉络,其实之前的工作更多关注”清洗输入”——也就是给翻译模型的输入文本本身有噪声(比如表情符号、俚语、错别字),怎么把输入洗干净再翻译 [6]。而 TransClean 关注的是”清洗输出”——翻译模型本身输出了多余内容,怎么从输出里提取干净译文 [1]。这是一个从输入端到输出端的研究重心转移,也反映了大模型时代翻译问题的新变化。

四、两种提取思路:为什么检测容易、提取难?

有了基准,研究人员测试了两种主流的提取思路,结果发现了一个有趣的现象:检测噪声几乎已经做到接近完美(97%-99% 准确率),但精确提取干净译文的最佳表现也只有约 54% [1]。

为什么差这么多?我们先看看两种思路分别是怎么工作的。

第一种叫跨度提取法(span-based extraction)。思路很朴素:把大模型的输出按换行切成一段一段,然后用一个翻译质量估计模型(这里用的是 COMET-KIWI,一种不需要参考译文就能打分的质量评估模型)给每一段打分,分数最高的那段就是译文 [1]。这就像你在一堆混在一起的文件里找某份报告,每份文件快速翻一下,看哪份最像你要的。

第二种叫LLM 提取法(LLM-based extraction)。更简单直接:再用另一个大模型,给它一个提示”从下面这段输出里,只把翻译结果提取出来”,让它帮你抠 [1]。这就像你让一个实习生帮你从一堆资料里把你要的那段话挑出来。

两种方法在合成数据上表现差不多,都在 50% 左右;但一到真实数据上,差距就拉开了:跨度提取法的准确率从 50.59% 骤降到 15.82%,而 LLM 提取法还能维持在 52.18% [1]。

为什么跨度法崩得这么厉害?因为真实世界的噪声远比合成的复杂。合成的格式噪声通常规规矩矩地按行分开,切一下就能分开;但真实输出里,噪声和译文可能混在同一段里,或者用奇怪的符号分隔,甚至译文被插在解释中间。按换行切分的方法根本切不准,自然就提取不出来了 [1]。

而 LLM 提取法虽然泛化能力更强,但也有自己的问题:它有时候会”自作主张”地改写译文,而不是原封不动地提取——明明语义是对的,但因为措辞和标准答案不一样,就被判错了 [1]。这也是为什么精确匹配的准确率上不去的原因之一。

五、剩下的难题:语义等价、多语言与新模型演化

聊到这里你应该也发现了,这个领域才刚起步,还有一大堆问题没解决。

第一个难题是怎么评估才合理。现在用的精确匹配标准太严了——如果提取出来的译文和标准答案意思完全一样,只是换了个同义词或者调整了语序,也算错 [1]。就像你让别人帮你找”苹果”,他给你拿了个”Apple”,你说不对,因为我要的是”苹果”两个字。研究人员自己也承认,这个指标可能过于严格,不能反映语义上的正确性 [1]。怎么设计更符合人类直觉的语义级评估指标,是个开放问题。

第二个难题是多语言覆盖不足。目前的基准整体偏英语中心,真实噪声样本里大部分是英语的解释和说明 [1]。那如果是中文大模型翻译法语,输出里的噪声是中文的,现有的方法还能好用吗?不好说。不同语言的噪声模式可能很不一样,比如有些语言的模型喜欢用母语解释,有些喜欢用目标语解释。

第三个难题更根本:模型在演化,噪声也在演化。今天总结出的 12 种模式,明天新出的模型可能又整出新的花样 [1]。这就像病毒和疫苗的关系——你刚研究出对付旧毒株的方法,新毒株又出现了。噪声模式的归纳是基于现有模型的,未来的模型会不会有完全不同的”废话”习惯?谁也不知道。

另外还有一些技术上的瓶颈。一个合理的猜测是,除了目前测试的两种基本提取思路,还有很多可能的方向值得探索:比如用文本对齐的方法找原文和译文的对应关系,或者用编辑距离来判断哪部分是多余的,又或者用多个模型集成投票。这些方法能不能突破 54% 的天花板?还需要更多研究。

如果你只记住一件事

大模型翻译的”话痨”问题,不是你用得不对,而是一个普遍存在且尚未解决的技术挑战:检测一段输出有没有废话很容易,但精准把干净译文抠出来却难得多——目前最好的方法也只有约一半的成功率 [1]。

下次再遇到大模型给你翻译时”加戏”,你就知道:这不是针对你,这是整个行业都在头疼的事儿。


参考文献

  1. TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs(arXiv (Cornell University)、2026、全文精读)
  2. AI Life A Mother-agent Architecture for Heritable, Lifelong and Evolutionary Agentic Systems From Platform Competition to Governed Agent Lineages, with Financial-Market Applications(SSRN、2026、仅摘要)
  3. KOLLEKTİV FƏALİYYƏTİN QİYMƏTLƏNDİRİLMƏSİNDƏ MULTİ-AGENT SİSTEMLƏRİNİN TƏDQİQİNİN VƏ TƏTBİQİNİN MÜASİR PROBLEMLƏRİ(Scientific Journal、2026、仅摘要)
  4. Multi-Agent AI Systems for Autonomous Software Development(SSRN、2026、仅摘要)
  5. LLM Agents in Transportation-enabled Service Platforms: From Behavioral Simulation to Platform Decision Support(SSRN、2026、仅摘要)
  6. Ask Language Model to Clean Your Noisy Translation Data(arXiv (Cornell University)、2023、仅摘要)
  7. What do Large Language Models Need for Machine Translation Evaluation?(arXiv (Cornell University)、2024、仅摘要)
  8. Refining Translations with LLMs: A Constraint-Aware Iterative Prompting Approach(arXiv (Cornell University)、2024、仅摘要)