让大模型翻译别
你有没有过这种体验:让大模型翻译一句简单的话,它偏要先加一句”好的,以下是翻译:“,有时候还附赠一段语法讲解,甚至突然开始自我介绍。你明明只想得到译文,结果收到了一篇小作文——这种画蛇添足的现象,在学术上有个专门的名字:翻译噪声(translation noise),指大模型输出里除了干净译文之外的所有额外内容。
为什么大模型翻译总爱”废话连篇”?这些废话有多少种花样?能不能自动把干净译文抠出来?最近一篇名为 TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs 的论文第一次系统研究了这个问题 [1]。我们今天就从日常痛点聊起,一直讲到这个领域的前沿难题。
一、你收到的”翻译废话”,比你想象的更普遍
先别急着觉得”只是我运气不好”。研究人员分析了来自 12 个大语言模型、覆盖 22 个语言对的 79 万多条翻译输出,发现噪声率从 3% 到 99% 不等——也就是说,有些模型几乎每一次翻译都会夹带私货 [1]。
一个反直觉的发现是:越大的模型反而越”话痨”。比如 gemma-3-27b-it 这样的大模型,在某种提示下噪声率高达 99.73%,几乎每次都要给你解释点什么;反而一些较小的模型更”干脆”,噪声率能低到 3% 左右 [1]。这就像职场里的实习生:能力强的总想多表现一下,反而容易画蛇添足;新手反而老老实实只做分内事。
当然,实际情况比这个比喻更复杂——模型大小不是唯一因素,提示词的影响也很大。即使你明确说”只输出翻译结果,不要任何额外文字”,噪声依然存在,只是比例会降低 [1]。换句话说,靠提示工程只能缓解,不能根治。
二、12种噪声模式:大模型的”画蛇添足”入门图鉴
这些”废话”到底长什么样?研究人员把它们归纳为 12 种反复出现的模式,分成两大类:格式噪声(formatting noise) 和 内容噪声(content noise) [1]。
格式噪声比较”规矩”,只是给译文套了个壳。比如加个语言标签(“英语:… 中文:…”)、把译文放进代码块里、加个标题或者编号。这就像你让同事帮你带杯咖啡,他用个礼品盒包装好再给你——东西没错,但包装是多余的。
内容噪声就花哨多了。最常见的是解释类,占了所有噪声的约 33%,比如”这句话的意思是…,因为里面有个习语…”;其次是备选翻译(约 15%),一口气给你三四个版本让你自己挑;还有跑题内容(约 12%),比如突然说”我是一个 AI 助手”或者问”你还需要翻译别的吗?” [1]。更奇葩的还有把原文再重复一遍的、加免责声明的、甚至开始讨论翻译理论的。
你可以把这些模式想象成 12 种不同的”赠品”:有的是包装盒,有的是说明书,有的是完全不相关的广告。它们的共同特点是:你都没要,但模型硬塞给了你。
三、TransClean基准:第一次把”去废话”变成可衡量的问题
既然噪声这么普遍,为什么之前没人好好研究?一个核心原因是:没有统一的基准测试集。你说你的去噪方法好,我说我的好,各说各话,没有公平的对比标准。
TransClean 就是为了解决这个问题而生的第一个专门基准 [1]。它的构建思路是”合成 + 人工精选”的混合策略:一共 9,900 对”噪声输出-干净译文”样本,其中 8,800 条是合成数据——按照真实噪声的分布比例,人为把各种噪声模式注入干净译文里;另外 1,100 条是人工精选的真实数据,从大模型的真实输出里挑出有噪声的例子,再由 3 个大模型投票产生”银标准”的干净译文 [1]。
为什么不全用真实数据?因为真实数据标注成本太高,而且噪声分布不均匀,有些罕见模式很难收集到足够的样本。合成数据的好处是可控——你可以精确控制每种噪声出现多少次,方便对比不同方法的优缺点。但合成数据也有局限:它没法完全还原真实世界里噪声的多样性和复杂性,所以才需要 1,100 条真实数据做补充 [1]。
这个基准的评估指标也很直接:一个是检测准确率——判断一段输出里有没有噪声;另一个是提取准确率——能不能精准地把干净译文从噪声里抠出来,采用归一化后的精确匹配标准 [1]。
说到翻译噪声研究的脉络,其实之前的工作更多关注”清洗输入”——也就是给翻译模型的输入文本本身有噪声(比如表情符号、俚语、错别字),怎么把输入洗干净再翻译 [6]。而 TransClean 关注的是”清洗输出”——翻译模型本身输出了多余内容,怎么从输出里提取干净译文 [1]。这是一个从输入端到输出端的研究重心转移,也反映了大模型时代翻译问题的新变化。
四、两种提取思路:为什么检测容易、提取难?
有了基准,研究人员测试了两种主流的提取思路,结果发现了一个有趣的现象:检测噪声几乎已经做到接近完美(97%-99% 准确率),但精确提取干净译文的最佳表现也只有约 54% [1]。
为什么差这么多?我们先看看两种思路分别是怎么工作的。
第一种叫跨度提取法(span-based extraction)。思路很朴素:把大模型的输出按换行切成一段一段,然后用一个翻译质量估计模型(这里用的是 COMET-KIWI,一种不需要参考译文就能打分的质量评估模型)给每一段打分,分数最高的那段就是译文 [1]。这就像你在一堆混在一起的文件里找某份报告,每份文件快速翻一下,看哪份最像你要的。
第二种叫LLM 提取法(LLM-based extraction)。更简单直接:再用另一个大模型,给它一个提示”从下面这段输出里,只把翻译结果提取出来”,让它帮你抠 [1]。这就像你让一个实习生帮你从一堆资料里把你要的那段话挑出来。
两种方法在合成数据上表现差不多,都在 50% 左右;但一到真实数据上,差距就拉开了:跨度提取法的准确率从 50.59% 骤降到 15.82%,而 LLM 提取法还能维持在 52.18% [1]。
为什么跨度法崩得这么厉害?因为真实世界的噪声远比合成的复杂。合成的格式噪声通常规规矩矩地按行分开,切一下就能分开;但真实输出里,噪声和译文可能混在同一段里,或者用奇怪的符号分隔,甚至译文被插在解释中间。按换行切分的方法根本切不准,自然就提取不出来了 [1]。
而 LLM 提取法虽然泛化能力更强,但也有自己的问题:它有时候会”自作主张”地改写译文,而不是原封不动地提取——明明语义是对的,但因为措辞和标准答案不一样,就被判错了 [1]。这也是为什么精确匹配的准确率上不去的原因之一。
五、剩下的难题:语义等价、多语言与新模型演化
聊到这里你应该也发现了,这个领域才刚起步,还有一大堆问题没解决。
第一个难题是怎么评估才合理。现在用的精确匹配标准太严了——如果提取出来的译文和标准答案意思完全一样,只是换了个同义词或者调整了语序,也算错 [1]。就像你让别人帮你找”苹果”,他给你拿了个”Apple”,你说不对,因为我要的是”苹果”两个字。研究人员自己也承认,这个指标可能过于严格,不能反映语义上的正确性 [1]。怎么设计更符合人类直觉的语义级评估指标,是个开放问题。
第二个难题是多语言覆盖不足。目前的基准整体偏英语中心,真实噪声样本里大部分是英语的解释和说明 [1]。那如果是中文大模型翻译法语,输出里的噪声是中文的,现有的方法还能好用吗?不好说。不同语言的噪声模式可能很不一样,比如有些语言的模型喜欢用母语解释,有些喜欢用目标语解释。
第三个难题更根本:模型在演化,噪声也在演化。今天总结出的 12 种模式,明天新出的模型可能又整出新的花样 [1]。这就像病毒和疫苗的关系——你刚研究出对付旧毒株的方法,新毒株又出现了。噪声模式的归纳是基于现有模型的,未来的模型会不会有完全不同的”废话”习惯?谁也不知道。
另外还有一些技术上的瓶颈。一个合理的猜测是,除了目前测试的两种基本提取思路,还有很多可能的方向值得探索:比如用文本对齐的方法找原文和译文的对应关系,或者用编辑距离来判断哪部分是多余的,又或者用多个模型集成投票。这些方法能不能突破 54% 的天花板?还需要更多研究。
如果你只记住一件事
大模型翻译的”话痨”问题,不是你用得不对,而是一个普遍存在且尚未解决的技术挑战:检测一段输出有没有废话很容易,但精准把干净译文抠出来却难得多——目前最好的方法也只有约一半的成功率 [1]。
下次再遇到大模型给你翻译时”加戏”,你就知道:这不是针对你,这是整个行业都在头疼的事儿。
参考文献
- TransClean: A Benchmark for Detecting and Extracting Clean Translations from Large Language Model Outputs(arXiv (Cornell University)、2026、全文精读)
- AI Life A Mother-agent Architecture for Heritable, Lifelong and Evolutionary Agentic Systems From Platform Competition to Governed Agent Lineages, with Financial-Market Applications(SSRN、2026、仅摘要)
- KOLLEKTİV FƏALİYYƏTİN QİYMƏTLƏNDİRİLMƏSİNDƏ MULTİ-AGENT SİSTEMLƏRİNİN TƏDQİQİNİN VƏ TƏTBİQİNİN MÜASİR PROBLEMLƏRİ(Scientific Journal、2026、仅摘要)
- Multi-Agent AI Systems for Autonomous Software Development(SSRN、2026、仅摘要)
- LLM Agents in Transportation-enabled Service Platforms: From Behavioral Simulation to Platform Decision Support(SSRN、2026、仅摘要)
- Ask Language Model to Clean Your Noisy Translation Data(arXiv (Cornell University)、2023、仅摘要)
- What do Large Language Models Need for Machine Translation Evaluation?(arXiv (Cornell University)、2024、仅摘要)
- Refining Translations with LLMs: A Constraint-Aware Iterative Prompting Approach(arXiv (Cornell University)、2024、仅摘要)