您还需要在意翻译质量吗?

只要问起任何一家人工智能翻译服务的质量,大概都会有人给您一个数字。通常是一个百分制分数。这个分数往往通过某种评定翻译质量的标准公式计算得来。它看似能以简单、客观且明确的方式,告诉您哪家服务商的翻译质量“最好”。而且,几乎可以肯定,您正在咨询的那家服务商会名列榜首。“数据为王”的理念盛行了几十年。如今,我们也已明白:数据可以按照最有利于讲述者的方式来解读。

坦白说。如果您向 DeepL 询问翻译质量,也会得到同样的回应。我们会向您分享 3 月开展的一项质量基准深入分析:语言专家参与了 48000 次盲测。结果显示,在涵盖 16 个语言对、与五家主要竞争对手(包括当前最强大的所有大型语言模型)的测试中,DeepL 在 94% 的测试组中胜出。对此,我们并不避讳。

然而,有一件事是人工智能翻译行业没人愿意承认的。每当测试结果发布时,这个令人不快的事实总会被悄然掩盖。我们衡量的质量差距正在不断缩小。事实上,差距之小,已有人认为它不再重要。

就目前而言,各类人工智能对书面文本的翻译总体上都已达到不错的水平。非专业人士很难第一眼发现其中的错误。各家之间的差异极其细微,往往体现在微妙之处,也颇具主观性。这在一定程度上解释了为何市面上会出现如此多不同的排名,也解释了为何领先模型总能轻易找到对自己有利的榜单。

那么,在选择人工智能翻译服务商时,您是否仍应将质量视为一项差异化因素?我认为应该。但您真正需要关注的,并不是测试分数所衡量的质量。

人工智能翻译在标准化质量测试中的表现,与它在实际应用中为所在机构及内容所呈现的效果,正日益显现出差距。在测试中,质量差距看似微乎其微。但在现实环境中,各家之间的差异要大得多,而且确实会对业务产生实质性影响。

人工智能翻译质量测试衡量什么

为了说明这一点,我们不妨更仔细审视:标准化质量测试究竟衡量什么、如何衡量,以及最重要的:哪些因素并未纳入其中。

人工语言专家在评估译文时,通常会采用多维度质量指标(MQM)框架,其中包括八个不同的翻译质量维度。通过为这些维度设定指标并确定各自的权重,便可以构建一个公式,用单一数值评分对质量进行量化。

MQM 的维度包括准确性(目标语言译文与源语言原文内容的吻合程度),也包括译文流畅度(译文在目标语言中是否自然流畅)、领域专用术语(专业术语是否翻译准确)、风格还原程度、是否遵循当地惯例等诸多要素。

不同翻译质量评分公式的含义

邀请专业语言人员评估译文既复杂,成本也高昂。实际上,许多与人工智能服务商相关的翻译质量排名根本未采用人工评估。它们采用的是以下某种自动评分系统。多年来,这些系统已日趋成熟。

  • 2001 年,IBM 推出了双语评估辅助工具(BLEU)。它通过分析机器译文与同一源文本的人工译文之间的接近程度,来评估机器翻译。问题何在?这种方法假定参考译文就是最佳译法,任何偏离参考译文的内容都会被视为错误。
  • 2006 年,这一方法经过调整,演变为译后编辑率(TER)评估。它计算的是,要将机器译文修改成人工译文,人工译员所需的编辑量。它与 BLEU 类似,但在这一体系中,数值越低越好。
  • 2020 年,Unbabel 推出了跨语言优化翻译评估指标(COMET),利用神经网络模型,将机器译文同时与人工译文和源文本进行比较。与 BLEU 和 TER 不同,它会参考原文,尝试判断文本含义。
  • 2023 年,随着基于 GPT 估算指标的评估(GEMBA)推出,自动评估迈入了大型语言模型(LLM)时代。GEMBA 通过提示大型语言模型,依据 MQM 的不同维度评判译文表现。

自动化翻译评估不断发展,实用性日益提升,但仍无法完全媲美人类专家的判断。当大型语言模型承担质量评估的主要工作时,便会遇到偏见问题:它们总是偏向由自身模型生成的译文,即便这些译文在准确性上有所欠缺。这在一定程度上源于翻译质量本身的主观性。实际上,这就像是人工智能模型在批改自己的翻译作业,并认定自己的答案最好。

作为自动评估年度会议的第十届大会,WMT25 对此得出了十分明确的结论:“在自动化指标中名列前茅的系统,并未在人类评估中持续胜出。这表明指标偏见依然存在,也进一步印证了人类评估仍应是裁定翻译质量的最终依据。”

换言之,如果您真正想了解翻译质量,就应询问人类专家(DeepL 的基准测试正是如此)。随着不同人工智能之间的翻译质量差距不断缩小,人类对于如何权衡各项要素的判断也愈发宝贵。质量差异已不再显而易见。至少在标准化质量测试中是如此。

翻译质量测试遗漏了什么:上下文、确定性和一致性

不过,正如我之前提到的,测试所衡量的翻译质量,并不等同于您在实际应用中体验到的翻译质量;在复杂组织中管理翻译和本地化工作时,尤其如此。事实上,恰恰是测试衡量的那些翻译质量要素,对业务的影响最大。

本文提到的大多数框架和评分体系都属于“分析式”评估。它们通常会比较原文与译文的“片段”,而这些片段一般只是一个个独立的句子。它们还会孤立地评定每个句子的翻译质量,仿佛这个句子与文本中其他位置的句子毫无关联。

但我们实际阅读译文时的体验完全不是这样。这种体验是“整体性的”。它不仅包括我们当时正在阅读的句子,也包括该句子所属的整篇文本。它还包括我们从某个组织接触到的其他所有沟通内容。在这种整体性的现实中,与所有译文整体的一致性和连贯性相比,单个句子的翻译质量或许没有那么重要。

每个组织都有自己独特的词汇体系,包括与产品和功能、业务领域、服务内容、战略概念等相关的术语和短语。这些术语能否始终采用一致译法,是衡量翻译质量的一个重要方面。如果帮助中心的译文与产品界面或行动号召按钮(CTA)上所用的术语不一致,那么翻译质量就是不佳。至于各处的单项翻译在技术上是否正确,并不重要。

如果人工智能翻译平台能够规模化规范术语、风格和语气(正如 DeepL 通过术语表、风格规则和翻译记忆库所做的那样),其价值便会大幅提升。相比之下,大型通用语言模型(Claude、Gemini、ChatGPT)在本质上具有概率性,这种特性以牺牲确定性、合规性和一致性为代价。在实际应用中,它们反而忽略了翻译质量真正重要的方面。

翻译质量测试遗漏了什么:质量表现是如何实现的

标准化翻译质量测试同样不关注质量表现是如何实现的,也不考量这种实现方式究竟能否规模化应用。

DeepL 自行开展的人工专家盲测显示,在高推理强度设置下,最新的大型通用语言模型可在特定语言对上达到具有竞争力的翻译质量。然而,为此,它们需要使用规模更大的模型、更广泛的任务承载面,以及更大的上下文窗口。 

这意味着它们会消耗大量 token(成本难以预测),耗时也长得多(至少慢 4 倍,最多慢 29 倍)。如果您通过 API 将人工智能翻译部署到产品中,这会造成很大影响。更重要的是,从质量角度来看,它们对译法的选择本身就更难预测。它们实际上会针对每项任务重新构思译法。因此,在一种语境中使用的术语和短语,换到另一种语境之后,沿用的可能性要低得多。 

如果您正以企业级规模开展翻译,这正是最需要密切关注的质量要素。对此,质量测试分数几乎无法提供任何有用信息。

我们为何要构建由客户掌控的整体质量观

基于这些原因,自动化测试分数对于判断翻译质量的参考价值十分有限。然而,这并不意味着,在您着手掌控自身翻译质量时,它们无法成为极为实用的工具。事实上,只要重新界定其作用,它们就极具价值。

DeepL 构建了全新的翻译质量评估(TQE)模型,利用专门打造的人工智能模型评估 DeepL 译文的质量。但关键在于,它并非只为译文给出一个“分数”,然后就此结束。它的作用是标示潜在错误和译文可以改进之处,以便引入人类专家参与优化改进。它承认,归根结底,真正具有决定意义的是人类的判断。

我们的 TQE 模型在分析文本时,会参考您在 DeepL 中使用的所有自定义功能。它不会孤立地分析翻译质量。它会结合上下文,检查所在组织的术语、风格和语气是否得到恰当应用。它呈现的,正是实际应用中真正重要的整体质量观。

如果您重视翻译质量(而且我认为您仍应重视),那么,这才是您真正应该关注的质量视角。关键不在于测试。关键在于找到适合您且契合内容、能在真实场景中切实奏效的翻译质量视角。

有兴趣使用 TQE 评估翻译质量?您可以前往 DeepL AI Labs,了解所有详细信息以及加入 TQE 测试环境的方式。

分享