如今的国际商业战略要求内容以前所未有的速度在不同语言间传播,这在以往任何一个十年都会让翻译团队不堪重负。

机器翻译(MT) 现在已成为企业内容扩展的核心,但其提供的翻译质量可能不稳定。

即使在同一个项目中,机器翻译的输出也会因语言对、内容类型和工作流程的不同而有所差异。这种差异比平均质量得分更重要,因为纠正高可见度内容中一个不一致的字符串所花费的时间会抵消机器翻译带来的效率提升,而正是这种效率提升才使得机器翻译变得值得。

每个企业本地化项目在大规模采用机器翻译时都会面临同样的权衡:速度与流畅度、成本与质量、规模与控制。

Platforms built for MT quality governance turn variable output into reliable translations through terminology controls, automated review paths, and consistent measurement.

Smartling就是这样一个平台,本文将详细介绍机器翻译质量究竟是什么,如何衡量它,以及如何在内容量增长时保持其一致性。

什么是机器翻译质量?

机器翻译质量是指翻译内容在多大程度上准确、自然地反映了原文的含义。质量指标包括准确性、流畅性和一致性。

机器翻译质量因语言对、内容类型以及围绕这两者构建的翻译工作流程的完善程度而异。

例如:

  • 需要语气调整的营销内容与需要术语精确性的技术文档相比,对质量的要求有所不同。
  • 拥有丰富训练数据的语言对与数据有限的语言对会产生不同的基准输出。

 

决定机器翻译质量的因素有哪些?

五个因素决定了 MT 发动机能否为特定作业产生可用输出。

语言对复杂度。有些语言对,例如英语-西班牙语英语-法语,拥有数十年的高质量训练数据。其他机器的机器数量则少得多,机器翻译的输出质量也反映了这种差距。

内容类型。技术文档需要术语精准。营销文案需要调整语气。法律内容需要两者兼备,并且还要忠实于字面意思。机器翻译缺乏理解细微差别的能力,因此在这三种情况下表现并不相同。

上下文可用性。能够访问周围段落、文档结构和视觉上下文的机器翻译引擎比孤立地翻译字符串的引擎产生更好的输出。

培训数据使用特定领域和品牌特定数据训练的模型在处理专业内容方面优于通用引擎。

发动机或车型选择。仅依靠通用机器翻译来处理每种内容类型和语言对,无法产生一致、高质量的结果。LLM、微调的神经机器翻译 (NMT) 引擎和 RAG 增强模型各自以不同的方式处理不同的内容类型。与其默认使用机器翻译,不如针对每个翻译任务选择合适的模型,这样才能确保更高质量的翻译。

 

机器翻译质量的关键维度

机器测试质量可能指不同的因素,这取决于你问谁以及出了什么问题。这四个维度涵盖了整个情况,任何一个维度如果管理不当,都会成为决定项目成败的问题。

 

准确性

准确度衡量的是译文是否保留了原文的含义。流畅但不准确的翻译比生硬但不准确的翻译更难在审校中被发现,因此这类错误的风险更高。

 

流利度

机器翻译最常暴露其不足之处的地方就是流畅性。语法和用词是基本要求。更难的问题是语域:一个翻译引擎能够正确翻译,但当内容需要对话式表达时,它却写得像手册一样;反之亦然。

 

一致性

一致性会在悄无声息中大规模瓦解。同一个术语在产品用户界面、帮助文章和营销页面中以三种不同的方式呈现,会削弱用户的信任,并给团队带来不断累积的返工。

 

情境感知

上下文感知是区分翻译单词的引擎和翻译含义的引擎的关键所在。德语中的性别代词、根据屏幕不同而读音不同的用户界面标签,或者在一个市场中是习语而在另一个市场中是无意义的短语,都需要引擎进行解释,而不仅仅是转换。

 

Smartling 如何强化一致性

术语表强制执行翻译记忆库(TM) 重用可确保每个作业中都使用已批准的术语和先前批准的措辞。一旦某个术语获得批准,Smartling 就会在下次该术语出现时自动应用它,无论翻译是通过机器翻译 (MT)、人工智能翻译 (AI) 还是人工智能人工翻译 (AIHT) 进行的。

Smartling 的AI 翻译工具包更进一步。AI 术语插入功能确保替换词符合字符串的上下文且语法正确,而不是简单地替换术语。

在某些语言中,词汇表中的术语需要根据其在句子中的位置而改变词形变化,因此语法保障措施至关重要。AI 自适应翻译记忆库通过优化可用匹配项来提高机器翻译工作流程中翻译记忆库的利用率,因此即使周围内容发生变化,预先批准的措辞也能继续沿用。

对于比术语更注重一致性的内容(强调语气、语域或品牌声音),Smartling Transcreation Tool将创译记忆与翻译记忆分开。因此,创造性的改编不会影响标准的翻译工作流程,也不会在需要字面准确性的地方引入不一致之处。

 

如何衡量机器翻译质量

MT质量测量结合了三种方法。大多数企业程序会在工作流程的不同阶段使用这三种技术。

 

人为评估

人工评估依赖于训练有素的语言学家根据客观的错误类别审查翻译内容。多维质量指标(MQM)框架是这项工作的行业标准。

审校人员按类型(如准确性、流畅性、术语、风格和语言习惯)和严重程度(如中性、轻微、严重或危急)记录错误。该系统根据严重程度权重计算总体质量评分。

语言质量保证 (LQA)简化了 MQM 评估期间的人工审核。LQA 是基于抽样的,这意味着团队会审查一部分具有代表性的翻译内容,以得出整体质量的近似衡量标准,而不是检查每个字符串。

 

自动化指标

BLEU、COMET 和 TER 等自动化指标通过算法将机器翻译输出与参考翻译进行比较。它们运行只需几秒钟,可以处理数百万个字符串,并产生一致的数值分数。

它们与人类判断的相关性并不完美,因此自动化指标最适合作为早期预警信号,而不是最终的质量判定。

 

混合测量

混合测量结合了对抽样内容的人工审核和对完整语料库的自动评分。混合方法是企业生产中最常见的,因为它可以在测量深度和测量成本之间取得平衡。

 

Smartling 如何实现混合测量

Smartling 的LQA 套件可处理结构化的人工评估。语言学家根据可定制的 MQM 兼容模式评估翻译。LQA 会为每个错误分配一个严重级别,该级别将计入整体质量评分。

结果会按时间范围、地区、项目或作业显示在LQA 仪表板中,为本地化经理提供结构化的、数据驱动的视图,以了解质量现状以及质量下滑的方面。

对于大规模运行MT的团队来说,仅仅依靠抽样是不够的。语言质量评估 (LQE) 代理会自动评估每个机器翻译字符串,并根据预测的后期编辑工作量将每个字符串标记为高、中或低。

在动态工作流程中,高质量的字符串可以完全绕过人工审核;中等质量的字符串会被标记为需要进行少量编辑。审查工作会投入到最需要的地方。

这两个工具涵盖了测量问题的两端:对每个机器翻译字符串进行全语料库信号测量,以及对采样内容进行结构化的人工评分。两者都会输入到 Smartling Analytics 中,为团队提供数据,以优化工作流程、证明决策的合理性,并随着时间的推移对质量计划进行问责。

 

常见的机器翻译质量问题

企业级多任务处理程序中会出现五种故障模式。大多数此类故障都是工作流程问题,而不是模型问题。

直译。习语、比喻和特定文化语汇逐字翻译,而不是按含义翻译。在一种棒球没有文化分量的语言中,“本垒打”变成了棒球术语。

术语不一致。同一个品牌名称在同一个网站上出现了三种不同的翻译版本。产品名称在一个页面上被翻译,而在另一个页面上则保留英文原样。

语法错误。在形态比源语言更丰富的语言中,性别一致、动词时态和词序都会出现错误。当机器翻译引擎缺乏关于句子主语或宾语的上下文信息时,就会发生这些错误。

上下文错误。代词指向错误的先行词。同形异义词容易产生歧义。法律文件中一个词的意思,在日常用语中却被翻译成另一个意思。

文化差异。正式程度、敬语和文化典故与听众所期望的语体不符。

 

机器翻译与人工翻译的质量比较

机器翻译和人工翻译不能互换。它们提供不同的内容,各有优缺点。

 

因素 机器翻译 人工翻译
速度
成本
质量 可变
可扩展性 缓和

 

两种方法各有优劣,没有绝对的优劣之分。对于企业级项目来说,正确的问题是哪些内容应该放在哪个轨道上,以及如何随着内容量的增长自动进行路由。

Smartling AutoSelect 通过在翻译时评估内容并将其发送到最合适的机器翻译引擎、LLM 或人工工作流程步骤来解决路由问题。如果选定的引擎无法生成高质量的翻译,AutoSelect 会尝试使用次优选项,如果需要,则会回退到人工工作流程步骤。

对于想要更多控制权的团队,AutoSelect 支持将定制训练的引擎与标准机器翻译提供商轮换使用。这意味着特定领域的内容,例如法律、医疗或高度技术性的内容,可以路由到为其构建的引擎,而一般内容则走标准路径。这样就形成了一个能够适应内容复杂性的路由层,而不是对所有内容都应用单一的路由引擎。

 

如何提高机器翻译质量

通过五种策略提高机器翻译质量,每种策略都针对工作流程的不同部分。

使用术语表。经批准的术语在字符串和作业中保持一致性。如果没有词汇表,同一个品牌术语在同一内容中会有三种不同的表达方式。

提供背景信息。片段级元数据、视觉上下文和周围内容可提高机器翻译准确率。孤立地翻译字符串的引擎缺乏正确解决歧义所需的信息。

采用混合工作流程。 机器翻译后编辑(MTPE)将机器翻译输出与人工审校相结合。MTPE 利用人类语言学家来清理原始的机器翻译输出。在进行审核步骤之前,Smartling 的 AI 后期编辑代理会自动检查语法、语气和语义准确性——这样语言学家就可以纠正剩余部分,而不是从头开始重建。

规范流程。团队如果使用相同的词汇表、翻译记忆库和审核步骤,并按照一致的工作流程处理内容,就能获得一致的质量。团队对每个项目的处理方式各不相同,最终得到的质量也反映了这种不一致性。

监控性能。LQA 样本、LQE 评分和错误趋势报告显示质量在出现问题之前就已偏离正轨,从而避免给客户带来困扰。如果没有监控,质量问题只有在外部有人指出后才会显现出来。

 

Smartling 如何提高机器翻译质量

Smartling 的 AI 译后编辑代理会在机器翻译输出到达人工审校员之前自动运行,检查语法、语气和语义准确性,并利用您的语言资源丰富翻译,使输出更接近可发布状态。

语言学家会修正剩余的部分,而不是从头开始重建。结合语言质量评估(LQE)代理,该代理根据预测的后期编辑工作量,将每个机器翻译字符串标记为高、中或低。

因此,团队可以将需要关注的字符串路由到审查部门,并直接发布高置信度的字符串,而无需不考虑实际风险而对每个字符串一视同仁。

 

如何在规模化生产中保持质量

提升机器翻译质量与改进单个翻译是不同的问题。规模化之后,质量取决于工作流程在成千上万甚至数百万个字符串上应用质量控制的可靠性。可靠性取决于四个原则。

工作流程标准化。同一种内容类型每次都经过相同的工作流程。营销内容在营销工作流程中流转。支持内容在支持工作流程中流转。质量取决于项目的所有者。

自动化内容从源系统进入翻译工作流程,无需人工交接。审批流程自动进行。翻译后的内容无需导出导入即可返回源系统。当字符串发生变化时,工作流会检测到它,而不是项目经理检查电子表格。

集中式质量跟踪。LQA 分数、LQE 分布和误差趋势都集中在一个地方。团队会在数百个其他字符串中出现不一致之处之前,发现不同语言和内容类型之间的不一致之处。

持续改进。随着新术语和新模式的出现,词汇表、翻译记忆库和提示模板也会随之更新。随着内容量的增长,质量基准会随着时间的推移而提高,而不是保持不变或下降。

如果以上四个原则不能协同运作,规模化的质量就会变成一个平均问题——总体上足够好,但在最重要的具体情况下却会出错。

Personio 用实例说明了这种转变在实践中的样子。这家人力资源软件公司手动从 Zendesk 复制源内容,将文件通过电子邮件发送给翻译机构,然后再将翻译结果粘贴回来。这种方法在小批量生产时有效,但如果不增加人手,就无法扩展到其他语言。

Personio 的内容教育团队将本地化程序集中到 Smartling 上,并引入机器翻译来支持内容,预计可节省 40% 的当前翻译预算,并将内部审核时间至少缩短一半。机器翻译处理大量标准化的帮助内容,而人工审核处理真正需要审核的内容。Personio 现在正将预算重新投入到公司之前无力支持的语言中。

 

机器翻译质量差的风险

当团队不管理 MT 质量时,下游影响会在四个可预见的地方显现出来。

品牌形象不一致。产品名称、标语和核心品牌语言因市场而异。顾客在不同的网站上会看到同一品牌的不同版本。

顾客感到困惑。产品描述、支持文章和结账流程在目标语言中产生的说明不够清晰。客户放弃、滥用或升级。

合规性问题。法律、医疗和金融等受监管类别的内容,如果翻译中缺少必要的语言或引入不准确之处,就会存在风险。有些行业将翻译错误视为违规行为。

返工增加。出版后才会出现质量问题,需要人工清理。事后修改内容的成本超过了第一次就正确翻译的成本。

 

如果没有质量体系会发生什么?

缺乏结构化质量体系的本地化项目都会遇到以下四种模式。

输出结果不稳定。由于没有共同的资源或规则来约束内容,因此术语、语气和措辞各不相同。

人工质检延误。质量取决于每个审阅者能否逐一发现问题。质量保证环节反而成了其他工作流程本应消除的瓶颈

能见度不足。没有人回答有关质量的基本问题,包括质量的优势所在、质量的下滑趋势,以及哪些语言或内容类型风险最大。

可扩展性差。增加语言和内容量会成倍增加协调成本,而不是利用可重用的资源。每个新地点都和第一个地点一样具有挑战性。

 

机器翻译质量是一个系统性问题。

MT质量本质上是不稳定的。引擎选择、内容类型、语言组合和工作流程设计都会影响输出结果,没有任何单一策略能够单独产生一致的质量。

成功的团队依靠的是系统,而不是孤立的机器翻译。在该系统中,结构化的工作流程对每项工作都应用一致的质量控制。自动化流程无需人工交接即可将内容流经这些工作流程。质量测量可以显示哪些方面的产出强劲,哪些方面正在下滑。

大多数企业团队都拥有这种基础设施的一部分,而质量问题就隐藏在这些基础设施中。Smartling 通过将结构化工作流程、自动化和质量衡量整合到一个平台中来弥合差距,为团队提供了一条可重复的 MT 质量提升路径,该路径可以随着内容量而不是人员数量而扩展。

如果您想了解 Smartling 如何将所有功能整合到一个平台上,请预约演示

常见问题解答

什么是机器翻译质量?

机器翻译质量衡量的是翻译内容在多大程度上准确、自然地反映了原文的含义和语气。评估内容包括准确性、流畅性、一致性和语境意识。

机器翻译的质量会因语言对、内容类型和工作流程而异,因此企业程序会衡量和管理机器翻译的质量,而不是想当然地认为机器翻译的质量很好。

如何衡量MT质量?

三种常见的方法是:使用 MQM 框架进行人工评估(通过 LQA 实现);使用 BLEU 和 COMET 等自动化指标;以及将抽样的人工审查与对整个语料库的自动评分相结合的混合测量。

Smartling 的 LQA 仪表板和语言质量评估代理 (LQE) 支持混合模型的两方面。

影响机器翻译质量的因素有哪些?

影响MT质量结果的五个因素。语言对的复杂性、内容类型、上下文可用性、训练数据覆盖率和模型选择都会影响输出结果。

工作流程设计与上述任何因素都同样重要,因为大规模的质量取决于术语表和翻译记忆库等控制措施的可靠应用。

机器翻译可信吗?

机器翻译能够可靠地处理符合模型优势的内容,并通过应用正确质量控制的工作流程进行运行。具有术语表强制执行和自动质量检查的低风险内容可以高信心发布。

在营销、监管和品牌关键类别中,高可见性内容应该通过混合工作流程(如 MTPE 或 AI 后期编辑)进行处理,其中 LLM 和人工验证增加了一层质量验证。

里根-怀特

本地化专家
Reagan White 是一位本地化专家,拥有帮助全球品牌简化翻译工作流程和扩展多语言内容的丰富经验。她拥有翻译技术和国际内容战略方面的背景,她撰写的文章涉及本地化自动化、人工智能翻译以及构建高效全球运营的最佳实践。

立即体验更智能的翻译

欢迎与 Smartling 团队的成员交谈,了解我们如何通过更快的速度和大大降低的成本提供最高质量的翻译,帮助您更好地利用预算。
Cta-Card-Side-Image