如何衡量 GPT、Claude 和 DeepL 的翻译质量?

快速回答

对 GPT-4o、Claude 3.5 Sonnet 和 DeepL 等引擎的翻译质量进行基准测试需要三个组成部分:从实际内容类型和语言对中提取的代表性测试集、使用 BLEU、MetricX 或 COMET 等指标的标准化自动评分,以及在所有引擎中应用相同一致的评估框架。没有哪一款引擎能够在所有语言对和内容类型上都胜出。基准测试的实际目标是确定哪个引擎最适合大规模处理您的特定内容,然后自动将生产作业路由到该引擎。Smartling 的 AI Hub 会持续评估引擎性能,并将每个字符串路由到其语言对和内容类型性能最高的引擎。

为什么翻译引擎的基准测试并非易事

翻译引擎的性能会因语言对、内容类型和领域而异。能够生成出色的西班牙语营销文案的引擎,在处理日语技术文档时可能表现不佳。仅基于公共测试集构建的基准可能无法反映贵组织的实际内容,这意味着标准化评估中的获胜者可能并非生产环境中的获胜者。

翻译基准测试中最常见的三个错误是:测试集太小、对不同的引擎应用不同的评估标准,以及将基准测试运行视为一次性决策而不是持续的测量。LLM 翻译质量会随着每次模型更新而变化,这意味着六个月前排名第三的引擎现在可能已经超过了之前的领先者。

 

自动评分方法究竟衡量的是什么

 
BLEU(双语评估替补)

BLEU 分数衡量机器翻译输出与人工参考翻译之间的重叠程度,以 0 到 1 之间的值表示。BLEU 快速且被广泛用作基准,但它奖励的是表面词语匹配而不是语义准确性,这意味着流畅的幻觉可能会获得高分,而正确但措辞不同的翻译得分却很低。对于企业基准测试而言,BLEU 可用作第一道筛选条件,但作为独立的质量信号则不够充分。

 
MetricX 和 COMET

MetricX(谷歌)和 COMET(Unbabel)是神经评估指标,它们使用语言模型,通过比较源文本、机器输出和参考翻译在语义维度上的表现来评估翻译质量。两者与人类判断的相关性都比 BLEU 更强,尤其是在检测流畅性错误和意义转变方面。对于大规模评估 LLM 转换的企业项目而言,MetricX 和 COMET 提供的信号比单独使用 BLEU 更可靠。

 
人工评估作为验证层

自动指标衡量翻译质量相对于参考文本的偏差。人工评估员会评估翻译是否符合语境、保持品牌调性,以及是否能让母语人士读得自然流畅。对于高风险内容类型,自动化基准测试可以缩小范围,而人工评估则可以在做出生产路线决定之前验证获胜者。

 

如何运行能够产生可操作结果的翻译基准测试

  • 构建具有代表性的测试集。从您的实际生产内容中选择 200 到 500 个源字符串,涵盖您最关心的语言对、内容类型和域。基于通用公共测试数据建立的基准测试无法预测引擎在您的营销文案、帮助中心文章或产品 UI 字符串上的性能。
  • 将相同的字符串分别输入到每个引擎中。将相同的源字符串提交给 GPT-4o、Claude 3.5 Sonnet、DeepL 和任何其他正在评估的引擎,而不进行预处理,它们之间没有差异。只有控制好实验条件,才能将发动机性能与其他变量隔离开来。
  • 以MetricX或COMET为主要指标进行评分。对所有输出结果采用相同的评分标准。按语言对和内容类型跟踪分数,而不是对所有结果取平均值,因为汇总分数可能会掩盖每种语言之间的显著差异。
  • 在进行比较之前,请先使用您的翻译记忆库和词汇表。企业翻译质量部分取决于翻译引擎与您现有语言资源的集成程度。在包含您的术语表和 TM 的条件下对发动机进行基准测试,而不是孤立地评估发动机的原始输出。
  • 制定持续监测计划。LLM的翻译功能会随着每个模型的发布而变化。基准测试运行是某个时间点的快照。如果团队根据持续的绩效数据而不是单一的基准决策来分配工作,那么随着时间的推移,他们的工作质量会保持得更好。

当翻译基准测试成为正确的优先事项时

企业项目正在评估应该使用哪个 LLM 或 MT 引擎作为生产翻译的默认引擎,并且需要客观、可重复的数据来支持决策。
注意到不同语言对之间的质量差异,并希望了解将不同的语言对路由到不同的引擎是否会提高整体输出质量的团队。
组织机构在引入新引擎之前,需要验证其性能是否与其现有生产基准相符。
旨在通过识别哪个引擎能够为其特定内容类型生成最强的第一遍输出来减少人工编辑时间的程序。

何时可能不需要正式的基准测试

⚠️

在人工智能翻译应用的早期阶段,建立基本工作流程、词汇表和翻译记忆库是当务之急,引擎的选择可以推迟到翻译量足以证明基准测试投资的合理性之后。

⚠️

团队使用内置引擎路由的平台,该平台可以自动评估和路由,基准测试由平台处理,而不是由本地化团队手动处理。

Smartling 如何处理引擎基准测试和路线规划?

Smartling 的 AI Hub 可评估 20 多个语言学习模型和机器翻译引擎的翻译质量,包括 GPT-4o、Claude 3.5 Sonnet、 DeepL 、Amazon Bedrock、Google Vertex 等。Smartling 的 AI 团队定期使用 MetricX、COMET 和 BLEU 进行基准测试,以评估引擎在不同内容类型和语言对上的性能。这些结果为Smartling 的自动选择路由功能提供了信息,该功能会将每个字符串分配给其特定语言对和内容类型的性能最高的引擎,而不是普遍应用单个引擎。

对于想要进行自己比较的企业团队,Smartling 的平台支持可配置的 LLM 配置文件,允许团队在设置默认路由规则之前,在生产内容上测试不同的引擎配置。

 

帮助文档: Smartling 自动选择 MT

帮助文档: Smartling 自动选择 LLM

对 GPT、Claude 和 DeepL 的翻译质量进行基准测试

Smartling 的 AI Hub 会评估 20 多个语言模型和机器翻译引擎的翻译质量,并将每个字符串路由到其语言对和内容类型性能最高的引擎。了解企业团队如何使用自动选择功能来消除引擎选择的猜测环节。