对于一批 AI 翻译的内容,您的本地化团队有两种选择:在发布之前审核每个部分,或者相信输出结果并按原样发布。这两种方法在大规模应用时都行不通。

一个太慢了。另一个风险太大。

AI质量评估提供了第三种选择。与其等待人类 翻译后判断质量它在翻译过程中预测质量,准确地标记出哪些部分可能需要再次检查,并让其余部分继续进行。评价不再是非此即彼。

本文将详细介绍什么是人工智能质量评估、置信度评分的工作原理以及它在人工智能领域中的作用。 本地化工作流程中的人工审核以及它如何在不消除人为判断的情况下改变质量的经济格局。

 

什么是人工智能质量评估

AI质量评估无需与人工参考进行比较即可预测翻译质量。

基于翻译错误模式训练的模型会为每个翻译片段生成置信度信号。

它与传统截然不同 语言质量保证 (LQA)。LQA 在翻译完成后对其进行评估,使用人工审校员或参考翻译来评分质量。质量评估在翻译之前或翻译过程中进行,可以立即向团队发出信号,让他们采取行动,而无需等待审核周期。

输出结果是分数,而不是判决结果。你的团队如何处理分数取决于工作流程如何路由标记的片段。

 

人工智能质量评估的工作原理

Quality estimation models are trained to recognize the patterns that signal likely translation errors. Ambiguous phrasing, 术语不匹配结构异常和低置信度引擎输出都作为模型可以评分的特征出现。

每个翻译片段都会获得一个置信度评分,反映出输出结果的准确可能性。分数位于工作流程中,随时可供下游路由规则执行。

置信度低的部分需要人工关注。高置信度的片段无需人工检查即可继续推进,其依据是决定项目最初使用哪种翻译方法的相同路由逻辑。

 

AI质量评估在工作流程中的位置

质量评估是翻译工作流程的一部分,而不是一个单独的审核流程。一旦获得置信信号,你的团队进行评审的方式将发生四项变化。

 

出版前筛选

出版前筛选是质量评估发挥作用的第一站。每个片段在发布前都会进行评分,这些评分会驱动下游路由,而不是保存在仪表板中以供以后审查。

另一种选择是大多数球队所继承的。错误往往在出版后才显现出来,例如客户投诉、抽查审核或差评等情况引起人们的注意,而此时纠正错误的成本远高于预防错误的成本。

 

基于置信度的路由

基于置信度的路由将每个分数转化为工作流程决策。低于置信度阈值的文本片段将提交人工审核;高于置信度阈值的文本片段将直接发布,无需人工检查,其规则与项目使用的翻译方法相同。

翻译工作流程管理 已经按风险、内容类型和语言对内容进行路由, Smartling 的动态工作流 在机器翻译步骤之后,将质量评估水平作为额外的决策标准。质量评估会向同一工作流引擎添加另一个路由信号,因此需要决定是否发送该信号。人工审核环节从数量驱动转变为数据驱动。

 

降低审核成本

评论员会把时间花在真正需要关注的部分上。Smartling's 语言质量评估 (LQE)代理对每个机器翻译片段进行评分,并估计需要多少人工编辑。审查工作重点放在模型显示的、置信度较低的部分,而不是对每个项目进行固定比例的抽样。

经济形势也随之改变。过去需要按比例增加审核人员才能完成审核的工作量,现在可以通过模型置信度来清理流程,人工审核也从瓶颈变成了有针对性的步骤。

Personio 在其支持内容中看到了这种转变。这家人力资源技术公司预测,通过将内容路由到其他渠道,内部审核时间将减少 50%。 机器翻译 采用适当的基于置信度的审查路径,同时削减翻译预算 40%。腾出的审校能力被重新投入到扩大语言覆盖范围,而不是增加人员配备。

 

防止幻觉的防护措施

质量评估还能起到一定的防护作用。 LLM幻觉.

当一个 AI 翻译 如果内容与源文件存在差异,例如引入不存在的内容、删除存在的内容或不准确地呈现术语,置信度评分可以在发布之前发现问题。

Smartling 的 AI Hub 增加了幻觉缓解和 LLM 提供商控制,这些控制与质量信号协同工作。这些层共同作用,使 AI 输出受到控制,而不是任由原始模型在任何给定请求下产生任何结果。

Netskope 说明其对运营的影响。这家网络安全公司使用 Smartling 的 AI Hub,通过治理控制,使 AI 输出能够大规模地随时投入生产,从而实现了周转时间缩短约 95%,并在一年内节省了数十万美元。

 

传统评审与人工智能质量评估

传统译后审校和人工智能质量评估以不同的方式解决相关问题。

 

因素

传统译后审校

人工智能质量评估

当这种情况发生时

翻译完成后

翻译之前或翻译过程中

它需要什么

人工审校或参考翻译

无需人工参考即可获得信号

覆盖范围

通常情况下,由于审稿人能力有限,会提供样本。

每个片段均自动评分

审查工作

均匀分布在内容中

专注于已标记的、置信度较低的细分市场

发布速度

受审稿人可用性限制

高置信度内容立即移动

 

如果没有质量评估会发生什么?

如果没有质量评估,评论就会走向两个极端之一。要么对每个片段进行审核,这会减慢交付速度并限制内容规模;要么审核范围缩小到抽样,这会导致错误漏网。

即使有样本,审查资源也会平均分配到各个内容中,而不管哪些部分实际上存在风险。资深审校员以同样的速度审查常规支持文章和法律免责声明。

 

国际商业机器 展示了大规模定向审查能够产生怎样的效果。这家科技公司通过配对翻译,将翻译质量提高了 40%,并将平均上市时间缩短了 50% 以上。 人工智能人机翻译结合人工验证 与其对所有部分进行全面审查,不如在最重要的部分进行审查。

质量评估并不能消除人为判断。它能准确地告诉你的团队,这种判断力应该用在哪些方面。

 

将质量转化为信号,而非评判。

质量评估将翻译质量从事后判断转变为团队在内容发布前采取行动的信号。基于置信度的路由可以让你的团队逐个审查异常情况,而不是审查所有内容。 

 

如需了解 Smartling 如何帮助您大规模保持翻译质量,请立即与我们预约会面。

关于人工智能质量评估的常见问题

什么是人工智能翻译质量评估?
AI质量评估是一种无需与人工参考进行比较即可预测翻译质量的方法。根据翻译错误模式训练的模型会为每个翻译片段生成置信度或质量分数,从而为您的团队提供一个信号,将低置信度的内容路由到人工审核,并允许高置信度的内容无需审核即可发布。
质量评估与传统的生命周期质量评估有何不同?
传统的语言质量保证 (LQA) 在翻译完成后对其进行评估,使用人工审校员或参考翻译来评分质量。质量评估可以在翻译之前或翻译过程中预测质量,无需等待人工判断。LQA衡量的是已经发生的事情;质量评估为接下来发生的事情提供信息。
人工智能质量评估能否取代人工审核?
不,质量评估会随着人工审核员投入时间和地点的变化而变化,而不是取决于是否需要他们。置信度低的内容仍然需要人工审核,而高曝光度或受监管的内容无论置信度得分如何,仍然需要人工验证。目标是进行有针对性的审查,而不是取消审查。
人工智能对质量的评估准确率如何?
模型准确率取决于训练数据、语言对和内容类型。训练有素的模型能够可靠地处理大量标准化的内容,并据此做出路由决策,同时将细致入微或受监管的内容留给人工直接审核。您的团队会根据内容的风险状况来校准置信阈值。
质量评估是否适用于所有语言对?
质量评估适用于现代机器翻译和人工智能翻译支持的大多数语言对,尽管模型置信度有所不同。训练数据较少或结构差异较大的语言对会产生更多可变信号,因此需要对这些语言对降低置信度阈值或扩大人工审核范围。

里根-怀特

本地化专家
Reagan White 是一位本地化专家,拥有帮助全球品牌简化翻译工作流程和扩展多语言内容的丰富经验。她拥有翻译技术和国际内容战略方面的背景,她撰写的文章涉及本地化自动化、人工智能翻译以及构建高效全球运营的最佳实践。

立即体验更智能的翻译

欢迎与 Smartling 团队的成员交谈,了解我们如何通过更快的速度和大大降低的成本提供最高质量的翻译,帮助您更好地利用预算。
Cta-Card-Side-Image