企业如何检测人工智能生成的翻译中的幻觉?

快速回答

AI 生成的翻译出现幻觉,是因为大型语言模型 (LLM) 生成的输出流畅但语义错误,生成听起来自信的文本,但实际上歪曲了原文。企业级检测依赖于自动化质量评估、回退路由和人工参与审核来检测高风险内容。当使用 LLM 作为翻译提供程序时,Smartling 的幻觉检测功能默认启用,会自动标记潜在的幻觉,并将受影响的字符串路由到其他提供程序或工作流程,而不是允许不准确的输出到达发布平台。

人工智能翻译中的幻觉是什么?

当使用大型语言模型进行翻译时,它们可以生成听起来自然流畅的输出,但并不能准确反映源内容的含义。这种行为被称为幻觉。

与直接翻译错误不同,幻觉并非明显错误。输出结果看起来像是语法正确、上下文合理的文本,这使得通过简单的审核很难发现问题,也更难大规模地检测出来。LLM本质上是捏造内容,使其符合目标语言的表面模式,而没有保留源语言的语义意图。

对于企业本地化团队而言,这是一个重大的风险。对品牌至关重要的营销内容、监管披露、产品文档和面向客户的界面都需要流畅且准确的翻译。在药品标签、财务披露或安全说明中出现法学硕士式的幻觉,会带来真正的商业、合规和声誉后果。

 

幻觉如何在局部内容中表现

人工智能翻译产生的幻觉往往呈现出几种可识别的模式:

  • 添加或捏造的内容:LLM 插入源文件中不存在的信息,例如扩展的解释、虚构的产品声明或模型推断而不是翻译的其他上下文。
  • 省略内容:由于模型在生成流畅输出时降低了对来源中的关键短语、限定词或免责声明的优先级,因此将其删除。
  • 语义倒装:短语的含义发生颠倒或实质性改变,而表面结构仍然合理。这种情况在否定句、条件句和限定性陈述句中尤为常见。
  • 术语不一致:模型在同一文档中对同一概念使用不同的术语,或者使用听起来合理但上下文中技术上不正确的术语进行替换。
  • 上下文窗口故障:当内容超出模型的有效上下文窗口时,后面的部分在翻译时可能会较少关注前面的源内容,从而产生虚假的延续。

 

为什么幻觉检测在企业规模上至关重要

人工审查可以发现小型程序中的缺陷,但无法大规模应用。企业本地化项目需要翻译数十种语言对的数百万个单词,如此庞大的数据量,任何人工审核流程都无法在不成为主要瓶颈的情况下实现全面覆盖。

解决方案是在翻译过程中进行自动检测:该系统在字符串进入工作流程之前识别潜在的错误内容,将标记的内容路由到备用提供商或人工审核,并保留标记内容及其原因的审计跟踪。

对于受监管行业的组织而言,翻译准确性是合规要求,这一点尤为重要;对于任何大规模部署 AI 翻译而无需人工审核每个字符串的企业而言,这一点也尤为重要。

当幻觉检测是首要任务时

以大型语言模型作为主要翻译提供者的组织,由于 LLM 输出的流畅性,使得通过标准审核流程更难检测到幻觉。
医疗保健、金融服务、法律和制药等受监管行业中,翻译不准确会带来合规风险,必须加以记录。
企业程序需要大量翻译面向客户的内容,因此对每一行字符串进行人工审核是不可行的,而自动化质量控制至关重要。
本地化程序采用 AI 翻译,无需人工干预即可完成所有内容的翻译,其中自动检测为低风险材料提供了主要的质量把关。
对于拥有品牌关键内容的组织而言,语义准确性与流畅性同等重要,而虚构的产品声明或品牌声明则代表着重大风险。
具有审计和治理要求的全球团队需要记录哪些内容被标记、如何处理以及最终由哪个提供商翻译。

当幻觉检测可能并非主要关注点时

⚠️

使用神经机器翻译引擎而不是 LLM 的程序,严格意义上的 LLM 意义上的幻觉不如其他质量故障模式(如术语不一致或结构错误)常见。

⚠️

低风险的内部内容,其主要质量要求是可理解性而不是语义精确性,错过幻觉的成本很低。

⚠️

非常短或结构化程度很高的内容,例如 UI 字符串或产品名称,由于格式受限,模型的生成能力受到限制,因此简单的质量检查就足够了。

企业检查清单:幻觉检测

 
检测能力
  • 该平台是否包含针对 LLM 生成的翻译的自动幻觉检测功能,并且默认启用该功能而无需手动配置?
  • 检测系统能否在字符串级别标记潜在的幻觉,以便可以重新路由单个问题字符串,而无需拒绝整个批次?
  • 能否将标记的字符串自动路由到其他翻译提供商或进行人工审核,而不是允许可能存在错误输出的内容继续执行?
 
透明度和治理
  • 该平台是否保留审计跟踪记录,记录哪些字符串被标记为可能产生幻觉,哪个提供商处理了原始输出,以及哪个提供商或审核员处理了回退输出?
  • 能否在 LLM 配置文件级别配置幻觉检测,从而使本地化团队能够控制如何将检测应用于不同的内容类型和工作流程?
  • 该平台是否能够按语言学习管理提供商、语言对和内容类型提供幻觉检测率的可见性,以便团队能够确定哪些组合会产生最大的风险?
 
与更广泛的质量控制相结合
  • 幻觉检测是否与其他质量控制措施(如基于 MQM 的 LQA 评分和语言质量评估)相结合,从而提供多层质量保证?
  • 该平台是否支持对被幻觉检测标记的内容进行人工审核,审核人员是否可以看到被标记的字符串、来源以及它将出现的上下文?

Smartling 如何进行幻觉检测

Smartling 的幻觉检测功能已内置于 LLM 翻译工作流程中,当 LLM 用作主要翻译提供程序时,该功能默认启用。当系统识别出可能包含幻觉的字符串时,它会自动标记该问题,并将受影响的字符串路由到其他提供商或工作流程,而不是允许输出继续发布。

Smartling 的 AI Hub 提供对 20 多个语言学习模型和机器翻译引擎的访问,自动选择功能可将内容路由到每种语言对性能最高的引擎。幻觉检测适用于中心内的所有 LLM 提供商,无论选择哪种模型,都能提供一致的质量管理。

 

准备好见证幻觉检测的实际应用了吗?

Smartling 的 AI Hub 包含用于 LLM 驱动的翻译工作流程的内置幻觉检测功能,具有自动回退路由和审计跟踪功能。了解 Smartling 的质量控制如何大规模保护企业本地化项目。