企业如何检测人工智能生成的翻译中的幻觉?

快速回答

人工智能生成的翻译中出现的幻觉很难被检测出来,因为它们听起来流畅自信,但语义上却是错误的。企业团队使用自动语义相似度评分来检测它们:非 LLM 模型评估翻译输出的含义是否与源字符串匹配。当相似度得分低于设定的阈值时,该字符串会被标记,并自动重新路由到其他 AI 提供商,而不是继续发布。Smartling 的幻觉检测使用了 Google Vertex AI 嵌入模型,该模型在 AI Hub 中默认启用。

为什么幻觉比其他翻译错误更难被发现

大多数翻译错误都可以通过阅读发现。对于懂原文语言的审校人员来说,翻译错误或遗漏的词语会非常显眼。幻觉则不同。一个会产生幻觉的大型语言模型,其输出在语法上正确,风格上流畅,作为翻译完全合情合理。错误在于语义:翻译后的字符串听起来没错,但意思与原文不同。

对于企业级数据量而言,审查每种语言的每个字符串是不切实际的。检测必须实现自动化,并在内容到达任何人工审核员之前集成到工作流程中。

 

自动幻觉检测的工作原理

自动幻觉检测使用语义相似度评分来比较翻译字符串的含义与其来源的含义。嵌入模型将每个字符串表示为语义空间中的一个向量,并测量它们之间的距离。当语义距离超过设定的阈值时,该字符串将被标记并重新路由以进行审核或重新翻译。

用于评估的嵌入模型与生成翻译的 LLM 是分开的,从而防止检测系统受到与翻译模型相同的偏见的影响。

当幻觉检测是首要任务时

企业程序使用大型语言模型作为主要或次要翻译提供程序,其出现幻觉的风险远高于使用传统神经机器翻译引擎的情况。
对于大量翻译面向客户的内容的组织而言,逐字逐句的审核是不可行的,而自动检测是发布前的主要质量把关。
医疗保健、制药、金融服务和法律等受监管行业,语义错误的翻译可能会带来合规性、责任或患者安全方面的后果。
团队通过 AI Hub 使用多个 LLM 提供商,其中幻觉风险因提供商而异,需要自动回退路由来处理故障而无需人工干预。

当幻觉检测并非主要关注点时

⚠️

仅使用神经机器翻译引擎而不是 LLM 的程序,其中传统的质量评估方法涵盖了主要错误类型。

⚠️

对于像 UI 标签或单字条目这样非常短的字符串,由于上下文有限,语义相似度评分不太可靠。

企业检查清单:幻觉检测

  • 该平台是否包含自动语义相似度评分功能,可以将翻译输出与源文本含义进行比较?
  • 幻觉检测系统是否使用与生成翻译的 LLM 不同的模型?
  • 当检测到幻觉时,平台是否会自动将标记的字符串路由到其他 AI 提供商?
  • 在所有基于 LLM 的翻译工作流程中,幻觉检测是否默认启用?
  • 检测是否在字符串级别进行,以避免单个被标记的字符串阻塞整个作业?

准备好见识一下 Smartling 的威力了吗?

Smartling 的 AI Hub 包含自动语义相似度评分和所有 LLM 驱动的翻译工作流程的回退路由功能,默认启用。看看企业团队是如何在幻觉影响客户之前将其拦截的。