质量评分可以告诉你翻译是否通过了既定的检查。它会统计错误次数、检查阈值并回顾历史数据。 然而,企业提出的问题却有所不同:我们是否准备好将产品销往该市场?
这种区别是目前大多数企业本地化计划中存在的断层线,也是 LocWorld55 都柏林站最受欢迎的会议之一的核心论点。房间里挤满了人,因为人工智能 (AI) 加快了运输速度,但现在的挑战是确保可靠性、评估和部署实践能够跟上步伐。毕竟,正是这些方面的差距会让球队损失真金白银和市场信誉。
在 LocWorld55 大会上,OpenAI 本地化主管 Kathy Mok 和 Smartling 人工智能副总裁 Olga Beregovaya 共同发表了题为“你会发布这个吗?”的演讲。重新定义人工智能时代的翻译质量。
.png?width=723&height=510&name=Smartling%20and%20OpenAI%20session%20at%20LocWorld55%20Dublin%20(1).png)
Olga Beregovaya (Smartling) 和 Kathy Mok (OpenAI) 在都柏林 LocWorld55 的舞台上。
对于那些没能到场的人来说,以下这些想法值得带回你们的项目中:
仪表盘撒谎(某种程度上)
Kathy 首先举了一个大多数本地化经理都会立即感同身受的场景。你们迅速推出了100种语言。多维质量指标 (MQM) 记分卡为绿色,服务级别协议 (SLA) 已达到要求,并且所有三种语言都已超过其阈值。然后反馈开始涌来:日本市场部表示创意素材不够好,一位讲西班牙语的利益相关者指出行动号召 (CTA) 的质量不高,一位增长产品经理悄悄地开始寻找自己的法国代理机构。
令人不安的是,仪表盘仍然显示绿色。MQM 分数并不是问题所在,而是它回答了它旨在回答的问题:翻译是否通过了定义的语言检查。企业想知道这种体验是否已准备好进入真正的市场,面向那些会根据所读内容做出真正决策的真实用户,而这两个问题并不相同。将它们视为等同,恰恰是技术上正确的翻译导致商业体验失败的原因。
为慢节奏世界打造的优质模型
但这并不意味着传统的质量衡量方法是错误的。这意味着它的设计是为了适应一种已经不存在的节奏。如今,品牌每天都在全球范围内发布内容,人工智能优先的翻译已成为运营规范,供应商合作伙伴正在实时重新培训工作流程以跟上步伐。在这种情况下,交付后错误计数充其量只能算是一个滞后指标。当语言质量保证 (LQA) 审查确认存在问题时,内容往往已经投放市场。
更深层次的问题是结构性的。传统质量模型要求评审员找出缺陷,但它们的设计目的并非在于探究某个特定缺陷是否重要、对谁重要、出现在哪个表面、在哪个市场以及风险等级如何。这种细致的错误标记工作有其用武之地,但它并不能可靠地预测广告活动是否会转化、安全信息是否会被信任,或者结账流程是否会导致用户完全放弃交易。
推出可运输性
这种转变被称为可交付性:将质量审查视为面向未来的发布准备决策,而不是回顾性的缺陷审核。核心问题从“我们发现了多少错误?”变成了“本地用户是否足够信任它而继续操作?”这听起来像是措辞上的一个小小的变化,但其操作上的影响却很重大。
这样看来,审稿人的工作就完全改变了。审稿人不会按照分类法来规范语言,而是通过评估以下四点来对发货决策进行本地化决策:
- 含义(原意是否保持不变?)
- 市场契合度(这是否适合特定的受众和背景?)
- 风险(是否会误导、阻碍行动或损害信任?)
- 行动(接下来会发生什么:发布、发布后改进,或修复后再发布)
最后一个维度很重要,因为如果没有清晰、可操作的输出,可交付性就变成了另一个抽象的质量框架,在实践中没有任何改变。这三个发货通知旨在防止这种情况发生:先修复后发货、发货后改进,或者准备发货。每一条规则都告诉团队该怎么做,而不仅仅是翻译的得分情况。
阈值随市场变化
本次会议中比较实用的论点之一是,可运输性并不是一个通用标准。这是一个风险评估的过程,合适的风险水平完全取决于翻译的内容和目标受众。一篇低曝光度的帮助中心文章、一个付费推广标题、一份安全说明和定价页面代表了四种截然不同的风险状况。对所有这些地方都采用相同的审查深度,要么意味着在不值得的地方投入过多,要么意味着在值得的地方投入不足。
市场画像也会以有意义的方式改变门槛。例如,对人工智能持谨慎态度的受众需要更高的信心提示和更谨慎的语气,而以实用性为先的市场则优先考虑任务清晰度而非风格润色,对质量敏感的地区对细微差别和语域有更高的期望。针对某一受众群体行之有效的本地化决策,对另一受众群体可能效果不佳,因此,本地对可交付性决策的掌控与拥有框架本身同样重要。
Smartling 和 OpenAI 如何在实践中构建它
奥尔加将会议的后半部分带入了实际操作层面,探讨了以这种方式运行一个项目实际需要做些什么。Smartling 和 OpenAI 的合作最初在 20 个地区开展,后来扩展到 60 多个地区,现在已全面覆盖 ChatGPT 和 OpenAI 的全套产品。这种规模,以这种速度持续下去,才是对任何质量框架的真正压力测试。
翻译人员的角色几乎需要彻底重新思考。在可发货性模型中,语言学家不是在队列中处理字符串。相反,他们的工作方式更像是当地产品经理,他们会在不带任何先入为主的观念的情况下阅读完整的背景信息,根据市场画像和风险框架进行评估,然后做出并记录一个明确的决定。这些决策会反馈到系统中,作为信号,告知哪些环节可以自动化,哪些环节仍然需要人工审核来决定结果,以及底层工作流程或模型行为需要随着时间的推移而发生哪些变化。
Smartling 构建了一个专门设计的工作界面来支持该模型,该界面简洁明了,语言通俗易懂,并且围绕三个发货调用而不是传统的错误分类进行构建。该设计直接体现了这一理念:没有复杂的评分表,没有繁琐的缺陷标记。该界面要求审阅者阅读完整上下文,进行整体评估,并做出决定。这种简洁性是有意为之,因为审查步骤中的认知负担是导致程序运行速度变慢并降低返回信号质量的原因之一。
无需完全重建程序即可开始
会议的问答环节提出了一个意料之中的问题:这听起来没错,但是从哪里开始呢?Kathy建议从一条路线、一个市场、一种内容类型、一个修改后的问题开始。与其问审稿人发现了多少错误,不如问他们是否会将这款产品推向市场。将反馈信息分为四个简单的类别:1)已发货;2)尚未发货;3)原因;以及 4)触发了什么操作。这就是信号,它比细粒度的错误计数更有用,因为它直接与业务决策相关。
所有权分配也很重要。客户组织设定业务背景,并定义每种内容类型和市场的风险承受能力。供应商合作伙伴负责促成判断,安排合适的审阅人员,构建能够以所需速度运行的工作流程,并确保工具支持清晰的决策,而不是给审阅人员增加流程开销。双方都必须尽自己的一份力,因为可交付性决策需要有人了解商业上的风险,还需要有人能够构建一个能够大规模地持续做出这些决策的方案。
即使只是一个规模不大的试点项目,其数据也能开始揭示项目中风险的真实面貌:团队在哪些方面过度审查了不必要的内容,在哪些方面审查不足,以及根据实际交付速度制定的质量策略在实践中会是什么样子。
永恒的问题
会议最后以一个引人深思的餐厅比喻作结:菜单可以翻译得完全正确,但问题不在于措辞是否正确。问题是,顾客是否会充满信心地下单,相信他们所读到的内容,并感到足够舒适而再次光顾。
甜点描述中略显生硬的措辞与对过敏原的误解是截然不同的问题。从技术角度来看,两者都是错误,但只有其中一项构成足以阻止发射的严重风险。了解其中的区别,并围绕这种区别构建质量计划,正是可运输性设计的目的所在。
本地化质量并非语言完美无缺的问题。这是一个关乎产品上市信心的话题。Smartling 和 OpenAI 在 LocWorld55 上的会议以具体的方式论证了这一点,并以一个在实际规模上运行的真实程序为基础。如果您目前的质量控制流程无法可靠地判断译文是否已准备好投放市场,那么这就是最有用的切入点。