今年,我们团队有三名成员的论文被欧洲机器翻译协会 (EAMT) 的年度会议接受。EAMT 汇聚了研究人员、从业人员和行业专业人士,共同分享知识,探讨该领域的现状。通过展示我们自己的研究成果和参加整个项目的会议,我们对 2026 年 MT 研究的现状以及它还有很长的路要走有了相当清晰的了解。

 

我们在 EAMT 2026 学到了什么

Smartling 高级语言工程师 Marina Sánchez Torrón 博士在 EAMT 2026 上登台演讲。

 

以下是我们最重要的几点总结:

 

关于法学硕士学位的争论已经结束了。现在才是最难的部分。

EAMT 上已经没有人再问是否应该使用 LLM 进行翻译了。这个问题已经解决了。讨论的重点已经完全转移到如何有效地部署它们,而这才是事情变得有趣的地方。

本次会议传递出的最强烈的信号之一是,独立的LLM很少能满足生产环境的需求。正在形成的架构并不是“用LLM代替翻译记忆库”。它是LLM加上翻译记忆库加上检索功能。翻译记忆库不会消失。它们被重新利用为经过筛选和审核的知识来源,将公司特定的语言知识直接注入LLM工作流程。高质量、干净的 TM 越来越成为决定性因素,无论您是在进行微调还是构建 RAG 架构。

多智能体翻译方法受到了一些关注,但诚实的结论是,它们仍处于实验阶段。委员会式生成模式是否很快就能投入生产,目前尚无定论。

 

术语和风格:有所进步,但尚未解决

如果说几乎所有会议都贯穿一个主题,那就是:翻译通用语言在很大程度上是容易的。持续翻译专业内容并非易事。

术语管理仍然是该领域尚未解决的最重大生产挑战之一。技术课程的很大一部分内容都集中在术语翻译、生物医学内容、法律翻译和特定领域的改编上,由此产生的挫败感显而易见。风格指南的遵守情况被反复提及,成为一个共同的痛点,但没有人声称已经找到了解决办法。

研究人员表明,与人类翻译相比,LLM 具有清晰、可衡量的风格特征:更高的词汇密度、更复杂的词汇、过度使用破折号和使用省略号的倾向,以及独特的句子长度模式。试图引导法学硕士学生模仿特定文学翻译家的尝试大多以失败告终,范本家族效应(GPT 与 Claude)比风格引导本身更为强烈。

一个重要的结论是:法学硕士使风格变得可衡量,但并没有解决这个问题。人工翻译仍然处于一个与现代模型截然不同的风格空间,现代模型可以接近但无法完全达到。AI 后期编辑可以改善风格和术语规范,但模型经常过度编辑,因此人工反馈对于使输出达到预期效果仍然至关重要。

 

微调仍然很重要

不久前,人们还对“提示将取代模型适应”这一想法充满热情。会议提供的证据并不支持这一点。多篇论文表明,针对法律、生物医学、文学和技术领域的领域特定微调具有明显的益处。采用 LoRA 技术的 EuroLLM-22B 在欧盟立法翻译方面优于 Claude Sonnet 的零样本模型。

更广泛地说:对于术语精确性、风格要求或监管限制至关重要的使用场景,专门的调整仍然很有价值。提示和检索是越来越重要的工具,但它们并不能取代模型中固有的领域专业知识。

 

提示的微妙之处远超大多数人的想象。

我们在海报展示环节中发表了关于手动与自动提示优化(DSPy 和 GEPA)的论文,引起了大家的极大兴趣。大多数与会者之前都没听说过 GEPA,许多人立即意识到它与他们自身面临的规模化挑战息息相关。谈话并没有在一小时后结束,我们一直聊到了咖啡休息时间。 Slator报道了Smartling的研究值得注意的是自动化优化缩小了与专家提示在术语和翻译方面的差距,而专家判断在语言质量评估错误检测方面仍然起主导作用。

更广泛地说,这次会议再次强调,提示设计并不是一个已经解决的问题。结构比语言更重要:完整的角色、语境、受众和目的能够持续减少各项研究中出现的风格错误。语言专家更倾向于使用目标语言提示,而不是源语言提示。而且,自动化优化并非总是奏效;它很大程度上取决于具体任务。

 

资源匮乏语言仍然是最难攻克的领域。

尽管在高资源语言对方面取得了显著进展,但低资源语言和少数民族语言仍然是一个棘手且很大程度上尚未解决的问题。语言学习者仍然将少数族裔语言变体与主流标准混为一谈,瓦伦西亚语并入标准加泰罗尼亚语就是一个例子。合成并行数据生成和基于 RAG 的知识提炼是最有前途的方法,但资源匮乏语言的新数据集仍然稀少。

在这个领域,神经机器翻译(NMT)也没有消亡。对于数据丰富的机构环境,专门的模型仍然可以胜出,主要是因为它们可以访问大量的、特定领域的训练数据,这使得投资是值得的。

 

评估是目前讨论的瓶颈所在。

生成翻译已经变得更容易解决了。如何可靠地定义和衡量它们的质量是该领域目前面临的瓶颈。

BLEU 和 TER 等传统指标越来越不足以满足实际应用场景的需求。错误的性别选择可能对TER影响甚微,但在某些情况下却是一个严重的错误。自动化指标,包括传统指标和 LLM 作为评判者的方法,仍然无法可靠地捕捉文档级别的质量。正如一位演讲者所说:如果没有更好的评估,该行业就有可能朝着错误的方向进行优化。

 

内部部署正成为一项真正的优先事项。

另一个主要主题是内部和本地 LLM 的战略重要性日益增强。政府、法律、议会和企业工作流程通常根本无法将敏感内容发送到外部 API。数据驻留要求是真实存在的,而且不会消失。

这为更小、可本地部署的专用模型创造了真正的市场,不是因为它们在原始质量上一定比前沿系统更好,而是因为它们是可控的。可部署性、术语表支持、样式指南处理、翻译记忆库集成以及可信的安全保障是很大一部分市场真正的差异化因素。

 

我们带回去的东西

EAMT 2026 证实了 Smartling 非常坚信的一点:生产翻译的未来不仅仅是更好的模型。它是一种可控、可审计、特定领域且安全的翻译基础设施,建立在强大的语言学习模型之上,以检索和翻译记忆为基础,适应特定领域,并由人工进行完善,以处理高风险内容。我们在解决开放性问题方面也走在正确的道路上,包括评估、术语、风格和低资源语言。

我们感谢 EAMT 为这些对话创造了空间,也感谢研究人员和实践者们如此坦诚地分享他们的工作。明年见。

 

对我们的研究或Smartling如何应对这些挑战有任何疑问? 联系我们.

 

立即体验更智能的翻译

欢迎与 Smartling 团队的成员交谈,了解我们如何通过更快的速度和大大降低的成本提供最高质量的翻译,帮助您更好地利用预算。
Cta-Card-Side-Image