DeepL AI Labs

实时语音翻译不仅仅是在输入或输出形式上有所创新的翻译。这对人工智能研究而言,是一项根本上全新、不同且令人兴奋的挑战。它旨在提供一种截然不同的用户体验,这种体验改变了翻译的优先级,引入了新的约束条件,并要求人工智能模型具备新的判断和决策能力。 

这就是我们的 Voice 研究团队中的研究经理 Sascha Brinker 和研究科学家 Kristina Geißler 正在应对的挑战。他们隶属于一个团队,该团队正在进一步发展 DeepL 卓越的文本翻译人工智能模型,以设置实时语音翻译的新标准。目前,他们正基于这一早期成功,开发新的模型和训练技术,为多语言实时语音翻译开辟全新的可能性。

基于高质量的文本翻译模型

我们拥有一个良好的起点:DeepL现有文本翻译模型的质量及其对语境的理解能力。语音团队通过部署该模型并调整推理策略以提高翻译速度,在早期就取得了重要进展。随后,他们开发了专为语音设计的定制模型,这些模型能够识别输出翻译的最佳时机,既利用了 DeepL 对语言对之间关系的理解,又应用了新的训练层。 

此处的目标是在延迟与翻译速度(这对用户实时跟上并参与对话至关重要)之间,与准确性和稳定性之间找到恰当的平衡点。掌握这种平衡意味着 DeepL 无需等到句子结束才进行翻译。与此同时,这还能最大限度地减少因模型被迫修正已翻译字幕而产生的“闪烁”现象。这些因素对用户体验有着巨大的影响。

省去转录阶段

通过不断调整和优化我们的文本翻译模型,我们取得了长足的进步。以至于 Slator 目前将 DeepL 评为实时语音翻译在质量和稳定性方面的绝对领导者。然而,取消翻译前必须先转录文本的要求,将使我们走得更远、更快。团队目前正在构建能够直接从音频输入生成翻译语音输出的模型,而无需经过中间的文本阶段。

通过向模型提供更多关于所翻译对话的上下文信息——讨论的内容、参与讨论的人员,以及他们可能使用的具体短语和术语——我们可以取得更大的进步。这模拟了顶级人类口译员在重大活动或会议前进行的大量密集训练工作。就像他们一样,这使我们的模型能够从对方刚开始构思词语的那一刻起,就翻译出他们即将说出的内容。

为语音翻译开辟新天地

这些全新的、直接的“语音到语音”模型扫除了语音翻译目前面临的一些最重要限制。由此,它们开辟了一些非常令人兴奋的新可能性。

由于无需先翻译成文本再转回语音,我们在提供语音翻译方面可以节省整整几秒钟的时间。在实时跟进语音的背景下,这是一项非常显著的提速,将对用户和听众的体验产生重大影响。

不仅如此。直接处理音频输入意味着我们可以训练模型来检测人们说话方式中蕴含的口音、方言和细微差别。额外的推理时间和更丰富的音频输入意味着,我们可以生成能够捕捉人们言语中的情感和深层含义的语音输出。

借助人工智能实现的实时语音翻译的未来,不仅仅在于速度更快。它还将更具人性化:能够捕捉人们在说话时沟通的更多层面。这正在将 DeepL 从一个翻译引擎转变为一个实时语音层,能够以一种让语言不再成为沟通障碍的方式,实现最自然的人类交流形式。 

这正是该领域成为 DeepL 人工智能研究中最令人兴奋的领域之一的原因。 

分享

互联互通

抢先了解我们最新的人工智能创新成果。