DeepL Voice 如何应对实时语音翻译的独特挑战

核心要点

  • 实时语音翻译要求具备速度、准确性以及处理不完整句子的能力:这些是文本翻译所不面临的挑战。
  • 发言语言包含语流中断、口语化表达和简短的肯定语,这些内容必须经过过滤,而非逐字翻译。
  • 接近语音速度的翻译能让参会者从被动听众转变为积极发言者。
  • DeepL Voice 通过生成灵活的翻译来最小化“闪烁”现象,这些翻译能够在句子进行中吸收新信息。
  • 人类语言学专业知识指导 DeepL Voice 如何处理跨语言的动词位置、句子结构及语境判断。
  • DeepL 与企业及语言学专家合作,确保 DeepL Voice 能反映现实世界中的沟通优先级。
  • NEC 成为 DeepL Voice 发布后首家全面部署该服务的公司。
  • DeepL 的语言人工智能套件(包括 Voice、翻译器和 Write)为全球企业提供了清晰沟通的工具。

人们说话的方式与写作的方式不同。而且,人们体验口头对话的方式也与阅读电子邮件或文章的方式不同。 

我们在说话瞬间相互理解的能力——将各种语言和非语言沟通方式融合在一起,瞬间把握对方的意思——是人类表达的一种高难度平衡术。 

当你退后一步思考对话中发生的事情时,你会惊讶于我们竟能如此迅速地传递如此多的信息。 

当你像 DeepL 通过我们的 DeepL Voice 解决方案 那样,将 实时翻译口语交流 作为任务来完成时,你会发现许多引人入胜的见解,这些见解揭示了口语翻译与文本翻译的本质区别。 

在这篇文章中,我将分享其中的一些见解,并解释我们如何利用这些见解来改变会议和对话的体验

实时语音对语音翻译已然实现:学习 DeepL Voice 是如何做到的.

为何实时语音翻译比文本翻译更具挑战性

即时对话沟通本质上是人类特有的能力,技术极难复制——即便是像人工智能这样先进的技术

若想为企业打造解决方案,帮助人们跟上并参与多语言对话,必须首先深刻理解其中的挑战。

这些挑战包括复现人类那种在对方说完之前就能预判其言外之意的能力。 

在实时语音翻译时,你还需要预判如何才能用另一种语言最好地表达某人的话。关键在于,你必须在确定原句如何结束之前就完成这些工作,以避免出现长时间的延迟。 

这里的挑战在于,看似对几个词的准确翻译,一旦说话者说完句子,结果却可能是不准确的翻译。 

在着手开发 DeepL Voice 时,我们就知道仅靠技术无法实现高质量的实时语音翻译。这取决于对 语言运作的各种方式 的深入兴趣和理解。 

因此,我们汇集了专注于口语对话的语言学专家。我们还利用了 DeepL 对不同语言运作机制的强大语境理解能力。 

此外,我们与企业合作,探索他们的优先事项以及能 为他们创造最大价值 的语音翻译体验。

探索 DeepL 人工智能如何革新翻译技术,助力实现真正无国界的企业.

为何速度是实时语音翻译的首要考量

我们最早学习的洞见之一是,时机就是一切 尤其在会议或对话的实时翻译中。

如果能接近语音的速度——在发言者说完一句话时就显示出翻译结果——那么就能极大地影响 这些会议的包容性。 

全球糕点生产商Brioche Pasquier的国际协调员Christine AubryDeepL Dialogues上对此进行了进一步阐述。 

她指出,更快的翻译能将参会者的参与模式从被动转为主动。人们不再需要费力跟上他人用另一种语言的发言,而是感觉完全跟上了节奏。就像母语使用者一样,他们有机会插话、引导对话,并积极参与。 

一两秒的差异就能产生巨大的影响。

因此,在翻译实时语音时,速度是首要任务。但您必须在速度与其他同样对人们体验产生重大影响的优先事项之间取得平衡。翻译必须尽可能准确,以 避免误解和混淆。 

在可能的情况下,翻译必须尽量减少因含义变化而不得不更正先前翻译文本时出现的“闪烁”现象。闪烁率越低,人们就越容易自然地跟上对话。

发言语言与书面语的区别——以及这对翻译为何重要

要准确翻译实时语音,必须理解书面语言的模式与语音的节奏之间存在的诸多差异。

例如,人们的说话方式比写作方式更具个人特色,也更不一致。他们使用 独特的措辞和俚语,这些措辞和俚语既可能源于地区方言,也可能源于他们的个性或自我形象。 

此外,人们在说话时会边说边构建和修正句子,从而导致语流不畅,即一个语法错误的词紧跟着另一个更正确的词出现。在翻译中逐字复制这些现象,对于试图理解意思的人来说并没有帮助。 

在整个对话过程中,人们还会发出简短的肯定语(例如“嗯”),以向说话者表明自己理解或同意对方所说的话。这些有助于对话本身的流畅进行。然而,对于试图用另一种语言理解的人来说,这些词会使翻译显得杂乱无章。 

在翻译中过滤掉发言语言中的这些元素会很有帮助。

使用 DeepL 术语表掌控术语和语义细微差别.

DeepL Voice 如何同时优化准确性和速度

若考虑到实时翻译平台并非在翻译完整的句子,这一挑战就变得更加有趣。它需要在用户说话的同时进行翻译,而此时句子的最终含义尚未明确。 

这要求我们以一种略有不同的方式来优化翻译。我们不仅仅想要最准确的翻译。我们希望获得的是一种既准确又足够灵活的翻译,能够纳入可能改变人们说话方向的新信息

下面是一个例子。 

设想我们正在翻译一场虚拟会议,其中一位参会者说英语,另一位则通过德语字幕跟进对方的发言。 

说英语的人打断了对话,说道:“我找到了。”现在,如果我们假设这是一个完整的句子,那么最好的德语翻译应该是“Ich habe es gefunden”。 

然而,由于这是实时语音对话,我们无法确定这句话是否完整。

在这种情况下,更好的选择可能是使用“Ich fand es”这样的翻译。为什么这么说呢?当英语发言人接着说“这让我感到沮丧”时,“ich fand es”的译法恰好可以简单地加上“frustrierend”一词。

如果前三个词被译为“Ich habe es gefunden”,那么我们就需要修改整个译文。 

这正是阻碍我们直观跟上对话节奏的重大“卡顿”所在。而这正是 DeepL 致力于尽可能减少的 问题类型。

不同语言中动词的位置如何影响实时翻译

准确的实时语音翻译 涉及大量此类语境判断,而当人类专业知识引导技术时,这些判断才能得到最佳处理。这种专业知识包括对不同语言中决定句子含义的关键动词通常位于何处的洞察。 

如果动词位于句首(如法语和西班牙语),则可以比动词位于句尾时更快地显示翻译结果。 

所有这些都有助于系统暂停恰到好处的时间,既能确保准确性,又不会因不必要的延迟而影响理解。

阅读 DeepL 客户的成功案例:这些企业信赖我们的语言人工智能.

为何人类语言学专长能让 DeepL Voice 更精准

人类语言学专业知识与高精度翻译的结合,使 DeepL Voice 能够显著改善国际企业的 会议对话 体验。

这些企业包括日本跨国信息技术与电子企业 NEC公司。在 DeepL Voice 发布仅几周后,该公司便成为 首家全面部署该服务的公司。 

DeepL Voice 引发的热潮反映了一个事实:这是语音翻译领域的一个突破性时刻。能够实时解码和翻译人们所说的话,这使 我们为跨国企业创造的价值 成倍增长。 

它改变了团队协作的方式,建立了更牢固的关系,并确保了不同想法和观点始终被纳入其中。 

我们迄今取得的进展,已经对组织的运作方式产生了重大影响。未来还有更多精彩!

学习为何 96% 的专业语言学家选择 DeepL Voice 作为卓越的 AI 字幕翻译工具.

与 DeepL 一起体验多语言沟通的未来

DeepL Voice 为会议和对话提供实时翻译字幕,确保每位参会者的声音都能被实时听到并理解。

翻译器Write 将这种精准性延伸至每个工作流程,为全球团队提供清晰准确的沟通工具。API集成 将这一强大功能融入您的日常工具、平台和工作流程。

联系销售团队,了解 DeepL 语言人工智能套件如何助力您的企业实现全球沟通。

分享