DeepL AI Labs

将 Mixhalo 引入 DeepL 平台,不仅添加了大规模实时语音到语音翻译的新功能。它正在重塑我们在Voice领域所能构建的范围。当您能够控制音频传输的速度,并消除这一限制时,过去看似不可能实现的功能将迅速成为产品路线图的一部分。

我们的团队正在携手构建一个发言语言层,使其适用于各种体验和交互。通过 DeepL Voice API,他们正赋能世界各地的创新者,将实时、多语言的语音功能融入到各种客户和受众的体验旅程中。

这包括:捕捉足球解说员描述进球或达阵时的情感表达;提供即时可用的语音体验,消除非母语者在医疗保健场景中的孤立感;精心设计客户支持通话体验,消除压力和挫败感;以及提供比人类口译员更快地提供翻译语音的现场活动多语言体验。

实时多语言音频的关键基础

Mixhalo联合创始人维克·辛格(Vik Singh)与DeepL Voice业务负责人利奥·多因(Leo Doin)正从两个互补的方向着手解决多语言音频延迟降低这一挑战。Mixhalo诞生于音乐行业,曾将鼓手敲击小军鼓的声音以比声波传播速度更快的速度,实时传输到座无虚席、数千名粉丝聚集的体育场中。DeepL的语言模型能够端到端处理实时音频翻译,无需交由不同的API处理,从而将翻译延迟降至最低。

设计能触动情感的翻译音频体验

量身定制的音频采集守护进程、专属网络协议、实时错误检测、针对播放速度进行优化的音频引擎:所有这些技术创新为设计更优化的实时音频翻译体验创造了时间和空间。添加语言智能技术,这种优化可以即时实现——通过能够识别最佳翻译时机、并懂得如何同步不同语法结构语言的模型来完成。

理想的实时翻译体验并不意味着立即播放翻译后的音频。它在于通过深入理解每种语言运作机制的人工智能,智能地调整播放。

这一切在呼叫中心的实时语音到语音翻译中得到了融合。这是 DeepL Voice API 最强大的应用之一。Vik 和 Mixhalo 团队正在致力于开发该功能,以确保客户始终感到与支持代表之间存在联系,并且翻译绝不会影响客户被倾听的感觉。

现场活动,以人类无法企及的速度进行翻译

DeepL 与 Mixhalo 的结合,其最大的影响或许将体现在现场活动中:在拥有数千名与会者和数百名演讲者的会议上,所有参与者都能通过流式传输到其设备上的音频,在整个会场内以自己偏好的语言分享想法并参与会议。

正是在此类场景中,实时多语言Voice层的价值才真正凸显出来。超低延迟的音频意味着,与会者在会场内移动时,可以收听自己选择的演讲者。即使不在会议室里,他们也能跟上会议内容。实时、即时的语音翻译意味着每位与会者都能听到自己最能理解的语言,同时还能捕捉到所有的情感和隐含的表达。这也意味着,每位演讲者都可以用构思演讲时所用的语言来分享自己的想法

不过,最令人惊叹的或许是这一切发生的速度。我们正在开发创新的新方法,让 DeepL 的人工智能模型能够捕捉和吸收主题演讲、小组讨论和其他演讲环节的上下文信息,这与现场活动口译员事先做准备的方式非常相似。结合人工智能更快的处理速度,我们能够生成比人类译员快得多的实时语音翻译。这将彻底改变人们对多语言内容体验的预期。这种体验将让人感觉仿佛置身未来,甚至充满魔力。它还将开始改变人们对口头交流运作方式的预期。

请在这篇博客中进一步了解 Mixhalo 和 DeepL 的计划。

分享

互联互通

抢先了解我们最新的人工智能创新成果。