DeepL AI Labs
MixhaloをDeepLプラットフォームに統合したことで、大規模なリアルタイム音声間翻訳に関する新たな機能が追加されただけではありません。音声分野で実現可能な範囲そのものを変革しつつあります。音声配信の速度を制御し、それを制約要因から取り除くことができれば、以前は不可能だったことも、すぐに製品ロードマップに盛り込むことができるようになります。
両社のチームは協力して、あらゆる種類の体験やインタラクションで利用できる音声の言語レイヤーを構築しています。DeepL Voice APIを通じて、世界中のイノベーターが、あらゆる種類のお客様やオーディエンスのジャーニーに、ライブでリアルタイムな多言語音声機能を組み込めるよう支援しています。
これには、ゴールやタッチダウンを解説するサッカー実況アナウンサーの感情を余すところなく伝えること、医療現場で非母語話者が感じる孤立感を解消する即座に利用できる音声体験、ストレスやフラストレーションを解消するためのお客様対応通話体験の綿密な設計、そして人間の通訳者よりもはるかに速く翻訳された音声を届けるライブイベントの多言語体験などが含まれます。
Mixhaloの共同創業者であるヴィク・シン氏と、DeepLのVoice部門責任者であるレオ・ドイン氏は、多言語オーディオの遅延を低減するという課題に、互いに補完し合う2つの方向から取り組んできました。Mixhaloは音楽業界から生まれ、ドラマーがスネアを叩く音を、音波そのものが届くよりも速く、数千人のファンで埋め尽くされたスタジアムへとストリーミングしてきました。DeepLの言語モデルは、異なるAPIへの引き継ぎを一切行わずに、リアルタイム音声の翻訳をエンドツーエンドで処理することができ、翻訳の遅延を可能な限り最低レベルにまで低減しています。
特注の音声キャプチャデーモン、カスタムネットワークプロトコル、リアルタイムのエラー検出、再生速度を最適化したオーディオエンジン――これらすべての技術革新が、ライブ音声翻訳の体験をさらに最適化するための時間と余地を生み出しています。さらに言語インテリジェンスを追加することで、翻訳に最適なタイミングや、文法構造の異なる言語を同期させる方法を把握したモデルを通じて、その最適化を瞬時に行うことが可能になります。
理想的なライブ翻訳体験とは、翻訳された音声を即座に再生することではありません。それは、各言語の仕組みを深く理解したAIを通じて、再生をインテリジェントに調整することにあります。
これらすべてが、コールセンター向けのライブ音声のテキスト化に結実しています。これは、DeepL Voice API の最も強力な用途の一つです。Vik 氏と Mixhalo チームは、お客様が常にサポート担当者とつながりを感じられ、翻訳によって「自分の声が聞かれている」という感覚が損なわれることがないように、この技術の開発に取り組んでいます。
DeepLとMixhaloの連携がもたらす最大の影響は、おそらくライブイベントで実感されるでしょう。数千人の参加者と数百人の講演者が集まるカンファレンスにおいて、会場全体から各参加者のデバイスへストリーミングされる音声を通じて、誰もが自分の好みの言語でアイデアを共有し、セッションをフォローできるようになります。
このようなシナリオにおいてこそ、リアルタイムの多言語Voiceレイヤーの価値が真に明らかになります。超低遅延の音声により、参加者は会場内を移動しながら、希望する講演者の話を聞くことができます。その部屋にいなくても、セッションをフォローすることができます。ライブで瞬時の音声のテキスト化により、すべての参加者は、感情や暗黙の表現もそのままに、自分が最も理解しやすい言語で講演を聞くことができます。また、すべての講演者が、自分の考えを形作った言語でアイデアを共有できるということでもあります。
しかし、おそらく最も印象的なのは、これらすべてが実現されるスピードでしょう。DeepLのAIモデルが、基調講演、パネルディスカッション、その他の講演セッションに関する文脈を、ライブイベントの通訳者が事前に準備を行うのと同じような方法で、捉え、取り込むための革新的な新しい方法を開発しています。これを AI の優れた処理速度と組み合わせることで、人間の通訳者が可能な速度をはるかに上回るスピードで、ライブの音声対音声翻訳を生成することが可能になります。これにより、多言語コンテンツの体験に対する期待が根本から一新されることでしょう。まるで未来の世界、あるいは魔法のような感覚を味わえることでしょう。そして、口頭コミュニケーションのあり方に対する期待も変革し始めるでしょう。