DeepL AI Labs

Začlenění Mixhalo do platformy DeepL nepřineslo jen nové možnosti v oblasti překladu řeči do řeči v reálném čase ve velkém měřítku. Mění to rozsah toho, co můžeme v oblasti Voice vytvořit. Když jste schopni ovládat rychlost přenosu zvuku a odstranit ji jako omezení, to, co bylo dříve nemožné, se může rychle stát součástí produktového plánu.

Naše týmy společně budují vrstvu mluveného jazyka, která je k dispozici pro každý typ zážitku a interakce. Prostřednictvím DeepL Voice API umožňují inovátorům po celém světě začlenit živý, vícejazyčný hlas v reálném čase do každé zákaznické a uživatelské cesty.

To zahrnuje zachycení všech emocí fotbalového komentátora popisujícího gól nebo touchdown, okamžitě dostupné hlasové zážitky, které odstraňují pocit izolace u mluvčích, pro které není daný jazyk mateřským, ve zdravotnických zařízeních, pečlivý design zážitků z hovorů se zákaznickou podporou s cílem eliminovat stres a frustraci a vícejazyčný zážitek z živých událostí, který poskytuje přeloženou řeč mnohem rychleji, než toho jsou schopni lidští tlumočníci.

Základní pilíře pro vícejazyčný zvuk v reálném čase

Spoluzakladatel společnosti Mixhalo, Vik Singh, a vedoucí Voice služeb ve společnosti DeepL, Leo Doin, přistupují k výzvě snížení latence u vícejazyčného zvuku ze dvou vzájemně se doplňujících směrů. Společnost Mixhalo vznikla v hudebním průmyslu, kde streamovala zvuk bubeníka hrajícího na malý buben do stadionu plného tisíců fanoušků rychleji, než k nim mohly dorazit samotné zvukové vlny. Jazykové modely DeepL jsou schopny zpracovat překlad zvuku v reálném čase od začátku do konce, bez předávání dat různým API, čímž snižují latenci překladu na nejnižší možnou úroveň.

Navrhování přeložených zvukových zážitků, které působí na emocionální rovině

Speciálně vyvinuté démony pro záznam zvuku, vlastní síťové protokoly, detekce chyb v reálném čase, zvukové enginy optimalizované pro rychlost přehrávání: všechny tyto technické inovace vytvářejí čas a prostor pro návrh optimalizovanějšího zážitku z živého překladu zvuku. Přidat k tomu jazykovou inteligenci a tato optimalizace může proběhnout okamžitě, a to díky modelům, které vědí, kdy je nejlepší překládat a jak synchronizovat jazyky s odlišnými gramatickými strukturami.

Ideální zážitek z živého překladu neznamená okamžité přehrávání přeloženého zvuku. Jde o inteligentní přizpůsobení přehrávání pomocí AI, která hluboce rozumí fungování každého jazyka.

To vše se spojuje v živém překladu řeči do řeči pro call centra. Jedná se o jednu z nejvýkonnějších aplikací API DeepL Voice. Vik a tým Mixhalo na tom pracují, aby zákazníci vždy cítili spojení s pracovníky podpory a aby překlad nikdy neohrozil pocit, že jsou vyslyšeni.

Živé akce, překládané rychlostí, kterou žádný člověk nedokáže napodobit

Snad největší dopad spojení DeepL a Mixhalo se projeví právě při živých událostech: konferencích s tisíci účastníků a stovkami řečníků, kteří budou moci sdílet nápady a sledovat přednášky ve svém preferovaném jazyce prostřednictvím zvuku streamovaného do jejich zařízení po celém místě konání.

Právě v takových scénářích se plně projeví hodnota vícejazyčné hlasové vrstvy v reálném čase. Díky zvuku s extrémně nízkou latencí mohou účastníci poslouchat řečníka podle svého výběru, i když se pohybují po místnosti. Mohou sledovat přednášky, i když se právě nenacházejí v dané místnosti. Živý, okamžitý překlad řeči znamená, že každý účastník slyší jazyk, kterému rozumí nejlépe, a to včetně všech emocí a implicitních výrazů. Znamená to také, že každý řečník může sdílet své myšlenky v jazyce, ve kterém je formuloval

Nejpůsobivější však bude pravděpodobně rychlost, s jakou se to vše odehrává. Vyvíjíme inovativní nové způsoby, jak modely AI DeepL zachycují a zpracovávají kontext kolem hlavních projevů, panelových diskusí a dalších přednášek, a to podobným způsobem, jakým se předem připravují tlumočníci na živých akcích. V kombinaci s vyšší rychlostí zpracování AI jsme tak schopni generovat živé překlady z řeči do řeči mnohem rychleji, než toho jsou schopni lidští překladatelé. To zcela změní představy o tom, jak by měl vypadat zážitek z vícejazyčného obsahu. Bude to působit futuristicky, možná až magicky. A začne to měnit představy o tom, jak funguje mluvená komunikace.

Více o Mixhalo a plánech společnosti DeepL se dozvíte v tomto blogu.

Sdílet

Sledujte nás

Získejte náhled na naše nejnovější inovace v oblasti AI.