DeepL AI Labs
Začlenění Mixhalo do platformy DeepL nepřineslo jen nové možnosti v oblasti překladu řeči do řeči v reálném čase ve velkém měřítku. Mění to rozsah toho, co můžeme v oblasti Voice vytvořit. Když jste schopni ovládat rychlost přenosu zvuku a odstranit ji jako omezení, to, co bylo dříve nemožné, se může rychle stát součástí produktového plánu.
Naše týmy společně budují vrstvu mluveného jazyka, která je k dispozici pro každý typ zážitku a interakce. Prostřednictvím DeepL Voice API umožňují inovátorům po celém světě začlenit živý, vícejazyčný hlas v reálném čase do každé zákaznické a uživatelské cesty.
To zahrnuje zachycení všech emocí fotbalového komentátora popisujícího gól nebo touchdown, okamžitě dostupné hlasové zážitky, které odstraňují pocit izolace u mluvčích, pro které není daný jazyk mateřským, ve zdravotnických zařízeních, pečlivý design zážitků z hovorů se zákaznickou podporou s cílem eliminovat stres a frustraci a vícejazyčný zážitek z živých událostí, který poskytuje přeloženou řeč mnohem rychleji, než toho jsou schopni lidští tlumočníci.
Spoluzakladatel společnosti Mixhalo, Vik Singh, a vedoucí Voice služeb ve společnosti DeepL, Leo Doin, přistupují k výzvě snížení latence u vícejazyčného zvuku ze dvou vzájemně se doplňujících směrů. Společnost Mixhalo vznikla v hudebním průmyslu, kde streamovala zvuk bubeníka hrajícího na malý buben do stadionu plného tisíců fanoušků rychleji, než k nim mohly dorazit samotné zvukové vlny. Jazykové modely DeepL jsou schopny zpracovat překlad zvuku v reálném čase od začátku do konce, bez předávání dat různým API, čímž snižují latenci překladu na nejnižší možnou úroveň.
Speciálně vyvinuté démony pro záznam zvuku, vlastní síťové protokoly, detekce chyb v reálném čase, zvukové enginy optimalizované pro rychlost přehrávání: všechny tyto technické inovace vytvářejí čas a prostor pro návrh optimalizovanějšího zážitku z živého překladu zvuku. Přidat k tomu jazykovou inteligenci a tato optimalizace může proběhnout okamžitě, a to díky modelům, které vědí, kdy je nejlepší překládat a jak synchronizovat jazyky s odlišnými gramatickými strukturami.
Ideální zážitek z živého překladu neznamená okamžité přehrávání přeloženého zvuku. Jde o inteligentní přizpůsobení přehrávání pomocí AI, která hluboce rozumí fungování každého jazyka.
To vše se spojuje v živém překladu řeči do řeči pro call centra. Jedná se o jednu z nejvýkonnějších aplikací API DeepL Voice. Vik a tým Mixhalo na tom pracují, aby zákazníci vždy cítili spojení s pracovníky podpory a aby překlad nikdy neohrozil pocit, že jsou vyslyšeni.
Snad největší dopad spojení DeepL a Mixhalo se projeví právě při živých událostech: konferencích s tisíci účastníků a stovkami řečníků, kteří budou moci sdílet nápady a sledovat přednášky ve svém preferovaném jazyce prostřednictvím zvuku streamovaného do jejich zařízení po celém místě konání.
Právě v takových scénářích se plně projeví hodnota vícejazyčné hlasové vrstvy v reálném čase. Díky zvuku s extrémně nízkou latencí mohou účastníci poslouchat řečníka podle svého výběru, i když se pohybují po místnosti. Mohou sledovat přednášky, i když se právě nenacházejí v dané místnosti. Živý, okamžitý překlad řeči znamená, že každý účastník slyší jazyk, kterému rozumí nejlépe, a to včetně všech emocí a implicitních výrazů. Znamená to také, že každý řečník může sdílet své myšlenky v jazyce, ve kterém je formuloval
Nejpůsobivější však bude pravděpodobně rychlost, s jakou se to vše odehrává. Vyvíjíme inovativní nové způsoby, jak modely AI DeepL zachycují a zpracovávají kontext kolem hlavních projevů, panelových diskusí a dalších přednášek, a to podobným způsobem, jakým se předem připravují tlumočníci na živých akcích. V kombinaci s vyšší rychlostí zpracování AI jsme tak schopni generovat živé překlady z řeči do řeči mnohem rychleji, než toho jsou schopni lidští překladatelé. To zcela změní představy o tom, jak by měl vypadat zážitek z vícejazyčného obsahu. Bude to působit futuristicky, možná až magicky. A začne to měnit představy o tom, jak funguje mluvená komunikace.