DeepL AI Labs
Att integrera Mixhalo i DeepL-plattformen har inte bara läggt till nya möjligheter inom raltidsöversättning av tal från tal i stor skala. Det förändrar omfattningen av vad vi kan bygga inom Voice. När man kan styra hastigheten på ljudöverföringen och eliminera den som en begränsning kan det som tidigare var omöjligt snabbt bli en del av produktplanen.
Tillsammans bygger våra team ett lager för talat språk som är tillgängligt för alla typer av upplevelser och interaktioner. Genom DeepL Voice API ger de innovatörer överallt möjligheten att bygga in levande, realtidsbaserad och flerspråkig röst i alla typer av kund- och målgruppsresor.
Det innefattar att fånga alla känslor hos en fotbollskommentator som beskriver ett mål eller en touchdown, omedelbart tillgängliga röstupplevelser som tar bort känslan av isolering för personer som inte har språket som modersmål inom hälso- och sjukvården, noggrann utformning av samtal till support för att eliminera stress och frustration, samt en flerspråkig upplevelse av liveevenemang som levererar översatt tal betydligt snabbare än vad mänskliga tolkar kan.
Mixhalos medgrundare, Vik Singh, och DeepL:s chef för Voice-tjänster, Leo Doin, har angripit utmaningen att minska fördröjningen för flerspråkigt ljud från två kompletterande håll. Mixhalo har sitt ursprung i musikbranschen, där man strömmade ljudet av en trumslagare som slog på en virveltrumma till en arena full av tusentals fans, snabbare än ljudvågorna själva kunde nå dem. DeepL:s språkmodeller kan hantera översättningen av ljud i realtid från början till slut, utan att behöva växla mellan olika API:er, vilket minskar översättningens fördröjning till lägsta möjliga nivå.
Skräddarsydda ljudinspelningsdemoner, anpassade nätverksprotokoll, felavkänning i realtid, ljudmotorer optimerade för snabb uppspelning: alla dessa tekniska innovationer skapar tid och utrymme för att utforma en mer optimerad upplevelse av live-ljudöversättning. Lägg till språkinformation så kan optimeringen ske omedelbart, genom modeller som vet när det är bäst att översätta och hur man synkroniserar språk med olika grammatiska strukturer.
Den ideala liveupplevelsen av översättning innebär inte att det översatta ljudet spelas upp omedelbart. Det handlar om att anpassa uppspelningen på ett intelligent sätt, genom AI som har en djup förståelse för hur varje språk fungerar.
Allt detta samverkar i direkt översättning av tal för callcenter. Det är en av de mest kraftfulla tillämpningarna av DeepL Voice API. Vik och Mixhalo-teamet arbetar med att säkerställa att kunderna alltid känner en anknytning till supportmedarbetarna och att översättningen aldrig äventyrar känslan av att de blir hörda.
Kanske kommer den största effekten av samarbetet mellan DeepL och Mixhalo att märkas vid liveevenemang: konferenser med tusentals deltagare och hundratals talare, där alla kan dela idéer och följa sessionerna på sitt eget språk via ljud som strömmas till deras enheter över hela evenemangsområdet.
Det är i scenarier som detta som värdet av ett flerspråkigt Voice-lager i realtid verkligen blir uppenbart. Ljud med extremt låg fördröjning innebär att deltagarna kan lyssna på den talare de väljer medan de rör sig runt i lokalen. De kan följa sessionerna även när de inte befinner sig i rummet. Live-översättning av tal i realtid innebär att varje deltagare hör det språk de förstår bäst, med alla känslor och underförstådda uttryck bevarade. Det innebär också att varje talare kan dela med sig av sina idéer på det språk de formulerade dem på.
Det mest slående är kanske ändå den hastighet med vilken allt detta sker. Vi utvecklar innovativa nya sätt för DeepL:s AI-modeller att fånga upp och ta in sammanhanget kring huvudtal, paneldiskussioner och andra talarsessioner, på ungefär samma sätt som tolkar vid liveevenemang förbereder sig i förväg. När detta kombineras med AI:s högre bearbetningshastighet kan vi generera direkt översättning av tal till tal betydligt snabbare än vad mänskliga översättare klarar av. Detta kommer att omdefiniera förväntningarna på hur upplevelsen av flerspråkigt innehåll ska vara. Det kommer att kännas futuristiskt, till och med magiskt. Och det kommer att börja förändra förväntningarna på hur muntlig kommunikation fungerar.