DeepL AI Labs

Realtidsöversättning av tal är inte bara översättning med en ny form av in- eller utdata. Det är en helt ny, annorlunda och spännande utmaning för AI-forskningen. Syftet är att leverera en helt annorlunda användarupplevelse som förändrar prioriteringarna inom översättning, inför nya begränsningar och kräver nya former av bedömning och beslutsfattande från en AI-modell. 

Det är den utmaningen som forskningschefen Sascha Brinker och forskaren Kristina Geißler tar sig an som en del av vårt Voice-team. De ingår i den grupp som vidareutvecklar DeepL:s högkvalitativa AI-modell för översättning av text för att ställa in en ny standard inom översättning av tal i realtid. De bygger nu vidare på den tidiga framgången med nya modeller och träningstekniker som öppnar upp helt nya möjligheter för flerspråkigt tal i realtid.

Vi bygger vidare på högkvalitativa modeller för översättning av text

Vi hade en bra utgångspunkt: kvaliteten och den kontextuella förståelsen hos DeepL:s befintliga modell för översättning av text. Voice-teamet kunde uppnå viktiga tidiga framsteg genom att använda denna modell och justera inferensstrategin för att öka översättningshastigheten. Därefter utvecklade de skräddarsydda modeller för Voice som kan identifiera det bästa ögonblicket att generera översättningar, genom att utnyttja DeepL:s förståelse för relationerna mellan språkpar och tillämpa nya träningslager. 

Målet här är att hitta rätt balans mellan latens och översättningshastighet (avgörande för användarnas förmåga att följa och delta i en konversation i realtid) å ena sidan, och noggrannhet och stabilitet å andra sidan. Att bemästra denna balans innebär att DeepL inte behöver vänta på att en mening ska avslutas innan den översätts. Samtidigt minimeras det ”flimmer” som uppstår när modellerna tvingas korrigera översatta undertexter. Dessa faktorer gör en enorm skillnad för användarupplevelsen.

Att ta bort steget för transkribering

Att anpassa och vidareutveckla vår modell för översättning av text har tagit oss långt. Så pass mycket att Slator för närvarande rankar DeepL som den klara ledaren när det gäller både kvalitet och stabilitet inom realtidsröstöversättning. Men genom att ta bort kravet på att transkribera texten innan den översätts kan vi ta oss ännu längre, och snabbare. Teamet arbetar för närvarande med att bygga modeller som kan generera översatt tal direkt från ljudinmatning, utan att gå via ett mellanliggande textstadium.

Vi kan uppnå ytterligare förbättringar genom att förse vår modell med mer kontext om de samtal den översätter: vad som diskuteras, vem som diskuterar det samt de specifika fraser och den terminologi som de sannolikt kommer att använda. Detta efterliknar en stor del av det intensiva träningsarbetet som de bästa mänskliga tolkarna utför inför stora evenemang eller möten. Precis som de gör det möjligt för våra modeller att översätta vad någon är på väg att säga, redan från det ögonblick då personen börjar forma ett ord.

Nya möjligheter för röstöversättning

Dessa nya, direkta modeller för översättning av tal undanröjer några av de viktigaste begränsningarna som röstöversättning för närvarande brottas med. På så sätt öppnar de upp för några mycket spännande nya möjligheter.

Utan kravet på att översätta till text och tillbaka kan vi spara hela sekunder i den tid det tar att leverera en muntlig översättning. När det gäller att följa tal i realtid är det en mycket betydande tidsbesparing som kommer att ha stor inverkan på användarupplevelsen och publikupplevelsen.

Och det finns mer. Att arbeta direkt med ljudinmatning innebär att vi kan träna modeller att upptäcka accenter, dialekter och nyanser som finns inbäddade i sättet som människor talar på. Extra inferenstid och rikare ljudinmatningar innebär att vi kan skapa talade utdata som fångar känslan och den djupare innebörden i det människor säger.

Framtiden för realtidsröstöversättning med hjälp av AI handlar inte bara om att det går snabbare. Den är också mer genuint mänsklig: den fångar upp fler av de många nivåer på vilka människor kommunicerar när de talar. Det förvandlar DeepL från en översättningsmotor till ett realtidsröstlager, som kan möjliggöra den mest naturliga formen av mänsklig kommunikation på ett sätt som gör att språket försvinner som en källa till friktion. 

Det är just detta som gör detta till ett av de mest spännande områdena inom AI-forskningen hos DeepL. 

Dela

Håll kontakten

Få en förhandsvisning av våra senaste AI-innovationer.