DeepL AI Labs
De integratie van Mixhalo in het DeepL-platform heeft niet alleen nieuwe mogelijkheden toegevoegd op het gebied van realtime spraak-naar-spraakvertaling op grote schaal. Het verandert de reikwijdte van wat we op het gebied van DeepL Voice kunnen ontwikkelen. Wanneer u de snelheid van de audio-uitvoer kunt regelen en dit als beperking kunt wegnemen, kan wat voorheen onmogelijk was al snel deel uitmaken van een productroadmap.
Samen bouwen onze teams aan een laag voor de gesproken taal die beschikbaar is voor elk type ervaring en interactie. Via de DeepL Voice API stellen zij innovators overal in staat om live, realtime, meertalige spraak te integreren in elke vorm van klant- en publiekservaring.
Dat omvat het vastleggen van alle emotie van een voetbalcommentator die een doelpunt of een touchdown beschrijft, direct toegankelijke spraakervaringen die het gevoel van isolatie wegnemen voor anderstaligen in de gezondheidszorg, een zorgvuldig ontwerp van telefonische klantenservice om stress en frustratie te elimineren, en een meertalige ervaring van live-evenementen die vertaalde spraak veel sneller levert dan menselijke tolken dat kunnen.
Vik Singh, medeoprichter van Mixhalo, en Leo Doin, hoofd van DeepL Voice, hebben de uitdaging om de latentie voor meertalige audio te verminderen vanuit twee complementaire invalshoeken benaderd. Mixhalo is ontstaan in de muziekindustrie, waar het geluid van een drummer die op een snaredrum slaat, naar een stadion vol duizenden fans werd gestreamd – sneller dan de geluidsgolven zelf hen konden bereiken. De taalmodellen van DeepL zijn in staat om de vertaling van realtime audio van begin tot eind af te handelen, zonder overdracht naar verschillende API’s, waardoor de vertraging van de vertaling tot een absoluut minimum wordt beperkt.
Op maat gemaakte audio-opnamedaemons, aangepaste netwerkprotocollen, realtime foutdetectie, audio-engines die zijn geoptimaliseerd voor afspeelsnelheid: al deze technische innovaties creëren tijd en ruimte om een nog beter geoptimaliseerde ervaring van live audiovertaling te ontwerpen. Voeg daar taalintelligentie aan toe en de optimalisatie kan onmiddellijk plaatsvinden, via modellen die weten wat het beste moment is om te vertalen en hoe talen met verschillende grammaticale structuren moeten worden gesynchroniseerd.
De ideale live-ervaring van vertaling betekent niet dat vertaalde audio onmiddellijk wordt afgespeeld. Het gaat erom het afspelen op intelligente wijze aan te passen, via AI die diepgaand begrijpt hoe elke taal werkt.
Dit alles komt samen in live spraak-naar-spraakvertaling voor callcenters. Het is een van de krachtigste toepassingen van de DeepL Voice API. Vik en het Mixhalo-team ontwikkelen deze technologie om ervoor te zorgen dat klanten altijd een gevoel van verbondenheid met de medewerkers die hen ondersteunen ervaren en dat de vertaling nooit afbreuk doet aan het gevoel dat er naar hen wordt geluisterd.
Misschien zal de grootste impact van de samenwerking tussen DeepL en Mixhalo wel merkbaar zijn bij live-evenementen: conferenties met duizenden deelnemers en honderden sprekers, die allemaal ideeën kunnen uitwisselen en sessies kunnen volgen in de taal van hun voorkeur, via audio die in de hele zaal naar hun apparaten wordt gestreamd.
Juist in dit soort scenario’s komt de waarde van een realtime, meertalige spraaklaag pas echt tot uiting. Audio met ultralage latentie betekent dat deelnemers kunnen luisteren naar de spreker van hun keuze terwijl zij zich verplaatsen. Zij kunnen sessies volgen, zelfs wanneer zij zich niet in de zaal bevinden. Live, onmiddellijke spraakvertaling betekent dat elke deelnemer de taal hoort die hij of zij het beste begrijpt, waarbij alle emotie en impliciete uitdrukkingen worden weergegeven. Het betekent ook dat elke spreker zijn of haar ideeën kan delen in de taal waarin ze zijn ontstaan
Het meest opvallend zal echter wellicht de snelheid zijn waarmee dit alles gebeurt. We ontwikkelen innovatieve nieuwe manieren waarop de AI-modellen van DeepL de context rond keynotes, paneldiscussies en andere sprekersessies kunnen vastleggen en verwerken, op vrijwel dezelfde manier als tolken bij live-evenementen zich van tevoren voorbereiden. Wanneer dit wordt gecombineerd met de hogere verwerkingssnelheid van AI, zijn wij in staat om live spraak-naar-spraakvertalingen te genereren die veel sneller zijn dan menselijke vertalers kunnen produceren. Dit zal de verwachtingen over hoe de ervaring met meertalige content eruit moet zien, volledig veranderen. Het zal futuristisch aanvoelen, zelfs magisch. En het zal de verwachtingen over hoe gesproken communicatie werkt, ingrijpend veranderen.