Hoe DeepL Voice de unieke uitdagingen van realtime spraakvertaling aanpakt

In deze blogpost
- Samenvatting
- Waarom realtime spraakbericht vertalen moeilijker is dan tekstvertalingen
- Waarom snelheid de hoogste prioriteit heeft bij realtime spraakbericht vertaling
- Hoe gesproken taal verschilt van geschreven taal – en waarom dit van belang is voor vertalingen
- Hoe DeepL Voice tegelijkertijd nauwkeurigheid en snelheid optimaliseert
- Hoe de plaatsing van werkwoorden in verschillende talen realtime vertaling beïnvloedt
- Waarom taalkundige expertise van mensen DeepL Voice nauwkeuriger maakt
Samenvatting
- Realtime spraakbericht vertalen vereist snelheid, nauwkeurigheid en het vermogen om onvolledige zinnen te verwerken: uitdagingen waar tekstvertalingen niet mee te maken hebben.
- Gesproken taal bevat onvloeiendheden, spreektaal en korte bevestigingen die moeten worden gefilterd in plaats van letterlijk vertaald.
- Door de snelheid van de spraak te benaderen, veranderen deelnemers aan een vergadering van passieve luisteraars in actieve bijdragers.
- DeepL Voice minimaliseert "flikkeringen" door flexibele vertalingen te genereren die nieuwe informatie halverwege een zin kunnen verwerken.
- Taalkundige expertise van mensen bepaalt hoe DeepL Voice omgaat met werkwoordplaatsing, zinsstructuur en contextuele beoordeling in verschillende talen.
- DeepL werkte samen met bedrijven en taalkundige experts om ervoor te zorgen dat DeepL Voice de prioriteiten van de communicatie in de praktijk weerspiegelt.
- NEC Corporation was het eerste bedrijf dat DeepL Voice na de lancering volledig implementeerde.
- De Language AI-suite van DeepL, met onder meer DeepL Voice, Translator en Write, biedt internationale ondernemingen de tools om duidelijk te communiceren.
Mensen spreken niet op dezelfde manier als ze schrijven. En ze ervaren gesproken gesprekken niet op dezelfde manier als het lezen van een e-mail of een artikel.
Ons vermogen om elkaar te begrijpen op het moment van spreken – waarbij we allerlei vormen van verbale en non-verbale communicatie samenbrengen om direct te begrijpen wat iemand bedoelt – is de evenwichtsoefening van de menselijke expressie.
Wanneer u een stap terug doet en nadenkt over wat er in een gesprek gebeurt, is het verbazingwekkend hoeveel informatie we zo snel overbrengen.
Wanneer u zich ten doel stelt om gesproken interacties te vertalen terwijl ze plaatsvinden, zoals DeepL heeft gedaan met onze DeepL Voice-oplossing, ontdekt u allerlei fascinerende inzichten in wat het vertalen van gesproken taal anders maakt dan het vertalen van tekst.
In dit bericht deel ik enkele van die inzichten en leg ik uit hoe we deze gebruiken om de ervaring van vergaderingen en gesprekken te transformeren.
Realtime stemvertaling is een feit: ontdek hoe DeepL Voice dit mogelijk maakt.
Waarom realtime spraakbericht vertalen moeilijker is dan tekstvertalingen
Directe, conversatiegerichte communicatie is fundamenteel menselijk en uiterst moeilijk te repliceren door technologie – zelfs technologie die zo geavanceerd is als AI.
Als u oplossingen voor bedrijven wilt ontwikkelen die mensen helpen gesprekken in meerdere talen te volgen en eraan deel te nemen, moet u beginnen met een diepgaand begrip van de uitdagingen die hiermee gepaard gaan.
Een van die uitdagingen is het nabootsen van het menselijke vermogen om te anticiperen op wat mensen zeggen nog voordat ze hun zin hebben afgemaakt.
Wanneer u spraak in live situaties vertaalt, moet u ook anticiperen op hoe iemands woorden het best in een andere taal kunnen worden uitgedrukt. Cruciaal is dat u dit moet doen voordat u zeker weet hoe de oorspronkelijke zin zal eindigen, om lange vertragingen te voorkomen.
De uitdaging hierbij is dat wat een nauwkeurige vertaling van een paar woorden lijkt te zijn, een onnauwkeurige vertaling kan blijken te zijn zodra de persoon zijn zin heeft afgemaakt.
Toen we begonnen met de ontwikkeling van DeepL Voice, wisten we dat we met technologie alleen geen hoogwaardige live stemvertaling konden realiseren. Het hangt af van een diepgaande interesse in en kennis van de verschillende manieren waarop taal werkt.
Daarom hebben we experts op het gebied van taalkunde bijeengebracht, met name met betrekking tot gesproken conversaties. We maakten ook gebruik van DeepL’s krachtige contextuele begrip van hoe verschillende talen werken.
Daarnaast zijn we partnerschappen aangegaan met bedrijven om hun prioriteiten te verkennen en de ervaring om spraakberichten te vertalen te ontdekken die voor hen de meeste waarde creëert.
Ontdek hoe DeepL AI vertalen transformeert om echt grenzeloos bedrijf doen mogelijk te maken.
Waarom snelheid de hoogste prioriteit heeft bij realtime spraakbericht vertaling
Een van de eerste inzichten die we hebben opgedaan, is dat timing alles is als het gaat om realtime vertaling van een vergadering of een gesprek.
Als u de snelheid van de spraak kunt benaderen – door de vertaling van een zin weer te geven op het moment dat de spreker deze heeft uitgesproken – dan kunt u een grote invloed uitoefenen op hoe inclusief die vergaderingen kunnen zijn.
Christine Aubry, internationaal coördinator bij de internationale patisseriefabrikant Brioche Pasquier, legde dit verder uit tijdens DeepL Dialogues.
Zij merkte op dat snellere vertalingen ervoor zorgen dat mensen overschakelen van passieve naar actieve deelname. In plaats van moeite te hebben om bij te blijven met wat anderen in een andere taal zeggen, voelen ze zich volledig op de hoogte. Net als een sprekers van de moedertaal hebben ze de mogelijkheid om in te springen, het gesprek vorm te geven en actief deel te nemen.
Een seconde of wat maakt een enorm verschil.
Daarom is snelheid een topprioriteit bij het vertalen van realtime spraak. Maar u moet snelheid afwegen tegen andere prioriteiten die ook een grote invloed hebben op de ervaring van mensen. Vertalingen moeten zo nauwkeurig mogelijk zijn om misverstanden en verwarring te voorkomen.
En waar mogelijk moeten vertalingen het 'flikkeren' minimaliseren dat optreedt wanneer u eerder vertaalde tekst moet corrigeren omdat de betekenis is veranderd. Hoe lager de flikkerfrequentie, hoe gemakkelijker het is voor iemand om een gesprek op een natuurlijke manier te volgen.
Hoe gesproken taal verschilt van geschreven taal – en waarom dit van belang is voor vertalingen
Om gesproken taal nauwkeurig te vertalen, is het belangrijk om de vele verschillen tussen de patronen van geschreven taal en het ritme van spraak te begrijpen.
De manier waarop mensen spreken is bijvoorbeeld veel individueler en minder consistent dan de manier waarop ze schrijven. Ze gebruiken eigenaardige uitdrukkingen en spreektaal die zowel voortkomen uit regionale dialecten als uit hun specifieke persoonlijkheid of zelfbeeld.
Bovendien construeren en corrigeren mensen zinnen terwijl ze spreken, wat leidt tot onvloeiendheden waarbij een grammaticaal onjuiste term onmiddellijk volgt op een andere, meer correcte. Het letterlijk weergeven hiervan in een vertaling helpt iemand die de betekenis probeert te begrijpen niet verder.
Tijdens gesprekken laten mensen ook korte bevestigingen (zoals “uh-huh”) vallen om de spreker gerust te stellen dat ze begrijpen of het eens zijn met wat er gezegd wordt. Deze bevorderen de flow van het gesprek zelf. Ze maken vertalingen echter onoverzichtelijk voor mensen die de tekst in een andere taal proberen te volgen.
Het is nuttig om deze elementen van de gesproken taal uit een vertaling te filteren.
Beheer terminologie en nuances met DeepL-Woordenlijsten.
Hoe DeepL Voice tegelijkertijd nauwkeurigheid en snelheid optimaliseert
De uitdaging wordt nog interessanter als u bedenkt dat een realtime vertaalplatform geen volledige zinnen vertaalt. Het moet een zin vertalen terwijl iemand die uitspreekt, op een moment dat de uiteindelijke betekenis van die zin nog niet duidelijk is.
Dit vereist dat wij vertalingen op een iets andere manier optimaliseren. We willen niet alleen de meest nauwkeurige vertaling. We willen een nauwkeurige vertaling die flexibel genoeg is om nieuwe informatie op te nemen die de richting van wat mensen zeggen zou kunnen veranderen.
Hier is een voorbeeld.
Stel u voor dat we een virtuele vergadering vertalen waarin een van de deelnemers Engels spreekt en een ander volgt wat er gezegd wordt via ondertitels in het Duits.
Onze spreker die Engels spreekt onderbreekt het gesprek om te zeggen: “I found it.” Als we nu aannemen dat dit een volledige zin is, zou de best mogelijke Duitse vertaling zijn: “Ich habe es gefunden.”
Omdat het hier echter om live spraak gaat, kunnen we niet met zekerheid zeggen of de zin compleet is of niet.
In dit geval zou het beter zijn om in plaats daarvan een vertaling als "Ich fand es" te gebruiken. Waarom Wanneer de Engelstalige spreker vervolgens zegt: "I found it frustrating", past de vertaling "ich fand es" perfect om er simpelweg het woord "frustrierend" aan toe te voegen.
Als de eerste drie woorden zouden worden vertaald als "Ich habe es gefunden", dan zouden we de hele vertaling moeten herzien.
Dat is het soort grote "haperingen" dat het intuïtief volgen van een gesprek in de weg staat. En dat is het soort probleem dat DeepL waar mogelijk tot een minimum wil beperken.
Hoe de plaatsing van werkwoorden in verschillende talen realtime vertaling beïnvloedt
Nauwkeurige, realtime spraakbericht vertaling omvat een breed scala aan dergelijke contextuele beoordelingen die het best kunnen worden gemaakt wanneer menselijke expertise de technologie begeleidt. De expertise omvat inzichten in waar verschillende talen de werkwoorden plaatsen die cruciaal zijn voor de betekenis van een zin.
Als ze aan het begin staan (zoals in het Frans en het Spaans), is het mogelijk om een vertaling sneller weer te geven dan wanneer ze aan het einde staan.
Dit alles helpt een systeem om net lang genoeg te pauzeren om nauwkeurig te zijn, maar niet zo lang dat het begrip onnodig wordt vertraagd.
Lees succesverhalen van DeepL-klanten: de ondernemingen die vertrouwen op onze Language AI.
Waarom taalkundige expertise van mensen DeepL Voice nauwkeuriger maakt
Deze combinatie van menselijke taalkundige expertise en uiterst nauwkeurige vertalingen stelt DeepL Voice in staat een groot verschil te maken voor de ervaring van vergaderingen en gesprekken voor internationale bedrijven.
Tot deze bedrijven behoort onder meer het Japans multinationale IT- en elektronicaconcern NEC Corporation. Het werd het eerste bedrijf dat DeepL Voice volledig implementeerde slechts enkele weken na de lancering ervan.
De opwinding rond DeepL Voice weerspiegelt het feit dat dit een baanbrekend moment is voor spraakbericht vertalen. De mogelijkheid om te decoderen en te vertalen wat mensen zeggen terwijl ze het zeggen, vermenigvuldigt de waarde die we kunnen creëren voor internationale bedrijven.
Het verandert de manier waarop teams kunnen samenwerken, bouwt sterkere relaties op en zorgt ervoor dat verschillende ideeën en perspectieven altijd worden meegenomen.
De vooruitgang die we tot nu toe hebben geboekt, maakt nu al een groot verschil in de manier waarop organisaties werken. Er staat nog veel meer te gebeuren!
Ervaar de toekomst van meertalige communicatie met DeepL