Zou u nog waarde hechten aan de vertaalkwaliteit?

Als u informatie vraagt over de kwaliteit van een willekeurige AI-vertaalservice, krijgt u waarschijnlijk een cijfer te horen. Dit is normaal gesproken een cijfer op een schaal van 100. Dit wordt vaak berekend aan de hand van een van de standaardformules voor het beoordelen van vertaalkwaliteit. Het wordt gepresenteerd als een eenvoudig, objectief en definitief overzicht van welke aanbieder de ‘beste’ vertalingen levert. Bovendien komen de vertalingen van de aanbieder waarmee u in gesprek bent vrijwel altijd als beste naar voren. In de afgelopen jaren is voortdurend herhaald dat ‘gegevens het belangrijkst zijn’, maar inmiddels beseffen wij ook dat gegevens kunnen worden geïnterpreteerd op een manier waarbij de verteller het meest gebaat is.

Ik zal eerlijk zijn. Als u aan DeepL vraagt naar de kwaliteit van de vertalingen, zult u hetzelfde antwoord krijgen. We zullen de uitgebreide kwaliteitsbenchmarkanalyse met u delen die wij in maart hebben uitgevoerd met 48.000 blinde tests met taalexperts. Uit deze analyse is gebleken dat DeepL in 94% van de testgroepen als beste naar voren kwam voor 16 talencombinaties. DeepL overtrof alle vijf grote concurrenten, waaronder de toonaangevende LLM’s. We hoeven ons hiervoor niet te verontschuldigen.

In de AI-vertaalwereld is er echter iets wat niemand graag toegeeft. Deze ongemakkelijke waarheid wordt telkens weer onder het tapijt geveegd wanneer de testresultaten worden gepubliceerd. Wij meten verschillen in kwaliteit die steeds kleiner worden. Deze verschillen zijn zelfs zo klein dat sommigen zouden kunnen beweren dat ze niet langer van belang zijn.

Momenteel zijn alle AI-vertalingen van geschreven tekst over het algemeen van goede kwaliteit. Er zijn maar weinig fouten die een leek op het eerste gezicht zou opmerken. De verschillen in kwaliteit zijn marginaal, genuanceerd en vrij subjectief. Dit is een van de redenen waarom er zoveel verschillende ranglijsten bestaan en waarom het voor toonaangevende modellen eenvoudig is om een ranglijst te vinden die in hun voordeel uitvalt.

Als u een aanbieder voor AI-vertalingen kiest, is kwaliteit dan nog steeds een onderscheidende factor waar u op moet letten? Ik vind dat u dat zeker moet doen. De kwaliteit die wordt gemeten aan de hand van testscores is echter niet de factor waar u zich op moet richten.

Het verschil tussen de prestaties van AI-vertalingen in gestandaardiseerde kwaliteitstests en de prestaties in de praktijk voor uw organisatie en uw content wordt alsmaar groter. Een test laat slechts marginale kwaliteitsverschillen zien. In de praktijk zijn de verschillen echter veel groter en hebben ze zeer concrete gevolgen voor uw bedrijf.

Wat wordt er gemeten bij kwaliteitstests voor AI-vertalingen?

Om mijn punt te verduidelijken, gaan we dieper in op wat gestandaardiseerde kwaliteitstests daadwerkelijk meten, hoe zij dit meten en het allerbelangrijkste: wat er niet in de tests wordt meegenomen.

Wanneer menselijke taalkundigen een vertaling beoordelen, maken zij doorgaans gebruik van het Multidimensional Quality Metrics (MQM)-kader, dat acht verschillende dimensies van vertaalkwaliteit omvat. Door aan deze verschillende dimensies meetwaarden toe te kennen en te bepalen hoe deze moeten worden gewogen, wordt een formule gecreëerd die een wiskundige weergave van kwaliteit biedt in de vorm van een score bestaande uit één getal.

De dimensies van MQM hebben betrekking op nauwkeurigheid (in hoeverre een vertaling in de doeltaal precies overeenkomt met de content van de originele tekst in de brontaal), maar ook op aspecten zoals de vloeiendheid van de vertaling (hoe natuurlijk de vertaling in de doeltaal klinkt), domeinspecifieke terminologie (of gespecialiseerde termen correct worden weergegeven), in hoeverre de stijl goed tot uiting komt, of de vertaling voldoet aan lokale conventies en nog veel meer.

Wat houden de verschillende formules voor vertaalkwaliteit in?

Het inzetten van deskundige taalkundigen om vertalingen te beoordelen is ingewikkeld en kostbaar. In de praktijk wordt bij veel ranglijsten voor vertaalkwaliteit die aan AI-aanbieders worden gekoppeld, helemaal geen gebruik gemaakt van menselijke beoordeling. In plaats daarvan maken zij gebruik van een van de volgende geautomatiseerde scoresystemen. Deze zijn in de loop der jaren steeds geavanceerder geworden.

  • In 2001 introduceerde Bilingual Evaluation Understudy (IBM BLEU). Dit systeem analyseert in hoeverre een automatische vertaling overeenkomt met een menselijke vertaling van dezelfde brontekst. Wat is hier het probleem van? Dit systeem gaat ervan uit dat deze referentievertaling de best mogelijke vertaling is en dat elke afwijking daarvan een fout is.
  • In 2006 werd dit aangepast voor de Translation Edit Rate (TER)-beoordeling, waarbij het aantal wijzigingen wordt geteld dat een menselijke vertaler zou moeten aanbrengen om de automatische vertaling om te zetten in een menselijke vertaling. Het is vergelijkbaar met BLEU, maar in dit systeem worden lagere cijfers beschouwd als beter.
  • Unbabel lanceerde in 2020 Crosslingual Optimized Metric for Evaluation of Translation (COMET), waarbij gebruik wordt gemaakt van een neuraal netwerkmodel om een automatische vertaling te vergelijken met zowel een menselijke vertaling als de brontekst. Het vergelijkt de vertaalde tekst met de oorspronkelijke tekst om de betekenis te achterhalen, wat bij BLEU en TER niet gebeurt.
  • Geautomatiseerde beoordeling deed zijn intrede in het LLM-tijdperk in 2023 met de lancering van GPT Estimation Metric Based Assessment (GEMBA). Dit is een systeem dat LLM’s ertoe aanzet om verschillende MQM-dimensies toe te passen op een vertaling en te beoordelen hoe deze presteert.

De automatische beoordeling van vertalingen is steeds bruikbaarder geworden, maar kan nog steeds niet helemaal tippen aan het oordeel van menselijke deskundigen. Wanneer LLM’s het zware werk van kwaliteitsbeoordeling op zich nemen, stuiten zij op problemen met vooringenomenheid: zij geven consequent de voorkeur aan vertalingen die door hun eigen model zijn geproduceerd, zelfs als deze niet nauwkeurig zijn. Dit is gedeeltelijk te wijten aan het subjectieve karakter van vertaalkwaliteit. Een AI-model beoordeelt in feite zijn eigen vertaalopdracht en besluit dat zijn eigen oplossing de beste was.

WMT25, de tiende editie van een jaarlijkse conferentie over automatische beoordeling, kwam hierover tot een zeer duidelijke conclusie: “Systemen die bij automatische beoordelingen het beste scoorden, bleken bij menselijke beoordeling niet altijd als beste uit de bus te komen. Dit wijst op een aanhoudende vertekening in de beoordeling en bevestigt dat de menselijke beoordeling de uiteindelijke maatstaf voor de vertaalkwaliteit moet blijven."

Met andere woorden: als u werkelijk iets wilt weten over vertaalkwaliteit, vraag het dan aan een menselijke deskundige (zoals DeepL doet in onze benchmarktests). Naarmate de verschillen in de kwaliteit van AI-vertalingen kleiner worden, wordt het steeds belangrijker dat mensen beoordelen hoe alle verschillende elementen met elkaar in evenwicht kunnen worden gebracht. De kwaliteitsverschillen zijn niet langer duidelijk merkbaar. Althans, niet in de standaardtests om de vertaalkwaliteit te meten.

Kwaliteitstests voor vertalingen zijn niet gericht op context, determinisme en consistentie

Zoals ik eerder al aangaf, is de vertaalkwaliteit die in tests wordt gemeten niet hetzelfde als de vertaalkwaliteit die u in de praktijk ervaart. Dit is vooral merkbaar voor beheerders van vertaal- en lokalisatieprocessen van complexe organisaties. Juist de aspecten van vertaalkwaliteit die de tests niet meten, hebben de grootste impact voor bedrijven.

Veel van de kaders en scoresystemen die ik in deze blog heb genoemd, zijn 'analytisch’. Ze werken vaak door ‘segmenten’ van de originele tekst en de vertaalde tekst met elkaar te vergelijken, wat meestal neerkomt op individuele zinnen. Ze beoordelen de vertaalkwaliteit van elke zin ook afzonderlijk, alsof deze niets te maken heeft met zinnen in andere tekstdelen.

Onze daadwerkelijke ervaring bij het lezen van vertaalde content is totaal anders. We pakken het 'holistisch' aan. We richten ons niet alleen op de zin die we op dat moment lezen, maar op de volledige tekst waarvan deze zin deel uitmaakt. Daarbij hoort ook elk ander stukje communicatie dat wij van een organisatie tegenkomen. In deze holistische omgeving is de kwaliteit van een losse vertaalde zin mogelijk minder belangrijk dan de consistentie en samenhang van de vertaalde tekst als geheel.

Elke organisatie gebruikt een eigen, kenmerkende woordenschat: terminologie en uitdrukkingen voor producten en functies, bedrijfsonderdelen, aspecten van de service, strategische concepten en nog veel meer. Het consistent vertalen van deze termen is een essentieel aspect van de vertaalkwaliteit. Indien een vertaling in het helpcentrum niet overeenkomt met de termen die op producten of actieknoppen worden gebruikt, is de vertaalkwaliteit slecht. Het doet er dan niet toe of de individuele vertalingen technisch correct zijn of niet.

Wanneer een AI-vertaalplatform op grote schaal de terminologie, stijl en toon vaststelt (zoals DeepL dat doet met woordenlijsten, stijlregels en vertaalgeheugens), neemt de waarde ervan aanzienlijk toe. Daarentegen gaat de fundamenteel kansberekenende aard van grote, algemene LLM’s (Claude, Gemini, ChatGPT) ten koste van het determinisme, de naleving en de consistentie. Ze schieten tekort op het gebied van wat er in de praktijk werkelijk telt als het gaat om vertaalkwaliteit.

Wat bij de kwaliteitstests voor vertalingen over het hoofd wordt gezien: hoe kwaliteit tot stand komt

Meestal wordt er bij het testen van de vertaalkwaliteit ook geen aandacht besteed aan de wijze waarop die kwaliteit wordt bereikt en in hoeverre dit daadwerkelijk schaalbaar is.

Volgens de eigen blinde tests van DeepL met menselijke deskundigen blijkt dat de nieuwste LLM’s voor algemeen gebruik een vergelijkbare vertaalkwaliteit leveren voor specifieke talencombinaties wanneer ze hoge redeneringsinstellingen gebruiken. Dit doen zij echter door gebruik te maken van grotere modellen, bredere taakgebieden en ruimere contextvensters. 

Dit houdt in dat ze veel tokens gebruiken (met onvoorspelbare kosten) en dat het veel langer duurt (minstens 4x en tot wel 29x langzamer), wat grote gevolgen heeft als u AI-vertalingen via een API in producten implementeert. Qua kwaliteit is het vooral van belang dat de door hen gekozen vertalingen inherent minder voorspelbaar zijn. Het komt erop neer dat zij voor elke opdracht het vertaalproces in feite opnieuw uitvinden, waardoor de termen en uitdrukkingen die zij in de ene context gebruiken, in een andere context veel minder vaak worden herhaald. 

Als u vertalingen op bedrijfsniveau uitvoert, is dat het kwaliteitsaspect waaraan u de meeste aandacht moet besteden. Uit de scores van kwaliteitstests valt hier nauwelijks iets zinnigs af te leiden.

Waarom wij een holistische visie op kwaliteit ontwikkelen waarbij klanten de controle hebben

Vanwege deze redenen bieden de scores van geautomatiseerde tests slechts een zeer beperkte indicatie van de vertaalkwaliteit. Dit betekent echter niet dat zij geen handige tool zijn om de kwaliteit van uw vertalingen te waarborgen. Ze zijn zelfs uiterst waardevol, mits u hun rol anders definieert.

We hebben bij DeepL een beoordeling van de vertaalkwaliteit (TQE)-model ontwikkeld, dat een AI-model gebruikt dat is ontwikkeld om de kwaliteit van DeepL-vertalingen te beoordelen. Dit model berekent niet alleen een score voor de vertaling. Het doel ervan is om mogelijke fouten en delen van een vertaling aan te wijzen die kunnen worden verbeterd door uw menselijke experts erbij te betrekken. Het model erkent dat dit menselijke oordeel uiteindelijk het belangrijkste is.

Wanneer ons TQE-model een tekst analyseert, doet het dat aan de hand van alle aanpassingsmogelijkheden waarmee u op DeepL werkt. Het analyseert niet de vertaalkwaliteit voor afzonderlijke onderdelen. Het controleert hoe de terminologie, stijl en toon van uw organisatie in de context worden toegepast. Het biedt het holistische kwaliteitsbeeld dat er in de praktijk werkelijk toe doet.

Als u vertaalkwaliteit belangrijk vindt, en ik vind dat u dat nog steeds zou moeten doen, dan is dit het aspect waar u zich vooral op moet richten. De resultaten tijdens tests zijn niet doorslaggevend. Het gaat erom dat u het perspectief op vertaalkwaliteit vindt dat bij u past en dat in de praktijk goed werkt voor uw content.

Wilt u TQE gebruiken om de vertaalkwaliteit te beoordelen? Op DeepL AI Labs vindt u alle details en mogelijkheden om deel te nemen aan onze TQE-testomgeving.

Delen