Come DeepL Voice affronta le sfide specifiche della traduzione vocale in tempo reale
I punti essenziali
- La traduzione vocale in tempo reale richiede velocità, precisione e la capacità di gestire frasi incomplete: sfide che la traduzione di testo non deve affrontare.
- Il linguaggio parlato include disfluenze, espressioni colloquiali e brevi affermazioni che devono essere filtrate piuttosto che tradotte letteralmente.
- Avvicinarsi alla velocità della voce trasforma i partecipanti alla riunione da ascoltatori passivi a contributori attivi.
- DeepL Voice riduce al minimo gli "scatti" generando traduzioni flessibili in grado di assorbire nuove informazioni nel mezzo della frase.
- Le competenze linguistiche umane guidano il modo in cui DeepL Voice gestisce la posizione dei verbi, la struttura delle frasi e la valutazione contestuale tra le diverse lingue.
- DeepL ha collaborato con aziende e professionisti della linguistica per garantire che DeepL Voice rifletta le priorità comunicative del mondo reale.
- NEC Corporation è stata la prima azienda a implementare pienamente DeepL Voice dopo il suo lancio.
- La suite di IA linguistica di DeepL, che include Voice, Traduttore e Write, offre alle aziende globali gli strumenti per comunicare in modo chiaro.
Le persone non parlano nello stesso modo in cui scrivono. E non vivono le conversazioni parlate nello stesso modo in cui leggono un'e-mail o un articolo.
La nostra capacità di capirci a vicenda nel momento in cui parliamo — mettendo insieme ogni tipo di comunicazione verbale e non verbale per cogliere all’istante ciò che qualcuno intende dire — è il numero da funambolo dell’espressione umana.
Quando fai un passo indietro e rifletti su ciò che accade in una conversazione, è incredibile quante informazioni trasmettiamo così rapidamente.
Quando ti poni l’obiettivo di tradurre le interazioni verbali mentre avvengono, come ha fatto DeepL con la nostra soluzione DeepL Voice, scopri ogni sorta di intuizione affascinante su ciò che rende la traduzione del parlato diversa dalla traduzione di testo.
In questo post condividerò alcune di queste intuizioni e spiegherò come le stiamo utilizzando per trasformare l'esperienza delle riunioni e delle conversazioni.
La traduzione vocale in tempo reale è realtà: scopri come DeepL Voice la rende possibile.
Perché la traduzione vocale in tempo reale è più difficile della traduzione di testo
La comunicazione istantanea e colloquiale è fondamentalmente umana ed estremamente difficile da replicare per la tecnologia, persino una tecnologia avanzata come l'IA.
Se vuoi creare soluzioni per le aziende professionali che aiutino le persone a seguire e partecipare a conversazioni in più lingue, devi partire da una comprensione profonda delle sfide che questo comporta.
Queste sfide includono la capacità di anticipare ciò che le persone stanno per dire prima ancora che abbiano finito di parlare.
Quando traduci la voce in situazioni dal vivo, devi anche anticipare come le parole di qualcuno possano essere espresse al meglio in un'altra lingua. Fondamentalmente, devi farlo prima di sapere con certezza come finirà la frase originale, per evitare lunghi ritardi.
La sfida qui è che quella che sembra essere una traduzione accurata di poche parole potrebbe rivelarsi una traduzione imprecisa una volta che la persona ha completato la frase.
Quando abbiamo iniziato a sviluppare DeepL Voice, sapevamo che non avremmo potuto ottenere una traduzione vocale dal vivo di alta qualità solo con la tecnologia. Dipende da un profondo interesse e dalla comprensione dei diversi modi in cui funziona la lingua.
Ecco perché abbiamo riunito esperti di linguistica applicata alle conversazioni parlate. Abbiamo anche sfruttato la potente comprensione contestuale di DeepL su come funzionano le diverse lingue.
Inoltre, abbiamo collaborato con diverse aziende per capire quali fossero le loro priorità e quale esperienza di traduzione vocale creasse più valore per loro.
Perché la velocità è la priorità assoluta nella traduzione vocale in tempo reale
Una delle prime cose che abbiamo capito è che il tempismo è tutto quando si tratta della traduzione in tempo reale di una riunione o di una conversazione.
Se riesci ad avvicinarti alla velocità della voce, visualizzando la traduzione di una frase nel momento in cui chi parla l'ha terminata, allora puoi influire notevolmente su quanto inclusive possano essere quelle riunioni.
Christine Aubry, coordinatrice internazionale per l'azienda manifatturiera globale di prodotti da forno Brioche Pasquier, ha spiegato meglio a DeepL Dialogues.
Ha sottolineato che traduzioni più veloci fanno passare le persone da una partecipazione passiva a una attiva. Invece di faticare a stare al passo con ciò che gli altri dicono in un'altra lingua, si sentono pienamente al passo. Proprio come un madrelingua, hanno l’opportunità di intervenire, dare forma alla conversazione e partecipare attivamente.
Un secondo fa un'enorme differenza.
Pertanto, la velocità è una priorità assoluta quando si traduce il parlato in tempo reale. Ma devi bilanciare la velocità con altre priorità che hanno anch'esse un grande impatto sull'esperienza delle persone. Le traduzioni devono essere il più accurate possibile per evitare malintesi e confusione.
E, ove possibile, le traduzioni devono ridurre al minimo lo "sfarfallio" che si verifica quando devi correggere un testo tradotto in precedenza perché il significato è cambiato. Più basso è il tasso di sfarfallio, più facile è per qualcuno seguire una conversazione in modo naturale.
In che modo la lingua parlata differisce da quella scritta e perché è importante per la traduzione
Per tradurre accuratamente il parlato dal vivo, è importante comprendere le numerose differenze tra gli schemi della lingua scritta e i ritmi della voce.
Ad esempio, il modo in cui le persone parlano è molto più individuale e meno coerente rispetto al modo in cui scrivono. Si usano espressioni e modi di dire distinti che possono derivare sia dai dialetti regionali che dalla propria personalità o immagine di sé.
Inoltre, le persone costruiscono e correggono le frasi mentre parlano, il che porta a disfluenze in cui un termine grammaticalmente scorretto segue immediatamente un altro, più corretto. Riprodurre tutto questo alla lettera nella traduzione non aiuta chi sta cercando di capire il significato.
Durante le conversazioni, le persone pronunciano anche brevi affermazioni (come "uh-huh") per rassicurare chi parla che hanno capito o sono d'accordo con ciò che sta dicendo. Queste espressioni aiutano il flusso della conversazione stessa. Tuttavia, ingombrano le traduzioni per chi cerca di seguire in un'altra lingua.
È utile filtrare questi elementi del linguaggio parlato dalla traduzione.
Prendi il controllo della terminologia e delle sfumature con i Glossari di DeepL.
Come DeepL Voice ottimizza contemporaneamente precisione e velocità
La sfida diventa ancora più interessante se si considera che una piattaforma di traduzione in tempo reale non traduce frasi complete. Deve tradurre una frase mentre qualcuno la sta pronunciando, quando il significato finale di quella frase non è ancora chiaro.
Questo ci impone di ottimizzare le traduzioni in modo leggermente diverso. Non vogliamo solo la traduzione più accurata. Vogliamo una traduzione accurata che sia abbastanza flessibile da incorporare nuove informazioni che potrebbero cambiare il senso di ciò che le persone stanno dicendo.
Ecco un esempio.
Immagina che stiamo traducendo una riunione virtuale in cui uno dei partecipanti parla in inglese e un altro segue ciò che dice tramite i sottotitoli in tedesco.
Il nostro interlocutore in inglese interrompe la conversazione per dire: "I found it." Ora, se supponiamo che questa sia una frase completa, la migliore traduzione possibile in tedesco sarebbe: “Ich habe es gefunden”.
Tuttavia, poiché si tratta di una voce dal vivo, non possiamo essere certi che la frase sia completa o meno.
In questo caso, un'opzione migliore potrebbe essere quella di usare invece una traduzione come "Ich fand es". Ma perché? Quando chi parla in inglese continua dicendo: «I found it frustrating», la traduzione «ich fand es» è perfetta per aggiungere semplicemente la parola «frustrierend».
Se le prime tre parole fossero tradotte come “Ich habe es gefunden”, allora dovremmo rivedere l’intera traduzione.
Questo è il tipo di "intoppo" che impedisce di seguire intuitivamente una conversazione. Ed è proprio questo il tipo di problema che DeepL mira a ridurre al minimo, ove possibile.
Come la posizione dei verbi nelle diverse lingue influenza la traduzione in tempo reale
Una traduzione vocale accurata e in tempo reale comporta una vasta gamma di valutazioni contestuali di questo tipo, che vengono effettuate al meglio quando la tecnologia è guidata dall’esperienza umana. Tale competenza include la comprensione di dove le diverse lingue tendono a posizionare i verbi cruciali per il significato di una frase.
Se si trovano all'inizio (come in francese e spagnolo), è possibile visualizzare una traduzione più rapidamente rispetto a quando si trovano alla fine.
Tutto questo aiuta il sistema a fare una pausa appena quanto basta per essere preciso, ma non così a lungo da ritardare inutilmente la comprensione.
Leggi le storie di successo dei clienti DeepL: le aziende che si affidano alla nostra IA linguistica.
Perché la competenza linguistica umana rende DeepL Voice più accurato
Questa combinazione di competenza linguistica umana e traduzione altamente accurata sta già consentendo a DeepL Voice di fare una grande differenza nell'esperienza di riunioni e conversazioni per le aziende internazionali. Tra queste c'è NEC Corporation, che è diventata la prima azienda a implementare completamente DeepL Voice, solo poche settimane dopo il nostro lancio ufficiale.
L'entusiasmo intorno a DeepL Voice riflette il fatto che questo è un momento rivoluzionario per la traduzione vocale. La capacità di decodificare e tradurre ciò che le persone dicono, mentre lo dicono, moltiplica il valore che possiamo creare per le aziende internazionali. Trasforma il modo in cui i team possono collaborare, costruisce relazioni più solide e garantisce che idee e prospettive diverse siano sempre incluse.
I progressi che abbiamo fatto finora stanno già facendo una grande differenza nel modo in cui le organizzazioni operano. E c'è ancora molto altro in arrivo!
