DeepL AI Labs

L'integrazione di Mixhalo nella piattaforma DeepL non si è limitata ad aggiungere nuove funzionalità per la traduzione da voce a voce in tempo reale su larga scala. Sta trasformando le possibilità di ciò che possiamo realizzare nel campo della Voice. Quando riesci a controllare la velocità di trasmissione dell’audio, eliminando questo vincolo, ciò che prima era impossibile può rapidamente diventare parte della roadmap di un prodotto.

Insieme, i nostri team stanno creando un livello di linguaggio parlato disponibile per ogni tipo di esperienza e interazione. Grazie all’API DeepL Voice, stanno dando agli innovatori di tutto il mondo la possibilità di integrare la voce dal vivo, in tempo reale e multilingue in ogni tipo di percorso del cliente e del pubblico.

Questo include acquisire tutta l’emozione di un telecronista di calcio che descrive un gol o un touchdown, esperienze vocali immediatamente accessibili che eliminano la sensazione di isolamento per chi non parla la lingua locale in contesti sanitari, una progettazione accurata delle esperienze di assistenza clienti telefonica per eliminare stress e frustrazione, e un’esperienza multilingue di eventi dal vivo che fornisce la traduzione del parlato molto più velocemente di quanto possano fare gli interpreti umani.

Le basi fondamentali per l’audio multilingue in tempo reale

Il cofondatore di Mixhalo, Vik Singh, e il responsabile della divisione Voice di DeepL, Leo Doin, hanno affrontato la sfida di ridurre la latenza dell’audio multilingue da due prospettive complementari. Mixhalo è nata nel settore musicale, trasmettendo in streaming il suono di un batterista che suona il rullante a uno stadio pieno di migliaia di fan, più velocemente di quanto le onde sonore stesse potessero raggiungerli. I modelli linguistici di DeepL sono in grado di gestire la traduzione dell’audio in tempo reale, end-to-end, senza passare da API diverse, riducendo la latenza della traduzione al minimo possibile.

Progettare esperienze audio tradotte che funzionino a livello emotivo

Daemon per l’acquisizione audio su misura, protocolli di rete personalizzati, rilevamento degli errori in tempo reale, motori audio ottimizzati per la velocità di riproduzione: tutte queste innovazioni tecniche creano il tempo e lo spazio necessari per progettare un’esperienza più ottimizzata di traduzione audio dal vivo. Aggiungi l’intelligenza linguistica e questa ottimizzazione può avvenire all’istante, grazie a modelli che sanno qual è il momento migliore per tradurre e come sincronizzare lingue con strutture grammaticali diverse.

L’esperienza ideale di traduzione in diretta non significa riprodurre immediatamente l’audio tradotto. Si tratta di regolare la riproduzione in modo intelligente, grazie a un’IA che comprende a fondo come funziona ogni lingua.

Tutto questo si concretizza nella traduzione vocale in tempo reale per i call center. È una delle applicazioni più potenti dell’API DeepL Voice. Vik e il team di Mixhalo la stanno sviluppando per garantire che i clienti sentano sempre un legame con gli operatori dell’assistenza e che la traduzione non comprometta mai la sensazione di essere ascoltati.

Eventi dal vivo, tradotti a una velocità che nessun essere umano può eguagliare

Forse l’impatto maggiore della collaborazione tra DeepL e Mixhalo si sentirà proprio negli eventi dal vivo: conferenze con migliaia di partecipanti e centinaia di relatori, tutti in grado di condividere idee e seguire le sessioni nella loro lingua preferita, grazie all’audio trasmesso in streaming sui loro dispositivi, in tutta la sede dell’evento.

È proprio in scenari come questo che il valore di un sistema vocale multilingue in tempo reale diventa davvero evidente. L’audio a bassissima latenza permette ai partecipanti di ascoltare il relatore che preferiscono mentre si spostano all’interno della sala. Possono seguire le sessioni anche quando non sono nella sala. La traduzione vocale in tempo reale e istantanea fa sì che ogni partecipante ascolti la lingua che capisce meglio, con tutte le emozioni e le sfumature espressive acquisite. Significa anche che ogni relatore può condividere le proprie idee nella lingua in cui le ha formulate

Ma forse la cosa più sorprendente sarà la velocità con cui tutto questo avviene. Stiamo sviluppando nuovi modi innovativi per consentire ai modelli di IA di DeepL di acquisire e assimilare il contesto di discorsi, tavole rotonde e altre sessioni dei relatori, proprio come fanno gli interpreti che si preparano in anticipo per gli eventi dal vivo. Se a questo aggiungi la maggiore velocità di elaborazione dell’IA, riusciamo a generare traduzioni in tempo reale da una lingua all’altra molto più velocemente di quanto possano fare i traduttori umani. Questo ridefinirà le aspettative su come dovrebbe essere l’esperienza dei contenuti multilingue. Sembrerà futuristico, persino magico. E inizierà a trasformare le aspettative su come funziona la comunicazione parlata.

Scopri di più su Mixhalo e sui piani di DeepL in questo blog.

Condividi

Segui i nostri sviluppi

Scopri in anteprima il futuro dell’IA.