DeepL AI Labs

La traduction vocale en temps réel n'est pas simplement une traduction dotée d'un nouveau format d'entrée ou de sortie. Il s'agit d'un défi fondamentalement nouveau, différent et passionnant pour la recherche en IA. Elle vise à offrir une expérience utilisateur très différente qui redéfinit les priorités de la traduction, introduit de nouvelles contraintes et exige de nouvelles formes de jugement et de prise de décision de la part d’un modèle d’IA. 

C’est le défi que Sascha Brinker, responsable de recherche, et Kristina Geißler, chercheuse, relèvent au sein de notre équipe de recherche vocale. Ils font partie du groupe chargé de faire évoluer le modèle d'IA de DeepL pour la traduction de texte, déjà réputé pour sa qualité supérieure, afin d'établir une nouvelle norme en matière de traduction vocale en temps réel. Ils s'appuient aujourd'hui sur ces premiers succès avec de nouveaux modèles et techniques d'entraînement qui ouvrent des perspectives inédites pour les échanges multilingues en temps réel.

S’appuyer sur des modèles de traduction de texte de haute qualité

Nous sommes partis d’une base solide : la qualité et la compréhension contextuelle du modèle de traduction de texte existant de DeepL. L’équipe Voice a pu réaliser d’importants progrès dès le début en déployant ce modèle et en ajustant la stratégie d’inférence afin d’accélérer la traduction. Elle a ensuite développé des modèles sur mesure pour la voix, capables d'identifier le moment optimal pour générer des traductions. Ces modèles tirent parti de la compréhension par DeepL des relations entre les paires de langues et s'appuient sur de nouvelles phases d'apprentissage. 

L'objectif ici est de trouver le juste équilibre entre la latence, la vitesse des traductions (essentielle pour permettre aux utilisateurs de suivre une conversation et d'y participer en direct), ainsi que la précision et la stabilité. Maîtriser cet équilibre signifie que DeepL n'a pas besoin d'attendre la fin d'une phrase avant de la traduire. Parallèlement, cela minimise les « saccades », qui se produisent lorsque les modèles sont contraints de corriger en direct les sous-titres traduits. Ces éléments font une énorme différence en termes d’expérience utilisateur.

Supprimer l’étape de transcription

Adapter et faire évoluer notre modèle de traduction de texte nous a menés loin. À tel point que Slator classe actuellement DeepL comme le leader incontesté, tant sur la qualité que sur la stabilité des traductions vocales en temps réel. Cependant, le fait de ne plus avoir à transcrire le texte avant de le traduire peut nous permettre d’aller encore plus loin, et plus vite. L'équipe développe actuellement des modèles capables de générer une restitution vocale traduite directement à partir de l'audio entrant, sans passer par une étape textuelle intermédiaire.

Nous pouvons encore améliorer nos performances en fournissant à notre modèle davantage de contexte sur les conversations qu’il traduit : le sujet abordé, les interlocuteurs, ainsi que les expressions et la terminologie spécifiques qu’ils sont susceptibles d’employer. Cela reproduit une grande partie du travail de préparation intensif que les interprètes humains de haut niveau effectuent avant les grands événements ou les réunions importantes. Tout comme eux, cela permet à nos modèles de traduire ce qu'une personne s'apprête à dire, dès l'instant où elle commence à formuler un mot.

Ouvrir de nouvelles perspectives pour la traduction vocale en temps réel

Ces nouveaux modèles directs « speech-to-speech » éliminent certaines des contraintes majeures auxquelles la traduction vocale est actuellement confrontée. En brisant ces barrières, ils ouvrent la voie à de nouvelles possibilités passionnantes.

En supprimant la nécessité de traduire d’abord en texte puis de revenir à la parole, nous gagnons des secondes entières sur le délai de restitution d'une traduction vocale. Dans le contexte d'un suivi vocal en temps réel, il s'agit d'une accélération très significative qui aura un impact majeur sur l'expérience des utilisateurs et du public.

Et l'histoire ne s'arrête pas là. Travailler directement à partir d’une entrée audio signifie que nous pouvons entraîner les modèles à détecter les accents, les dialectes et les nuances subtiles propres à la façon dont les gens s'expriment. Un temps d'inférence optimisé et des entrées audio plus riches nous permettent de générer des restitutions vocales qui capturent l'émotion et le sens profond des propos tenus.

L'avenir de la traduction vocale en temps réel par l'IA n'est pas seulement une question de vitesse. Il est aussi plus profondément humain : il permet de saisir un plus grand nombre de dimensions sur lesquelles les individus communiquent lorsqu'ils parlent. Cela transforme DeepL : d'un moteur de traduction, il devient une véritable couche vocale en temps réel, capable de faciliter la forme la plus naturelle de communication humaine en faisant totalement disparaître la barrière de la langue. 

C’est ce qui fait de ce domaine l’un des plus passionnants de la recherche en IA chez DeepL. 

Partager

Restez connecté

Découvrez en avant-première nos dernières innovations en matière d’IA.