DeepL AI Labs

L’intégration de Mixhalo à la plateforme DeepL n’a pas seulement ajouté de nouvelles capacités en matière de traduction vocale en temps réel à grande échelle. Elle transforme la portée de ce que nous pouvons créer dans le domaine de la Voice. Lorsque vous êtes en mesure de contrôler la vitesse de diffusion audio et de la faire cesser d’être une contrainte, ce qui était auparavant impossible peut rapidement s’inscrire dans une feuille de route produit.

Ensemble, nos équipes développent une couche de langue parlée accessible à tous les types d’expériences et d’interactions. Grâce à l’API DeepL Voice, elles permettent aux innovateurs du monde entier d’intégrer une voix multilingue, en direct et en temps réel, dans chaque type de parcours client et d’interaction avec le public.

Cela inclut la restitution de toute l’émotion d’un commentateur de football décrivant un but ou un touchdown, des expériences vocales instantanément accessibles qui éliminent le sentiment d’isolement des locuteurs non natifs dans les établissements de santé, la conception minutieuse des expériences d’appel au service client pour éliminer le stress et la frustration, ainsi qu’une expérience multilingue des événements en direct qui fournit une traduction de la voix bien plus rapidement que ne le peuvent des interprètes humains.

Les fondements essentiels de l’audio multilingue en temps réel

Vik Singh, cofondateur de Mixhalo, et Leo Doin, responsable de la division Voice chez DeepL, ont abordé le défi de la réduction de la latence de l’audio multilingue sous deux angles complémentaires. Mixhalo a vu le jour dans l’industrie musicale, en diffusant en streaming le son d’un batteur frappant sur une caisse claire vers un stade rempli de milliers de fans, plus rapidement que les ondes sonores elles-mêmes ne pouvaient les atteindre. Les modèles linguistiques de DeepL sont capables de gérer la traduction audio en temps réel, de bout en bout, sans passer par différentes API, ce qui réduit la latence de la traduction à son niveau le plus bas possible.

Concevoir des expériences audio traduites qui touchent sur le plan émotionnel

Des démons de capture audio sur mesure, des protocoles réseau personnalisés, une détection des erreurs en temps réel, des moteurs audio optimisés pour la rapidité de lecture : toutes ces innovations techniques créent le temps et l’espace nécessaires pour concevoir une expérience de traduction audio en direct plus optimisée. Ajoutez-y l’intelligence linguistique, et cette optimisation peut s’opérer instantanément, grâce à des modèles qui savent déterminer le moment le plus opportun pour traduire et comment synchroniser des langues présentant des structures grammaticales différentes.

L’expérience idéale de traduction en direct ne consiste pas à diffuser instantanément l’audio traduit. Il s’agit d’ajuster la lecture de manière intelligente, grâce à une IA qui comprend en profondeur le fonctionnement de chaque langue.

Tout cela se concrétise dans la traduction vocale en direct pour les centres d’appels. C’est l’une des applications les plus puissantes de l’API DeepL Voice. Vik et l’équipe de Mixhalo la développent afin de garantir que les clients aient toujours le sentiment d’être en lien avec les conseillers, et que la traduction ne compromette jamais l’impression qu’ils sont écoutés.

Des événements en direct, traduits à une vitesse qu’aucun être humain ne peut égaler

C’est peut-être lors d’événements en direct que l’association de DeepL et de Mixhalo aura le plus grand impact : des conférences réunissant des milliers de participants et des centaines d’intervenants, tous capables de partager leurs idées et de suivre les sessions dans la langue de leur choix, grâce à un flux audio diffusé sur leurs appareils, partout dans la salle.

C’est dans des scénarios comme celui-ci que la valeur d’une couche vocale multilingue en temps réel devient véritablement évidente. Grâce à un son à très faible latence, les participants peuvent écouter l’intervenant de leur choix tout en se déplaçant. Ils peuvent suivre les sessions même lorsqu’ils ne se trouvent pas dans la salle. La traduction vocale en direct et instantanée permet à chaque participant d’entendre la langue qu’il comprend le mieux, avec toute l’émotion et les nuances implicites qui y sont contenues. Cela signifie également que chaque intervenant peut partager ses idées dans la langue dans laquelle il les a formulées

Mais ce qui sera sans doute le plus frappant, c’est la rapidité avec laquelle tout cela se déroule. Nous développons actuellement de nouvelles méthodes innovantes permettant aux modèles d’IA de DeepL de saisir et d’analyser le contexte des discours d’ouverture, des tables rondes et autres interventions, à l’instar de la manière dont les interprètes d’événements en direct se préparent à l’avance. Combiné à la vitesse de traitement supérieure de l’IA, cela nous permet de générer des traductions en direct, de la voix vers la voix, bien plus rapidement que ne le peuvent les traducteurs humains. Cela va redéfinir les attentes quant à ce que doit être l’expérience du contenu multilingue. Cela semblera futuriste, voire magique. Et cela commencera à transformer les attentes concernant le fonctionnement de la communication orale.

Découvrez-en davantage sur Mixhalo et les projets de DeepL dans ce blog.

Partager

Restez connecté

Découvrez en avant-première nos dernières innovations en matière d’IA.