DeepL AI Labs
L'intégration de Mixhalo au sein de la plateforme DeepL ne se limite pas à ajouter de nouvelles capacités de traduction de voix à voix en temps réel et à grande échelle. Elle transforme en profondeur notre vision des technologies vocales. Lorsqu’on parvient à maîtriser la vitesse de diffusion audio et à en faire un atout plutôt qu'une contrainte, l'impossible se transforme en « roadmap produit ».
Ensemble, nos équipes développent une couverture linguistique vocale adaptée à tout type d'expérience et d'interaction. Grâce à l'API DeepL Voice, elles permettent aux innovateurs du monde entier d'intégrer la voix multilingue en direct et en temps réel au cœur de chaque parcours client et expérience spectateur.
Cela va de la restitution de toute l'émotion d'un commentateur sportif décrivant un but ou un touchdown, à des solutions vocales instantanées qui rompent l'isolement des patients non anglophones dans le secteur médical, en passant par une gestion optimisée des appels au service client pour éliminer le stress et la frustration, sans oublier la traduction en direct d'événements, bien plus rapide que celle assurée par des interprètes humains.
Vik Singh, cofondateur de Mixhalo, et Leo Doin, responsable du pôle Voice chez DeepL, ont abordé le défi de la réduction de la latence audio sous deux angles complémentaires. Mixhalo est née dans le secteur de la musique, en parvenant à diffuser le son de la caisse claire d'un batteur à des milliers de fans réunis dans un stade, plus rapidement que la vitesse de propagation de l'onde sonore. De leur côté, les modèles linguistiques de DeepL traduisent l'audio en temps réel de A à Z, sans passer par des API tierces, réduisant ainsi le délai de traduction à son strict minimum.
Démons de capture audio sur mesure, protocoles réseau personnalisés, détection d'erreurs en temps réel, moteurs audio optimisés pour une lecture ultra-rapide : toutes ces innovations techniques libèrent de l'espace pour façonner une expérience de traduction audio en direct inédite. Ajoutez-y l'intelligence linguistique et cette optimisation devient instantanée, portée par des modèles capables d'identifier le moment idéal pour traduire et de synchroniser des langues aux structures grammaticales différentes.
L'expérience idéale de traduction en direct ne consiste pas simplement à diffuser le son traduit immédiatement. Il s'agit d'ajuster la lecture de manière intelligente, grâce à une IA qui maîtrise parfaitement le fonctionnement de chaque langue.
Toutes ces avancées se concrétisent dans la traduction voix-à-voix en direct pour les centres d'appels. C'est l'une des applications les plus puissantes de l’API DeepL Voice. Vik et l'équipe Mixhalo la perfectionnent pour garantir que les clients conservent toujours un lien naturel avec les conseillers, sans que la traduction n'altère le sentiment d'être réellement écoutés.
C'est probablement lors d'événements en direct que le rapprochement entre DeepL et Mixhalo révélera tout son potentiel : des conférences rassemblant des milliers de participants et des centaines d'intervenants, tous en mesure de partager leurs idées et de suivre les interventions dans leur langue de prédilection, via un flux audio diffusé directement sur leurs appareils dans toute la salle.
C'est dans de tels contextes que la valeur d'une couverture vocale multilingue en temps réel prend tout son sens. Grâce à une latence ultra-faible, les participants peuvent écouter l'intervenant de leur choix tout en se déplaçant. Ils peuvent ainsi suivre les présentations même s'ils ne se trouvent pas dans la salle. La traduction vocale instantanée en direct permet à chaque participant de profiter des échanges dans la langue qu'il maîtrise le mieux, tout en préservant l'émotion et les nuances d'expression. De plus, chaque intervenant peut exprimer ses idées dans la langue dans laquelle il les a conçues.
Mais le plus impressionnant reste la vitesse d'exécution. Nous développons de nouvelles méthodes innovantes permettant aux modèles d'IA de DeepL d'assimiler le contexte des conférences, des tables rondes et des présentations, à l'image du travail de préparation effectué par des interprètes de conférence. Associée à la vitesse de traitement de l'IA, cette approche nous permet de générer des traductions de voix à voix en direct bien plus rapidement que ne le feraient des traducteurs humains. Cela redéfinira durablement les standards en matière de contenus multilingues. L'expérience s'annoncera futuriste, voire magique. Elle commencera à transformer notre manière de concevoir la communication orale.