DeepL AI Labs
La traducción de voz en tiempo real no consiste únicamente en traducir a partir de un formato distinto de entrada o salida. Se trata de un reto totalmente nuevo, distinto y apasionante para la investigación en inteligencia artificial. Su objetivo es ofrecer una experiencia de usuario muy diferente que cambie las prioridades de traducción, introduzca nuevas restricciones y exija a un modelo de IA nuevos criterios y procesos de toma de decisiones.
Ese es el reto que han asumido el responsable de investigación Sascha Brinker y la investigadora científica Kristina Geißler como parte de nuestro equipo de investigación de voz. Forman parte del grupo que está desarrollando el modelo de IA de DeepL, de calidad superior, para marcar un nuevo estándar en la traducción de voz en tiempo real. Ahora, basándose en esos primeros logros, están desarrollando nuevos modelos y técnicas de entrenamiento que ofrecen posibilidades totalmente nuevas para la traducción de voz multilingüe en tiempo real.
Partimos de una buena base: la calidad y la comprensión contextual del modelo actual de traducción de textos de DeepL. El equipo de DeepL Voice logró importantes avances iniciales al implementar este modelo y ajustar la estrategia de inferencia para mejorar la velocidad de traducción. A continuación, desarrolló modelos a medida para voz que identifican el momento óptimo para generar las traducciones, aprovechando el conocimiento de DeepL sobre las relaciones entre combinaciones de idiomas y aplicando nuevas capas de entrenamiento.
El objetivo aquí es encontrar el equilibrio perfecto entre la latencia y la velocidad de las traducciones —algo fundamental para que los usuarios puedan seguir una conversación y participar en ella en tiempo real—, manteniendo a su vez la precisión y la estabilidad. Conseguir este equilibrio permite que DeepL no tenga que esperar hasta el final de una frase para poder traducirla. Al mismo tiempo, minimiza el «parpadeo» que se produce cuando los modelos deben corregir subtítulos ya traducidos. Todos estos factores marcan una gran diferencia en la experiencia de usuario.
Adaptar y perfeccionar nuestro modelo de traducción de texto nos ha permitido llegar muy lejos. Tanto es así que Slator sitúa actualmente a DeepL como líder indiscutible en cuanto a calidad y estabilidad de las traducciones de voz en tiempo real. Sin embargo, eliminar la necesidad de transcribir el texto antes de traducirlo nos permite avanzar todavía más y a mayor velocidad. El equipo está desarrollando modelos capaces de generar traducciones de voz directamente a partir de audio, sin pasar por la fase de transcripción del texto.
Podemos seguir avanzando al proporcionar a nuestro modelo más contexto sobre las conversaciones: de qué se habla, quiénes participan y qué frases y terminología específica es probable que empleen. Este proceso replica en gran medida el intenso trabajo de preparación que llevan a cabo los intérpretes profesionales antes de eventos o reuniones importantes. Al igual que ellos, esto permite a nuestros modelos traducir lo que alguien va a decir, desde el momento en que empieza a articular una palabra.
Estos nuevos modelos de traducción directa de voz dejan atrás algunas de las limitaciones más importantes que condicionan actualmente este campo. Con ello, abren un abanico de nuevas posibilidades de lo más interesantes.
Al eliminar la necesidad de pasar por una traducción de texto a voz y viceversa, podemos reducir en varios segundos el tiempo que se tarda en generar una traducción de voz. Cuando se sigue una conversación en tiempo real, esta aceleración tan significativa supone un gran paso adelante que mejorará enormemente la experiencia tanto para los usuarios como para la audiencia.
Y eso no es todo. Trabajar directamente con el audio de entrada nos permite entrenar modelos para que detecten acentos, dialectos y hasta los matices más sutiles de la forma de hablar de cada persona. Al contar con más tiempo de inferencia y entradas de audio de mayor calidad, podemos generar respuestas habladas que captan la emoción y el sentido profundo del discurso.
El futuro de la traducción de voz con IA en tiempo real no solo es más rápido. También es mucho más humano: capta mejor los múltiples niveles en los que nos comunicamos al hablar. Esto convierte a DeepL, más allá de un motor de traducción, en una capa de voz en tiempo real capaz de facilitar la forma más natural de comunicación humana y de hacer que el idioma deje de ser un obstáculo.
Precisamente por eso, esta es una de las áreas más apasionantes de la investigación en inteligencia artificial dentro de DeepL.