DeepL AI Labs

La incorporación de Mixhalo a la plataforma DeepL no solo ha añadido nuevas capacidades en torno a la traducción por voz en tiempo real a gran escala. Está transformando el alcance de lo que podemos crear en el ámbito de DeepL Voice. Cuando puedes controlar la velocidad de transmisión del audio y eliminar esa limitación, lo que antes era imposible puede convertirse rápidamente en un plan de desarrollo de producto.

Juntos, nuestros equipos están creando una capa de idioma hablado que está disponible para todo tipo de experiencias e interacciones. A través de la API de DeepL Voice, están dando herramientas a innovadores de todo el mundo para integrar voz multilingüe en directo y en tiempo real en todo tipo de recorridos de clientes y audiencias.

Esto incluye capturar toda la emoción de un comentarista de fútbol al describir un gol o un touchdown; experiencias de voz accesibles al instante que eliminan la sensación de aislamiento de los hablantes no nativos en entornos sanitarios; un diseño cuidadoso de las experiencias de atención al cliente por teléfono para eliminar el estrés y la frustración; y una experiencia multilingüe de eventos en directo que ofrece traducción de voz mucho más rápido de lo que pueden hacerlo los intérpretes humanos.

Los pilares fundamentales del audio multilingüe en tiempo real

El cofundador de Mixhalo, Vik Singh, y el responsable de DeepL Voice, Leo Doin, han abordado el reto de reducir la latencia del audio multilingüe desde dos perspectivas complementarias. Mixhalo surgió en la industria musical, transmitiendo el sonido de un baterista tocando la caja a un estadio lleno de miles de fans, más rápido de lo que las propias ondas sonoras tardarían en llegar hasta ellos. Los modelos lingüísticos de DeepL son capaces de gestionar la traducción de audio en tiempo real de principio a fin, sin necesidad de pasar por diferentes API, lo que reduce la latencia de la traducción al mínimo posible.

Diseñar experiencias de audio traducido que funcionen a nivel emocional

Daemons de captura de audio a medida, protocolos de red personalizados, detección de errores en tiempo real, motores de audio optimizados para la velocidad de reproducción: todas estas innovaciones técnicas crean el tiempo y el espacio necesarios para diseñar una experiencia más optimizada de traducción de audio en directo. Añadir la inteligencia lingüística permite que esa optimización se produzca al instante, gracias a modelos que saben cuál es el mejor momento para traducir y cómo sincronizar idiomas con diferentes estructuras gramaticales.

La experiencia ideal de traducción en directo no consiste en reproducir el audio traducido al instante. Se trata de ajustar la reproducción de forma inteligente, mediante una IA que entiende a fondo cómo funciona cada idioma.

Todo esto se une en la traducción por voz en directo para centros de atención al cliente. Es una de las aplicaciones más potentes de la API de DeepL Voice. Vik y el equipo de Mixhalo la están desarrollando para garantizar que los clientes siempre sientan una conexión con los agentes de atención al cliente y que la traducción nunca afecte a la sensación de que se les está escuchando.

Eventos en directo, traducidos a una velocidad que ningún humano puede igualar

Quizá el mayor impacto de la unión entre DeepL y Mixhalo se note en los eventos en directo: conferencias con miles de asistentes y cientos de ponentes, todos capaces de compartir ideas y seguir las sesiones en su idioma preferido, a través del audio que se transmite a sus dispositivos en todo el recinto.

Es en situaciones como esta donde el valor de una capa de voz multilingüe en tiempo real se hace realmente evidente. El audio de latencia ultrabaja permite a los asistentes escuchar al ponente que elijan mientras se desplazan por el recinto. Pueden seguir las sesiones incluso cuando no están en la sala. La traducción por voz en directo e instantánea hace que cada asistente escuche el idioma que mejor entiende, captando toda la emoción y la expresión implícita. También significa que cada ponente puede compartir sus ideas en el idioma en el que las ha concebido

Quizá lo más llamativo, sin embargo, sea la velocidad a la que ocurre todo esto. Estamos desarrollando nuevas formas innovadoras para que los modelos de IA de DeepL capten e incorporen el contexto de las ponencias, mesas redondas y otras sesiones de ponentes, de forma muy similar a como se preparan de antemano los intérpretes de eventos en directo. Al combinar esto con la mayor velocidad de procesamiento de la IA, podemos generar traducciones en directo de un idioma a otro mucho más rápido de lo que son capaces los traductores humanos. Esto va a cambiar por completo las expectativas sobre cómo debería ser la experiencia con el contenido multilingüe. Te parecerá algo futurista, incluso mágico. Y empezará a transformar las expectativas sobre cómo funciona la comunicación oral.

Descubre más sobre Mixhalo y los planes de DeepL en este blog.

Compartir

No te pierdas nada

Echa un vistazo a nuestras últimas innovaciones en IA.