Así afronta DeepL Voice los retos únicos de la traducción de voz en tiempo real

Contenido
- Aspectos clave
- La complejidad de traducir voz en tiempo real frente a la traducción de texto
- El papel crucial de la velocidad en la traducción de voz en tiempo real
- Diferencias entre el lenguaje oral y el escrito: por qué son clave en la traducción
- DeepL Voice optimiza la precisión y la velocidad al mismo tiempo
- La posición de los verbos y su impacto en la traducción en tiempo real
- La experiencia lingüística humana mejora la precisión de DeepL Voice
Aspectos clave
- La traducción de voz en tiempo real exige rapidez, precisión y la capacidad de trabajar con frases incompletas: retos que no existen en la traducción de textos.
- El lenguaje oral contiene muletillas, expresiones coloquiales y afirmaciones breves que es necesario filtrar, en lugar de traducirlas literalmente.
- Alcanzar una velocidad similar a la del habla permite que los participantes de la reunión pasen de ser oyentes pasivos a colaboradores activos.
- DeepL Voice minimiza el «parpadeo» al generar traducciones flexibles que pueden asimilar nueva información en mitad de la oración.
- DeepL Voice se basa en la experiencia lingüística humana para optimizar la colocación de verbos, la estructura de las frases y el criterio contextual en distintos idiomas.
- Gracias a la colaboración con empresas y expertos lingüísticos, DeepL ha logrado que DeepL Voice refleje las prioridades de la comunicación en el mundo real.
- NEC Corporation fue la primera empresa en implementar DeepL Voice al completo tras su lanzamiento.
- Las soluciones de IA lingüística de DeepL, que incluyen DeepL Voice, el Traductor y DeepL Write, son las herramientas que las empresas internacionales necesitan para comunicarse con total claridad.
No hablamos igual que escribimos. Tampoco percibimos igual una conversación oral que la lectura de un correo electrónico o un artículo.
Nuestra capacidad para entendernos en el momento de hablar —reuniendo todo tipo de comunicación verbal y no verbal para captar al instante lo que alguien quiere decir— es el acto de equilibrio de la expresión humana.
Si nos paramos a pensar en lo que ocurre durante una conversación, es sorprendente la cantidad de información que transmitimos en tan poco tiempo.
Al asumir la tarea de traducir interacciones orales en tiempo real, como ha hecho DeepL con nuestra solución DeepL Voice, salen a la luz aspectos fascinantes sobre lo que diferencia la traducción del idioma hablado de la de texto.
En esta publicación, compartiré algunos de esos aspectos y explicaré cómo los estamos utilizando para transformar la experiencia de las reuniones y conversaciones.
La traducción de voz a voz en tiempo real ya está aquí: descubre cómo DeepL Voice lo hace posible.
La complejidad de traducir voz en tiempo real frente a la traducción de texto
La comunicación oral instantánea es intrínsecamente humana y extremadamente difícil de replicar para la tecnología, aun contando con una tecnología tan avanzada como la IA.
Si deseas crear soluciones para profesionales que ayuden a las personas a seguir y participar en conversaciones en varios idiomas, debes empezar por comprender en profundidad los retos que ello conlleva.
Entre esos retos se encuentra el de replicar la habilidad humana de anticipar lo que las personas van a decir antes de que terminen de decirlo.
Al traducir voz en directo, también es necesario anticipar la mejor manera de expresar el mensaje de alguien en otro idioma. Es crucial hacerlo antes de saber con certeza cómo terminará la frase original para evitar largas demoras.
El problema aquí es que lo que parece ser una traducción precisa de unas pocas palabras puede resultar errónea cuando la persona termina de hablar.
Cuando nos pusimos a desarrollar DeepL Voice, éramos conscientes de que la tecnología por sí sola no bastaría para ofrecer una traducción de voz en tiempo real de alta calidad. Requiere un profundo interés y comprensión de las diferentes formas en que funciona el lenguaje.
Por eso reunimos a expertos en lingüística aplicada a la comunicación oral. También aprovechamos la potente capacidad de DeepL para entender el contexto y el funcionamiento de los distintos idiomas.
Además, colaboramos con empresas para conocer sus prioridades y la experiencia de traducción de voz que les aporta más valor.
Descubre cómo la IA de DeepL está transformando la traducción para impulsar negocios sin fronteras.
El papel crucial de la velocidad en la traducción de voz en tiempo real
Una de las primeras lecciones que aprendimos es que la rapidez lo es todo cuando se trata de la traducción en tiempo real de una reunión o una conversación.
Si consigues una velocidad similar a la del habla —mostrando la traducción de una frase en el momento en que el hablante la ha terminado—, puedes influir enormemente en el grado de inclusión de esas reuniones.
Christine Aubry, coordinadora internacional del fabricante global de pastelería Brioche Pasquier, profundizó más sobre este tema en DeepL Dialogues.
Destacó que una mayor velocidad de traducción permite que los asistentes pasen de un modo pasivo a uno activo. En lugar de esforzarse por seguir el hilo de lo que dicen los demás en otro idioma, se sienten plenamente partícipes. Como si hablaran su propia lengua, tienen la oportunidad de intervenir, influir en la conversación y formar parte activa de ella.
Un segundo marca una gran diferencia.
Por lo tanto, la rapidez es una prioridad fundamental a la hora de traducir la voz en tiempo real. Ahora bien, la velocidad debe equilibrarse con otras prioridades que también determinan en gran medida la experiencia del usuario. Las traducciones tienen que ser lo más precisas posible para evitar malentendidos y confusiones.
Y, siempre que se pueda, deben minimizar el «parpadeo» que se produce al corregir el texto previo porque el significado ha cambiado. Cuanto menor sea la tasa de este parpadeo, más fácil será seguir una conversación de forma natural.
Diferencias entre el lenguaje oral y el escrito: por qué son clave en la traducción
Para traducir con precisión la voz en vivo, es importante comprender las numerosas diferencias entre los patrones del idioma escrito y los ritmos del lenguaje oral.
Por ejemplo, la forma en que hablamos es mucho más personal y menos homogénea que la forma en que escribimos. Usamos expresiones y coloquialismos distintivos que pueden provenir tanto de dialectos regionales como de nuestra personalidad o autoimagen.
Además, construimos y corregimos frases mientras hablamos, lo que da lugar a discrepancias en las que un término gramaticalmente incorrecto es seguido al instante por otro más adecuado. Reproducir esto de forma literal en la traducción no resulta útil para quien intenta comprender el significado.
Durante las conversaciones, también solemos utilizar breves afirmaciones (como «ajá») para asegurarle a quien nos habla de que le estamos entendiendo o estamos de acuerdo con lo que dice. Todo esto ayuda a que la conversación fluya mejor. Sin embargo, entorpece las traducciones para quienes intentan seguir la conversación en otro idioma.
Conviene filtrar estos elementos propios del lenguaje oral en una traducción.
Controla la terminología y los matices con los glosarios de DeepL.
DeepL Voice optimiza la precisión y la velocidad al mismo tiempo
El reto se vuelve aún más interesante si tenemos en cuenta que una plataforma de traducción en tiempo real no traduce frases completas. Tiene que traducir cada frase conforme alguien la va diciendo, aun cuando el significado final todavía no está claro.
Esto nos obliga a optimizar las traducciones de una forma ligeramente distinta. No solo buscamos una traducción más precisa, sino una que sea lo bastante flexible como para ir incorporando nueva información que pueda cambiar el sentido de lo que se está diciendo.
Veamos un ejemplo.
Imaginemos que estamos traduciendo una reunión virtual en la que uno de los participantes habla en inglés y otro sigue lo que dice con subtítulos en alemán.
El hablante de inglés interrumpe la conversación para decir: «I found it». Ahora bien, si asumimos que se trata de una oración completa, la mejor traducción posible al alemán sería: «Ich habe es gefunden».
Sin embargo, como se trata de una intervención en directo, no podemos tener la certeza de si la frase está completa o no.
En este caso, sería preferible utilizar una traducción como «Ich fand es». ¿Por qué? Cuando el hablante de inglés continúa diciendo: «I found it frustrating», la traducción «ich fand es» permite añadir simplemente la palabra «frustrierend».
Si las tres primeras palabras se hubieran traducido como «Ich habe es gefunden», tendríamos que corregir toda la traducción.
Ese es el tipo de «parpadeo» notable que impide seguir una conversación de forma intuitiva. Y ese es precisamente el tipo de problema que DeepL trata de minimizar siempre que sea posible.
La posición de los verbos y su impacto en la traducción en tiempo real
La traducción de voz precisa y en tiempo real implica una serie de decisiones contextuales complejas que se gestionan mejor cuando la tecnología se guía por la experiencia humana. Esa experiencia incluye conocimientos sobre dónde suelen colocarse los verbos que son cruciales para el significado de una frase en los diferentes idiomas.
Si aparecen al principio (como en francés y español), es posible mostrar una traducción más rápidamente que cuando aparecen al final.
Todo esto permite al sistema pausar el tiempo justo para mantener la precisión, pero sin excederse para no retrasar la comprensión innecesariamente.
Lee los casos de éxito de clientes de DeepL: las empresas que ya confían en nuestra IA lingüística.
La experiencia lingüística humana mejora la precisión de DeepL Voice
Esta combinación de experiencia lingüística humana con traducciones de gran precisión ya está permitiendo a DeepL Voice transformar las reuniones y conversaciones de empresas internacionales. Entre ellas se encuentra NEC Corporation, que se convirtió en la primera empresa en implementar completamente DeepL Voice, solo unas semanas después de nuestro lanzamiento oficial.
El entusiasmo que ha despertado DeepL Voice refleja que se trata de un momento revolucionario para la traducción de voz. La capacidad de descodificar y traducir lo que dicen las personas, mientras lo dicen, multiplica el valor que podemos crear para las empresas internacionales. Transforma la forma en que los equipos pueden colaborar, crea relaciones más sólidas y garantiza que siempre se incluyan diferentes ideas y perspectivas.
Los avances que hemos logrado hasta ahora ya están marcando una gran diferencia en la forma en que operan las organizaciones. ¡Hay mucho más por venir!