DeepL AI Labs

A tradução de voz em tempo real não é apenas tradução com uma nova forma de entrada ou saída. Trata-se de um desafio fundamentalmente novo, diferente e estimulante para a investigação em IA. Tem como objetivo proporcionar uma forma muito diferente de experiência do utilizador que altera as prioridades da tradução, introduz novas restrições e exige novas formas de avaliação e tomada de decisões por parte de um modelo de IA. 

É esse o desafio que o Gestor de Investigação Sascha Brinker e a Investigadora Científica Kristina Geißler estão a enfrentar como parte da nossa equipa de investigação de voz. Fazem parte do grupo que está a desenvolver o modelo de IA de qualidade superior da DeepL para a tradução de texto, com o objetivo de definir um novo padrão na tradução de voz em tempo real. Estão agora a dar continuidade a esse sucesso inicial com novos modelos e técnicas de treino que abrem possibilidades totalmente novas para a voz multilingue em tempo real.

A partir de modelos de tradução de texto de alta qualidade

Partimos de uma boa base: a qualidade e a compreensão contextual do modelo de tradução de texto existente da DeepL. A equipa de DeepL Voice conseguiu obter importantes resultados iniciais ao implementar este modelo e ao ajustar a estratégia de inferência para aumentar a velocidade da tradução. Em seguida, desenvolveram modelos personalizados para voz, capazes de identificar o momento ideal para apresentar as traduções, tirando partido da compreensão da DeepL sobre as relações entre idiomas e aplicando novas camadas de treino. 

O objetivo aqui é encontrar o equilíbrio certo entre a latência e a velocidade das traduções (crucial para a capacidade dos utilizadores de acompanharem e interagirem com uma conversa à medida que esta decorre), por um lado, e a precisão e a estabilidade, por outro. Dominar este equilíbrio significa que a DeepL não tem de esperar pelo fim de uma frase antes de a traduzir. Ao mesmo tempo, minimiza o «cintilar» que ocorre quando os modelos são obrigados a corrigir legendas traduzidas. Estes aspetos fazem uma enorme diferença na experiência do utilizador.

Eliminar a fase de transcrição

A adaptação e a evolução do nosso modelo de tradução de texto levaram-nos muito longe. Tanto é assim que a Slator classifica atualmente o DeepL como o líder indiscutível tanto em termos de qualidade como de estabilidade nas traduções de voz em tempo real. No entanto, eliminar a necessidade de transcrever o texto antes de o traduzir pode levar-nos ainda mais longe, mais rapidamente. A equipa está atualmente a desenvolver modelos capazes de gerar uma saída de voz traduzida diretamente a partir da entrada de áudio, sem passar por uma etapa intermédia de texto.

Podemos obter ganhos adicionais ao fornecer ao nosso modelo mais contexto sobre as conversas que traduz: o que está a ser discutido, quem está a discutir o assunto e as frases e terminologia específicas que é provável que utilizem. Isto reproduz grande parte do trabalho intensivo de treinamento que os intérpretes humanos de alto nível realizam antes de grandes eventos ou reuniões. Tal como eles, permite que os nossos modelos traduzam o que alguém está prestes a dizer, desde o momento em que começa a formar uma palavra.

Abrindo novas fronteiras para a tradução de voz

Estes novos modelos diretos de «discurso para discurso» eliminam algumas das restrições mais importantes com que a tradução de voz se depara atualmente. Ao fazê-lo, abrem novas possibilidades muito empolgantes.

Sem a necessidade de traduzir para texto e de volta, podemos ganhar segundos inteiros no tempo necessário para fornecer uma tradução oral. No contexto do acompanhamento da voz em tempo real, trata-se de uma aceleração muito significativa que terá um grande impacto na experiência do utilizador e do público.

E há mais. Trabalhar diretamente com a entrada de áudio significa que podemos treinar modelos para detetar sotaques, dialetos e nuances incorporadas na forma como as pessoas falam. Mais tempo de inferência e entradas de áudio mais ricas significam que podemos criar saídas faladas que captam a emoção e o significado mais profundo do que as pessoas dizem.

O futuro da tradução de voz em tempo real através da IA não é apenas mais rápido. É também mais profundamente humano: capta melhor os vários níveis em que as pessoas comunicam quando falam. Está a transformar a DeepL de um motor de tradução numa camada de voz em tempo real, capaz de possibilitar a forma mais natural de comunicação humana, de uma forma que faz com que o idioma desapareça como fonte de atrito. 

É isso que torna esta uma das áreas mais empolgantes da investigação em IA na DeepL. 

Partilhar

Acompanhe todos os desenvolvimentos

Descubra em primeira mão o futuro da IA.