Como o DeepL Voice enfrenta os desafios únicos da tradução de fala em tempo real

Principais conclusões

  • A tradução de fala em tempo real exige rapidez, precisão e a capacidade de lidar com frases incompletas: desafios que a tradução de textos não enfrenta.
  • O idioma falado inclui hesitações, expressões coloquiais e afirmações curtas que precisam ser filtradas, em vez de traduzidas literalmente.
  • Chegar perto da velocidade da fala transforma os participantes da reunião de ouvintes passivos em colaboradores ativos.
  • O DeepL Voice minimiza o “trepidação” ao gerar traduções flexíveis que conseguem absorver novas informações no meio da frase.
  • A expertise em linguística humana orienta como o DeepL Voice lida com o posicionamento dos verbos, a estrutura das frases e o julgamento contextual entre idiomas.
  • A DeepL fez parcerias com empresas e especialistas em linguística para garantir que o DeepL Voice reflita as prioridades da comunicação no mundo real.
  • A NEC Corporation se tornou a primeira empresa a implementar totalmente o DeepL Voice após seu lançamento.
  • O pacote de IA linguística da DeepL, incluindo Voice, Translator e Write, oferece às empresas internacionais as ferramentas para se comunicarem com clareza.

As pessoas não falam da mesma maneira que escrevem. E elas não vivenciam conversas faladas da mesma forma que vivenciam a leitura de um e-mail ou de um artigo. 

Nossa capacidade de nos entendermos no momento em que falamos — reunindo todos os tipos de comunicação verbal e não verbal para compreender instantaneamente o que alguém quer dizer — é o ato de equilíbrio da expressão humana. 

Quando você dá um passo atrás e pensa no que rola numa conversa, é incrível a quantidade de informação que a gente transmite tão rápido. 

Quando você se propõe a traduzir interações faladas enquanto elas acontecem, como o DeepL fez com a nossa solução DeepL Voice, você descobre todo tipo de insights fascinantes sobre o que torna a tradução da linguagem falada diferente da tradução de textos. 

Nesta postagem, vou compartilhar algumas dessas percepções e explicar como estamos usando-as para transformar a experiência de reuniões e conversas.

A tradução de voz para voz em tempo real já está aqui: saiba como o DeepL Voice torna isso possível.

Por que a tradução de fala em tempo real é mais difícil do que traduzir texto

A comunicação instantânea e coloquial é algo fundamentalmente humano e extremamente difícil de ser reproduzida pela tecnologia — mesmo uma tecnologia tão avançada quanto a IA.

Se você quer criar soluções para empresas que ajudem as pessoas a acompanhar e participar de conversas em vários idiomas, precisa começar com uma compreensão profunda dos desafios envolvidos.

Esses desafios incluem reproduzir a habilidade humana de antecipar o que as pessoas estão dizendo antes mesmo de elas terminarem de falar. 

Quando você está realizando a tradução de fala em situações ao vivo, também precisa antecipar como as palavras de alguém podem ser melhor expressas em outro idioma. Fundamentalmente, você precisa fazer isso antes de saber com certeza como a frase original vai terminar, para evitar longos atrasos. 

O desafio aqui é que o que parece ser uma tradução precisa de algumas palavras pode acabar se revelando uma tradução imprecisa assim que a pessoa terminar a frase. 

Quando começamos a desenvolver o DeepL Voice, sabíamos que não conseguiríamos uma tradução de fala ao vivo de alta qualidade apenas com tecnologia. Isso depende de um profundo interesse e compreensão das diferentes maneiras como o idioma funciona

É por isso que reunimos especialistas em linguística aplicada a conversas faladas. Também aproveitamos a poderosa compreensão contextual do DeepL sobre como diferentes idiomas funcionam

Além disso, fizemos parcerias com empresas para explorar suas prioridades e a experiência de tradução de fala que cria mais valor para elas.

Descubra como a IA do DeepL está transformando a tradução para possibilitar negócios verdadeiramente sem fronteiras.

Por que a velocidade é a principal prioridade na tradução de fala em tempo real

Uma das primeiras lições que aprendemos é que o timing é tudo quando se trata da tradução em tempo real de uma reunião ou conversa.

Se você conseguir se aproximar da velocidade da fala — exibindo a tradução de uma frase assim que o locutor a terminar —, então você pode influenciar significativamente o quanto essas reuniões podem ser inclusivas

Christine Aubry, coordenadora internacional da fabricante de produtos de confeitaria Brioche Pasquier, explicou melhor no DeepL Dialogues

Ela observou que traduções mais rápidas mudam o modo de participação das pessoas de passivo para ativo. Em vez de se esforçarem para acompanhar o que os outros estão dizendo em outro idioma, elas se sentem totalmente a par do que está acontecendo. Como um falante nativo do idioma, elas têm a oportunidade de intervir, moldar a conversa e participar ativamente

Um segundo ou mais faz uma enorme diferença.

Portanto, a velocidade é uma prioridade máxima ao traduzir fala em tempo real. Mas é preciso equilibrar a velocidade com outras prioridades que também têm um grande impacto na experiência das pessoas. As traduções devem ser o mais precisas possível para evitar mal-entendidos e confusão

E, sempre que possível, as traduções devem minimizar o “cintilamento” que ocorre quando você precisa corrigir um texto traduzido anteriormente porque o significado mudou. Quanto menor a taxa de oscilação, mais fácil fica para alguém acompanhar uma conversa de maneira natural.

Como o idioma falado difere do idioma escrito — e por que isso importa para a tradução

Para traduzir a fala ao vivo com precisão, é importante entender as muitas diferenças entre os padrões do idioma escrito e os ritmos da fala.

Por exemplo, a maneira como as pessoas falam é muito mais individual e menos consistente do que a maneira como escrevem. Elas usam expressões distintas e gírias que podem vir tanto de dialetos regionais quanto de sua personalidade ou autoimagem específicas. 

Além disso, as pessoas constroem e corrigem frases enquanto falam, o que leva a falhas de fluência em que um termo gramaticalmente incorreto segue imediatamente outro, mais correto. Reproduzir isso literalmente na tradução não ajuda quem está tentando entender o significado. 

Ao longo das conversas, as pessoas também proferem afirmações curtas (como “uh-huh”) para garantir aos interlocutores que entenderam ou concordam com o que estão dizendo. Isso ajuda no fluxo da conversa em si. No entanto, elas sobrecarregam as traduções para quem está tentando acompanhar em outro idioma. 

É útil filtrar esses elementos do idioma falado da tradução.

Controle a terminologia e as nuances com os Glossários do DeepL.

Como o DeepL Voice otimiza precisão e velocidade ao mesmo tempo

O desafio fica ainda mais interessante quando você pensa que uma plataforma de tradução em tempo real não traduz frases completas. Ela precisa traduzir uma frase enquanto alguém a está falando, quando o significado final dessa frase ainda não está claro. 

Isso exige que otimizemos as traduções de uma maneira um pouco diferente. Não queremos apenas a tradução mais precisa. Queremos uma tradução precisa que seja flexível o suficiente para incorporar novas informações que possam mudar o rumo do que as pessoas estão dizendo.

Aqui vai um exemplo. 

Imagina que estamos traduzindo uma reunião virtual em que um dos participantes está falando em inglês e outro está acompanhando o que ele diz com legendas em alemão. 

Nosso falante de inglês interrompe a conversa para dizer: “I found it.” Agora, se assumirmos que essa é uma frase completa, a melhor tradução possível para o alemão seria: “Ich habe es gefunden.” 

No entanto, como se trata de uma conversa ao vivo, não podemos ter certeza se a frase está completa ou não.

Nesse caso, uma opção melhor seria usar uma tradução como “Ich fand es”. Por quê? Quando o falante de inglês continua dizendo: “I found it frustrating”, a tradução “ich fand es” está perfeitamente posicionada para simplesmente adicionar a palavra “frustrierend”.

Se as três primeiras palavras fossem traduzidas como “Ich habe es gefunden”, precisaríamos revisar toda a tradução. 

Esse é o tipo de “falha” grave que atrapalha o acompanhamento intuitivo de uma conversa. E esse é o tipo de problema que o DeepL busca minimizar sempre que possível.

Como a posição dos verbos nos diferentes idiomas influencia a tradução em tempo real

Tradução de fala precisa e em tempo real envolve uma ampla gama de julgamentos contextuais que são melhor realizados quando a expertise humana orienta a tecnologia. Essa experiência inclui insights sobre onde diferentes idiomas tendem a posicionar os verbos cruciais para o significado de uma frase. 

Se eles vierem no início (como em francês e espanhol), é possível exibir uma tradução mais rapidamente do que quando vêm no final. 

Tudo isso ajuda o sistema a fazer uma pausa apenas o tempo necessário para ser preciso, mas não tanto a ponto de atrasar a compreensão desnecessariamente.

Leia histórias de sucesso de clientes da DeepL: as empresas que confiam na nossa IA linguística.

Por que a expertise em linguística humana torna o DeepL Voice mais preciso

Essa combinação de conhecimento linguístico humano com tradução altamente precisa está permitindo que o DeepL Voice faça uma grande diferença na experiência de reuniões e conversas para empresas internacionais.

Entre essas empresas está a multinacional japonesa de tecnologia da informação e eletrônicos NEC Corporation. Ela se tornou a primeira empresa a implementar totalmente o DeepL Voice apenas algumas semanas após o seu lançamento. 

O entusiasmo em torno do DeepL Voice reflete o fato de que este é um momento revolucionário para a tradução de fala. A capacidade de decodificar e traduzir o que as pessoas estão dizendo enquanto falam multiplica o valor que podemos criar para empresas internacionais

Isso transforma a forma como as equipes podem colaborar, constrói relacionamentos mais fortes e garante que ideias e perspectivas diferentes sejam sempre incluídas. 

Os avanços que fizemos até agora já estão fazendo uma grande diferença na forma como as organizações operam. E tem muito mais por vir!

Descubra por que 96% dos linguistas profissionais escolheram o DeepL Voice como o melhor tradutor de legendas com IA.

Experimente o futuro da comunicação multilíngue com o DeepL

Compartilhar