DeepL AI Labs

Trazer o Mixhalo para a plataforma DeepL não foi só adicionar novos recursos em torno da tradução de fala em tempo real em grande escala. Está transformando o escopo do que podemos criar na área de voz. Quando você consegue controlar a velocidade da transmissão de áudio e eliminar isso como uma limitação, o que antes era impossível pode rapidamente se tornar um plano de desenvolvimento de produto.

Juntas, nossas equipes estão criando uma camada de idioma falado disponível para todo tipo de experiência e interação. Por meio da API de DeepL Voice, elas estão capacitando inovadores em todo o mundo a incorporar voz ao vivo, em tempo real e multilíngue em todo tipo de jornada do cliente e do público.

Isso inclui capturar toda a emoção de um comentarista de futebol ao descrever um gol ou um touchdown, experiências de voz instantaneamente acessíveis que eliminam a sensação de isolamento para falantes não nativos em ambientes de saúde, um design cuidadoso das experiências de atendimento ao cliente por telefone para eliminar o estresse e a frustração, e uma experiência multilíngue em eventos ao vivo que oferece tradução de fala muito mais rápido do que intérpretes humanos conseguiriam.

Os fundamentos essenciais para o áudio multilíngue em tempo real

O cofundador da Mixhalo, Vik Singh, e o chefe de voz da DeepL, Leo Doin, têm abordado o desafio de reduzir a latência do áudio multilíngue a partir de duas perspectivas complementares. A Mixhalo surgiu na indústria musical, transmitindo o som de um baterista tocando uma caixa para um estádio cheio de milhares de fãs, mais rápido do que as próprias ondas sonoras levariam para chegar até eles. Os modelos de idioma da DeepL são capazes de lidar com a tradução de áudio em tempo real, de ponta a ponta, sem precisar passar por diferentes APIs, reduzindo a latência da tradução ao nível mais baixo possível.

Criando experiências de áudio traduzidas que funcionam no nível emocional

Daemons de captura de áudio personalizados, protocolos de rede personalizados, detecção de erros em tempo real, motores de áudio otimizados para velocidade na reprodução: todas essas inovações técnicas criam tempo e espaço para criar uma experiência mais otimizada de tradução de áudio ao vivo. Adicione a isso a inteligência linguística, e essa otimização pode acontecer instantaneamente, por meio de modelos que sabem o melhor momento para traduzir e como sincronizar idiomas com diferentes estruturas gramaticais.

A experiência ideal de tradução ao vivo não significa reproduzir o áudio traduzido instantaneamente. Trata-se de ajustar a reprodução de forma inteligente, por meio de IA que entende profundamente como cada idioma funciona.

Tudo isso se une na tradução de fala para fala ao vivo para centrais de atendimento. É uma das aplicações mais poderosas da API DeepL Voice. O Vik e a equipe da Mixhalo estão desenvolvendo isso pra garantir que os clientes sempre sintam uma conexão com os atendentes e que a tradução nunca comprometa a sensação de que estão sendo ouvidos.

Eventos ao vivo, traduzidos a velocidades que nenhum ser humano consegue acompanhar

Talvez o maior impacto da união entre a DeepL e a Mixhalo seja sentido em eventos ao vivo: conferências com milhares de participantes e centenas de palestrantes, todos podendo compartilhar ideias e acompanhar as sessões no idioma de sua preferência, por meio de áudio transmitido para seus dispositivos, em todo o local do evento.

É em cenários como esse que o valor de uma camada de voz multilíngue em tempo real fica realmente evidente. Áudio com latência ultrabaixa significa que os participantes podem ouvir o palestrante que quiserem enquanto se movimentam pelo local. Eles podem acompanhar as sessões mesmo quando não estão na sala. A tradução de fala ao vivo e instantânea faz com que cada participante ouça o idioma que melhor entende, com toda a emoção e expressão implícita preservadas. Isso também significa que cada palestrante pode compartilhar suas ideias no idioma em que as formulou

Talvez o mais impressionante, porém, seja a velocidade com que tudo isso acontece. Estamos desenvolvendo novas formas inovadoras para que os modelos de IA do DeepL capturem e assimilem o contexto em torno de palestras, painéis de discussão e outras sessões com palestrantes, da mesma forma que os intérpretes de eventos ao vivo se preparam com antecedência. Quando isso é combinado com a maior velocidade de processamento da IA, conseguimos gerar traduções ao vivo, de fala para fala, muito mais rápido do que tradutores humanos são capazes. Isso vai redefinir as expectativas sobre como deve ser a experiência com conteúdo multilíngue. Vai parecer futurista, até mágico. E vai começar a transformar as expectativas sobre como funciona a comunicação falada.

Descubra mais sobre os planos da Mixhalo e da DeepL neste blog.

Compartilhar

Fique por dentro

Confira prévias das nossas inovações em IA mais recentes.