DeepL AI Labs
A integração do Mixhalo na plataforma DeepL não se limitou a adicionar novas capacidades em torno da tradução de voz para voz em tempo real e em grande escala. Está a transformar o âmbito do que podemos desenvolver na área da voz. Quando se consegue controlar a velocidade de transmissão do áudio e eliminar essa limitação, o que antes era impossível pode rapidamente tornar-se parte do plano de desenvolvimento do produto.
Em conjunto, as nossas equipas estão a construir uma camada de idioma falado que está disponível para todos os tipos de experiências e interações. Através da API DeepL Voice, estão a capacitar inovadores em todo o mundo para integrarem voz multilingue, ao vivo e em tempo real, em todo o tipo de percurso do cliente e do público.
Isso inclui captar toda a emoção de um comentador de futebol a descrever um golo ou um touchdown, experiências de voz instantaneamente acessíveis que eliminam a sensação de isolamento para falantes não nativos em contextos de cuidados de saúde, a conceção cuidadosa de experiências de atendimento ao cliente por telefone para eliminar o stress e a frustração, e uma experiência multilingue de eventos ao vivo que proporciona tradução de voz muito mais rapidamente do que os intérpretes humanos conseguem.
O cofundador da Mixhalo, Vik Singh, e o diretor de DeepL Voice, Leo Doin, têm abordado o desafio de reduzir a latência do áudio multilingue a partir de duas perspetivas complementares. A Mixhalo surgiu na indústria musical, transmitindo o som de um baterista a tocar na caixa para um estádio repleto de milhares de fãs, mais rapidamente do que as próprias ondas sonoras conseguiam chegar até eles. Os modelos linguísticos da DeepL são capazes de gerir a tradução de áudio em tempo real, de ponta a ponta, sem transferências para diferentes APIs, reduzindo a latência da tradução ao nível mais baixo possível.
Daemons de captura de áudio personalizados, protocolos de rede personalizados, deteção de erros em tempo real, motores de áudio otimizados para a velocidade de reprodução: todas estas inovações técnicas criam tempo e espaço para conceber uma experiência mais otimizada de tradução de áudio ao vivo. Adicionar a inteligência do idioma e essa otimização pode ocorrer instantaneamente, através de modelos que sabem qual o melhor momento para traduzir e como sincronizar idiomas com diferentes estruturas gramaticais.
A experiência ideal de tradução em direto não significa reproduzir o áudio traduzido instantaneamente. Trata-se de ajustar a reprodução de forma inteligente, através de IA que compreende profundamente como cada idioma funciona.
Tudo isto se concretiza na tradução de voz para voz em tempo real para centros de atendimento. É uma das aplicações mais poderosas da API DeepL Voice. O Vik e a equipa da Mixhalo estão a desenvolvê-la para garantir que os clientes sintam sempre uma ligação com os agentes de apoio e que a tradução nunca comprometa a sensação de que estão a ser ouvidos.
Talvez o maior impacto da união entre a DeepL e a Mixhalo se faça sentir nos eventos ao vivo: conferências com milhares de participantes e centenas de oradores, todos capazes de partilhar ideias e acompanhar as sessões no seu idioma preferido, através de áudio transmitido para os seus dispositivos, em todo o recinto.
É em cenários como este que o valor de uma camada de voz multilingue em tempo real se torna verdadeiramente evidente. O áudio com latência ultrabaixa significa que os participantes podem ouvir o orador da sua escolha enquanto se deslocam. Podem acompanhar as sessões mesmo quando não se encontram na sala. A tradução de voz ao vivo e instantânea significa que cada participante ouve o idioma que melhor compreende, com toda a emoção e expressão implícita captadas. Significa também que cada orador pode partilhar as suas ideias no idioma em que as concebeu
Talvez o mais impressionante, porém, seja a rapidez com que tudo isto acontece. Estamos a desenvolver novas formas inovadoras para que os modelos de IA da DeepL capturem e assimilem o contexto em torno de palestras, painéis de discussão e outras sessões de oradores, de forma muito semelhante à forma como os intérpretes de eventos ao vivo se preparam antecipadamente. Quando isto é combinado com a maior velocidade de processamento da IA, conseguimos gerar traduções em tempo real, de voz para voz, muito mais rapidamente do que os tradutores humanos são capazes. Isto irá redefinir as expectativas sobre o que deve ser a experiência de conteúdo multilingue. Vai parecer futurista, até mesmo mágico. E começará a transformar as expectativas sobre o funcionamento da comunicação oral.