DeepL AI Labs
Интеграция Mixhalo в платформу DeepL не просто добавила новые возможности для масштабного перевода речи в режиме реального времени. Это кардинально меняет рамки того, что мы можем создать в сфере Voice. Когда у вас появляется возможность контролировать скорость передачи аудиосигнала и устранить её как ограничивающий фактор, то, что раньше казалось невозможным, может быстро стать частью дорожной карты продукта.
Совместными усилиями наши команды создают уровень обработки языка речи, доступный для любого вида взаимодействия и пользовательского опыта. С помощью DeepL Voice API они дают возможность новаторам по всему миру внедрять живой, многоязычный голос в режиме реального времени в любой путь взаимодействия с клиентами и аудиторией.
Сюда входит передача всей эмоциональной насыщенности футбольного комментатора, описывающего гол или тачдаун; мгновенно доступные голосовые интерфейсы, устраняющие чувство изоляции у людей, для которых английский не является родным языком, в медицинских учреждениях; тщательно продуманный дизайн обслуживания клиентов по телефону, позволяющий избавиться от стресса и разочарования; а также многоязычное сопровождение живых мероприятий, обеспечивающее перевод речи гораздо быстрее, чем это могут сделать человеческие переводчики.
Соучредитель Mixhalo Вик Сингх и руководитель голосового направления DeepL Лео Доин подходят к решению задачи сокращения задержки в многоязычном аудио с двух взаимодополняющих направлений. Компания Mixhalo зародилась в музыкальной индустрии, передавая звук удара барабанщика по малым барабанам на стадион, заполненный тысячами фанатов, быстрее, чем звуковые волны могли бы до них долететь. Языковые модели DeepL способны обрабатывать перевод аудио в режиме реального времени от начала до конца без передачи данных между различными API, что позволяет снизить задержку перевода до минимально возможного уровня.
Специально разработанные демоны захвата аудио, настраиваемые сетевые протоколы, обнаружение ошибок в режиме реального времени, аудиодвижки, оптимизированные для скорости воспроизведения: все эти технические инновации создают время и пространство для разработки более оптимизированного опыта живого аудиоперевода. Добавить к этому языковую интеллектуальную систему, и эта оптимизация может происходить мгновенно благодаря моделям, которые знают, когда лучше всего выполнять перевод и как синхронизировать языки с различными грамматическими структурами.
Идеальный опыт перевода в режиме реального времени не означает мгновенное воспроизведение переведённого аудио. Речь идет о разумной настройке воспроизведения с помощью ИИ, глубоко понимающего особенности функционирования каждого языка.
Всё это объединяется в функции устного перевода речи «речь-в-речь» для колл-центров. Это одно из самых мощных применений API DeepL Voice. Вик и команда Mixhalo разрабатывают эту технологию, чтобы клиенты всегда ощущали связь с операторами службы поддержки, а перевод ни в коем случае не умалял их уверенности в том, что их слышат.
Возможно, наибольший эффект от объединения DeepL и Mixhalo проявится именно в ходе живых мероприятий: на конференциях с тысячами участников и сотнями докладчиков, где все смогут обмениваться идеями и следить за сессиями на предпочитаемом языке благодаря аудиопотоку, транслируемому на их устройства по всему помещению.
Именно в таких сценариях ценность многоязычного голосового слоя, работающего в режиме реального времени, становится по-настоящему очевидной. Звук со сверхнизкой задержкой означает, что участники могут слушать выбранного ими докладчика, перемещаясь по помещению. Они могут следить за сессиями, даже находясь за пределами зала. Мгновенный перевод речи в режиме реального времени означает, что каждый участник слышит речь на том языке, который ему наиболее понятен, при этом сохраняются все эмоции и невербальные нюансы. Это также означает, что каждый докладчик может делиться своими идеями на том языке, на котором он их сформулировал
Однако, пожалуй, самым поразительным будет скорость, с которой всё это происходит. Мы разрабатываем инновационные способы, позволяющие моделям ИИ DeepL фиксировать и анализировать контекст выступлений, панельных дискуссий и других сессий с участием докладчиков — практически так же, как это делают устные переводчики при подготовке к реальным мероприятиям. В сочетании с более высокой скоростью обработки данных ИИ это позволяет нам генерировать перевод речи на язык речи в режиме реального времени гораздо гораздо быстрее, чем это под силу человеческим переводчикам. Это кардинально изменит представления о том, каким должен быть опыт взаимодействия с многоязычным контентом. Это будет казаться чем-то футуристическим, даже волшебным. И это начнёт менять представления о том, как устроено устное общение.