DeepL AI Labs

Інтеграція Mixhalo в платформу DeepL не просто додала нові можливості для масштабного перекладу мовлення «з мови на мову» у реальному часі. Це змінює межі того, що ми можемо створити у сфері голосових технологій. Коли ви можете контролювати швидкість передачі аудіо та усунути її як обмеження, те, що раніше було неможливим, швидко стає частиною дорожньої карти продукту.

Разом наші команди створюють шар усного мовлення, доступний для будь-якого типу досвіду та взаємодії. Завдяки DeepL Voice API вони надають інноваторам у всьому світі можливість інтегрувати живий, багатомовний голос у реальному часі в будь-який досвід клієнтів та аудиторії.

Це включає передачу всіх емоцій футбольного коментатора, який описує гол чи тачдаун; миттєво доступні голосові інтерфейси, що усувають відчуття ізольованості для тих, хто не є носіями мови, у медичних закладах; ретельне проектування дзвінків до служби підтримки клієнтів для усунення стресу та розчарування; а також багатомовний досвід перегляду подій у прямому ефірі, що забезпечує переклад мовлення набагато швидше, ніж це можуть зробити перекладачі-люди.

Основні засади багатомовного аудіо в режимі реального часу

Співзасновник Mixhalo Вік Сінг та керівник Voice-напрямку DeepL Лео Дойн підходять до вирішення завдання зменшення затримки багатомовного аудіо з двох взаємодоповнюючих напрямків. Компанія Mixhalo зародилася в музичній індустрії, транслюючи звук ударів барабанщика по малій барабані на стадіон, заповнений тисячами вболівальників, швидше, ніж звукові хвилі могли до них дістатися. Мовні моделі DeepL здатні обробляти переклад аудіо в реальному часі на всьому ланцюжку, без передачі даних між різними API, що дозволяє звести затримку перекладу до мінімуму.

Створення перекладених аудіодосвідів, що діють на емоційному рівні

Спеціально розроблені демони запису аудіо, власні мережеві протоколи, виявлення помилок у реальному часі, аудіодвигуни, оптимізовані для швидкості відтворення: усі ці технічні інновації створюють час і простір для розробки більш оптимізованого досвіду перекладу аудіо в прямому ефірі. Додати до цього мовну інтелігенцію, і ця оптимізація може відбуватися миттєво завдяки моделям, які знають найкращий час для перекладу та вміють синхронізувати мови з різними граматичними структурами.

Ідеальний досвід перекладу в прямому ефірі не означає миттєве відтворення перекладеного аудіо. Йдеться про інтелектуальне регулювання відтворення за допомогою ШІ, який глибоко розуміє, як працює кожна мова.

Усе це поєднується в перекладі мовлення «з мови на мову» в режимі реального часу для кол-центрів. Це одне з найпотужніших застосувань DeepL Voice API. Вік та команда Mixhalo розробляють цю технологію, щоб клієнти завжди відчували зв’язок із операторами, які підтримують їх, а переклад ніколи не заважав їм відчувати, що їх чують.

Прямі трансляції, що перекладаються зі швидкістю, на яку не здатна жодна людина

Мабуть, найбільший вплив об’єднання DeepL та Mixhalo буде відчутний під час прямих трансляцій: конференцій із тисячами учасників та сотнями доповідачів, які зможуть обмінюватися думками та стежити за сесіями своєю рідною мовою завдяки аудіо, що транслюється на їхні пристрої по всьому майданчику.

Саме в таких сценаріях цінність багатомовного голосового шару в режимі реального часу стає справді очевидною. Аудіо з наднизькою затримкою означає, що учасники можуть слухати обраного ними доповідача, пересуваючись по приміщенню. Вони можуть стежити за сесіями, навіть перебуваючи поза залом. Миттєвий переклад мовлення в прямому ефірі означає, що кожен учасник чує мову, яку розуміє найкраще, з усіма емоціями та невербальними виразами. Це також означає, що кожен доповідач може ділитися своїми ідеями тією мовою, якою їх сформулював

Однак, мабуть, найвражаючою буде швидкість, з якою все це відбуватиметься. Ми розробляємо інноваційні способи, завдяки яким моделі ШІ DeepL зможуть фіксувати та аналізувати контекст виступів, панельних дискусій та інших сесій, подібно до того, як це роблять перекладачі на живих заходах, готуючись заздалегідь. У поєднанні з більшою швидкістю обробки даних ШІ це дозволяє нам генерувати переклади мовлення «з мови на мову» в режимі реального часу набагато швидше, ніж це під силу людським перекладачам. Це змінить уявлення про те, яким має бути досвід сприйняття багатомовного контенту. Це здаватиметься футуристичним, навіть магічним. І це почне змінювати уявлення про те, як працює усне спілкування.

Дізнайтеся більше про Mixhalo та плани DeepL у цьому блозі.

Поширити

Залишайтеся на зв’язку

Отримайте попередній перегляд наших останніх інновацій у галузі ШІ.