Как DeepL Voice решает уникальные задачи перевода речи в режиме реального времени

В этой статье
- Основные выводы
- Почему перевод речи в режиме реального времени сложнее, чем перевод текста
- Почему скорость является главным приоритетом в переводе речи в режиме реального времени
- Чем язык устный отличается от языка письменного — и почему это важно для перевода
- Как DeepL Voice одновременно оптимизирует точность и скорость
- Как расположение глаголов в разных языках влияет на перевод в режиме реального времени
- Почему лингвистический опыт специалистов делает DeepL Voice более точным
- Откройте для себя будущее многоязычного общения с DeepL
Основные выводы
- Перевод речи в режиме реального времени требует скорости, точности и умения обрабатывать неполные предложения — задачи, с которыми не сталкивается перевод текста.
- Язык включает в себя заминки, разговорные выражения и краткие утверждения, которые необходимо отфильтровывать, а не переводить буквально.
- Достижение скорости, близкой к скорости речи, превращает участников встречи из пассивных слушателей в активных участников.
- DeepL Voice сводит к минимуму «мерцание» перевода, генерируя гибкие переводы, способные учитывать новую информацию в середине предложения.
- Опыт лингвистов-специалистов предоставляет информацию о том, как DeepL Voice обрабатывает расположение глаголов, структуру предложений и контекстуальную оценку в разных языках.
- DeepL сотрудничает с компаниями и экспертами в области лингвистики, чтобы DeepL Voice отражал приоритеты реальной коммуникации.
- NEC Corporation стала первой компанией, полностью внедрившей DeepL Voice после его запуска.
- Набор языковых ИИ-решений DeepL, включающий Voice, Переводчик и Write, предоставляет глобальным предприятиям инструменты для четкой коммуникации.
Люди говорят не так, как пишут. И они воспринимают устные разговоры не так, как чтение адреса электронной почты или статьи.
Наша способность понимать друг друга в момент разговора — объединение всех видов вербальной и невербальной коммуникации для мгновенного понимания того, что имеет в виду собеседник, — это сложнейший трюк человеческого самовыражения.
Если отступить на шаг назад и подумать о том, что происходит в разговоре, то удивительно, как много информации мы передаем за столь короткое время.
Когда вы ставите перед собой задачу переводить устные взаимодействия в режиме реального времени, как это сделала DeepL с нашим решением DeepL Voice, вы открываете для себя множество увлекательных идей о том, чем перевод устной речи отличается от перевода текста.
В этой статье я поделюсь некоторыми из этих открытий и объясню как мы используем их для преобразования опыта проведения встреч и бесед.
Почему перевод речи в режиме реального времени сложнее, чем перевод текста
Мгновенное общение в форме диалога является сугубо человеческим явлением, и технологиям чрезвычайно сложно его воспроизвести — даже таким передовым технологиям, как ИИ.
Если вы хотите создавать решения для бизнеса, которые помогут людям следить за разговорами на нескольких языках и участвовать в них, вам необходимо сначала глубоко понять связанные с этим проблемы.
К этим задачам относится воспроизведение человеческой способности предвидеть, что скажет собеседник, еще до того, как он закончит свою фразу.
При переводе речи в режиме реального времени вам также необходимо предвидеть, как слова собеседника можно наилучшим образом выразить на другом языке. Важно отметить, что это необходимо сделать до того, как станет точно известно, как закончится исходное предложение, чтобы избежать длительных задержек.
Сложность здесь заключается в том, что то, что кажется точным переводом нескольких слов, может оказаться неточным переводом, как только человек закончит свое предложение.
Когда мы приступили к разработке DeepL Voice, мы понимали, что не сможем добиться высокого качества перевода речи в реальном времени, опираясь исключительно на технологии. Это зависит от глубокого интереса к различным механизмам функционирования языка и их понимания.
Именно поэтому мы привлекли экспертов в области лингвистики, специализирующихся на устной речи. Мы также использовали мощные возможности DeepL по контекстуальному пониманию того, как функционируют различные языки.
Кроме того, мы наладили сотрудничество с различными компаниями, чтобы изучить их приоритеты и понять, какой опыт перевода речи приносит им наибольшую пользу.
Узнайте, как ИИ DeepL преобразует перевод, открывая путь к бизнесу без границ.
Почему скорость является главным приоритетом в переводе речи в режиме реального времени
Одно из первых открытий, которое мы сделали, заключается в том, что время решает всё когда речь идёт о переводе в режиме реального времени во время встречи или разговора.
Если удастся приблизиться к скорости речи — отображая перевод предложения к моменту, когда говорящий его закончил, — то это может существенно повлиять на степень инклюзивности таких встреч.
Кристин Обри, международный координатор глобального производителя кондитерских изделий Brioche Pasquier, подробнее объяснила это на DeepL Dialogues.
Она отметила, что более быстрый перевод переключает людей из режима пассивного участия в режим активного участия. Вместо того чтобы с трудом следить за тем, что говорят другие на другом языке, они чувствуют себя в курсе событий. Как и носители языка, они имеют возможность вставлять свои реплики, формировать ход беседы и активно участвовать.
Всего одна секунда имеет огромное значение.
Поэтому скорость является главным приоритетом при переводе речи в режиме реального времени. Однако необходимо найти баланс между скоростью и другими приоритетами, которые также оказывают большое влияние на впечатления людей. Переводы должны быть максимально точными, чтобы избежать недоразумений и путаницы.
Кроме того, по возможности переводы должны сводить к минимуму «мерцание», возникающее, когда приходится исправлять ранее переведенный текст из-за изменения смысла. Чем ниже частота мерцания, тем легче человеку следить за разговором естественным образом.
Чем язык устный отличается от языка письменного — и почему это важно для перевода
Чтобы точно переводить устную речь, важно понимать многочисленные различия между структурой письменного языка и ритмикой речи.
Например, манера речи людей гораздо более индивидуальна и менее последовательна, чем их письменная речь. Они используют характерные обороты речи и разговорные выражения, которые могут быть обусловлены как региональными диалектами, так и их индивидуальностью или самооценкой.
Кроме того, люди строят и исправляют предложения по ходу речи, что приводит к неплавности речи, когда один грамматически неверный термин мгновенно следует за другим, более правильным. Буквальное воспроизведение таких моментов в переводе не помогает тому, кто пытается понять смысл.
В ходе разговоров люди также произносят короткие подтверждающие звуки (такие как «ага»), чтобы заверить собеседника в том, что они понимают или согласны с тем, что он говорит. Это способствует плавности самого разговора. Однако они загромождают перевод для тех, кто пытается следить за разговором на другом языке.
Полезно отфильтровать эти элементы языка разговора из перевода.
Контролируйте терминологию и нюансы с помощью глоссариев DeepL.
Как DeepL Voice одновременно оптимизирует точность и скорость
Задача становится еще более интересной, если учесть, что платформа перевода в реальном времени не переводит полные предложения. Ей необходимо переводить предложение в тот момент, когда кто-то его произносит, когда окончательный смысл этого предложения еще не ясен.
Это требует от нас оптимизации переводов несколько иным образом. Нам нужен не просто самый точный перевод. Нам нужен точный перевод, который будет достаточно гибким, чтобы учитывать новую информацию, способную изменить смысл того, что говорят люди.
Вот пример.
Представьте, что мы переводим виртуальную встречу, на которой один из участников говорит по-английски, а другой следит за его речью с помощью субтитров на немецком языке.
Наш участник, говорящий на английском, прерывает разговор, чтобы сказать: «Я нашел это». Теперь, если мы предположим, что это полное предложение, лучшим возможным переводом на немецкий язык будет: «Ich habe es gefunden».
Однако, поскольку речь идет о живом высказывании, мы не можем быть уверены, является ли это предложение полным или нет.
В данном случае лучшим вариантом может быть использование перевода «Ich fand es». Почему? Когда говорящий по-английски продолжает: «Мне это показалось разочаровывающим», перевод «ich fand es» идеально подходит для того, чтобы просто добавить слово «frustrierend».
Если бы первые три слова были переведены как «Ich habe es gefunden», то нам пришлось бы переделывать весь перевод.
Именно такого рода серьезные «сбои» мешают интуитивно следить за ходом разговора. И именно такого рода проблемы DeepL стремится минимизировать везде, где это возможно.
Как расположение глаголов в разных языках влияет на перевод в режиме реального времени
Точный перевод речи в режиме реального времени предполагает широкий спектр подобных контекстуальных решений, которые лучше всего принимать, когда технологии руководствуются человеческим опытом. Эти знания включают понимание того, где в разных языках обычно располагаются глаголы, имеющие решающее значение для смысла предложения.
Если они стоят в начале (как в французском и испанском языках), перевод можно отобразить быстрее, чем в том случае, когда они стоят в конце.
Все это помогает системе делать паузу ровно настолько, чтобы обеспечить точность, но не настолько долго, чтобы неоправданно задерживать понимание.
Ознакомьтесь с историями успеха клиентов DeepL: компаний, доверяющих нашему языковому ИИ.
Почему лингвистический опыт специалистов делает DeepL Voice более точным
Благодаря сочетанию лингвистического опыта людей и высокоточного перевода DeepL Voice позволяет значительно улучшить качество совещаний и бесед для международных компаний.
К таким компаниям относится японская транснациональная корпорация в сфере информационных технологий и электроники NEC Corporation. Оно стало первой компанией, полностью внедрившей DeepL Voice всего через несколько недель после его запуска.
Энтузиазм вокруг DeepL Voice отражает тот факт, что это является прорывным моментом в области голосового перевода речи. Способность расшифровывать и переводить то, что люди говорят, в момент произнесения, многократно увеличивает ценность, которую мы можем создать для международных компаний.
Это преобразует способы сотрудничества команд, укрепляет отношения и гарантирует, что различные идеи и точки зрения всегда будут учтены.
Достигнутые нами на данный момент успехи уже существенно меняют подход к работе организаций. И это еще не все!
Откройте для себя будущее многоязычного общения с DeepL
DeepL Voice обеспечивает перевод субтитров в режиме реального времени во время встреч и разговоров, благодаря чему каждый участник слышен и понятен в режиме реального времени.
Переводчик и Write распространяют эту точность на все рабочие процессы, предоставляя международным командам инструменты для четкого и точного общения. API и Интеграции позволяют использовать эти возможности в ваших повседневных инструментах, платформах и рабочих процессах.
Связаться с отделом продаж, чтобы узнать, как набор решений DeepL на базе языкового ИИ может усилить глобальную коммуникацию в вашей компании.