Важно ли сейчас качество перевода?

Спросите о качестве любого ИИ-переводчика — вам, скорее всего, дадут оценку в виде числа. Обычно числа по шкале до 100. Часто оно рассчитывается по стандартной формуле оценки качества перевода. Это похоже на простой, объективный и исчерпывающий показатель того, у какого поставщика «лучшие» переводы. И почти наверняка переводы поставщика, с которым вы общаетесь, окажутся на вершине рейтинга. Мы десятилетиями слышим о важности данных и понимаем, что их можно интерпретировать выгодным для рассказчика образом.

Скажу честно. Если вы спросите DeepL о качестве перевода, получите тот же ответ. Мы расскажем об углубленном сравнительном анализе качества, проведенном в марте в рамках 48 000 слепых тестов с участием языковых экспертов. Тогда DeepL занял первое место в 94% тестовых групп среди 16 языковых пар и обошел всех пяти основных конкурентов, включая все самые мощные большие языковые модели. В этом ответе нет ничего плохого.

Однако в сфере ИИ-перевода не любят кое-что признавать. Когда публикуют результаты тестирования, эту неудобную правду стараются скрыть. Мы измеряем пробелы в качестве, которые со временем становятся все меньше. Пробелы настолько малы, что некоторые могут утверждать: они уже не имеют значения.

На данный момент все ИИ-переводы письменного текста в целом хороши. В них мало ошибок, которые неспециалист заметил бы с первого взгляда. Различия малозначительные, тонкие и весьма субъективные. Отчасти именно поэтому существует так много рейтингов, и ведущим моделям легко выбрать тот, который выставит их в лучшем свете.

Так должно ли качество быть ключевым фактором при выборе поставщика ИИ-перевода? Я считаю, что да, однако качество по результатам тестов — не самое важное.

Разница между результатами ИИ-перевода в стандартизированных тестах и на практике — как для вашей организации, так и для вашего контента — становится все более заметной. В тестах пробелы в качестве кажутся незначительными. В реальных условиях пробелы гораздо более значительные и ощутимо влияют на бизнес.

Что измеряют тесты качества ИИ-перевода

Чтобы пояснить, о чем я говорю, давайте рассмотрим, что на самом деле оценивают стандартизированные тесты качества, как они это делают и, что важнее всего, что они не учитывают.

Когда лингвисты оценивают перевод, они обычно используют многомерные метрики качества (MQM), в которые входят восемь критериев. Применяя критерии и выбирая вес для каждого из них, можно создать математическую формулу, которая отображает качество в виде числа.

Критерии MQM включают точность (насколько перевод соответствует содержанию исходного текста), плавность (насколько естественно звучит перевод), отраслевую терминологию (правильно ли использованы термины), степень отражения стиля, соблюдение местных языковых норм и другие аспекты.

Как устроены различные формулы оценки качества перевода

Привлекать опытных лингвистов для оценки переводов сложно и дорого. Во многих рейтингах качества ИИ-перевода вообще не участвуют люди. Вместо этого компании используют одну из автоматизированных систем оценки, перечисленных ниже. С годами эти системы все активнее развиваются.

  • В 2001 году компания IBM представила систему BLEU (Bilingual Evaluation Understudy). Она анализирует, насколько точно машинный перевод соответствует человеческому переводу того же исходного текста. В чем проблема такого подхода? Он исходит из того, что приведенный для сравнения перевод — наилучший из возможных, а любое отклонение от него считается ошибкой.
  • В 2006 году этот подход адаптировали для метрики TER (Translation Edit Rate). Она подсчитывает количество правок, которые пришлось бы внести человеку, чтобы превратить машинный перевод в человеческий. Этот показатель схож с BLEU, однако в системе TER предпочтение отдают низким значениям.
  • В 2020 году компания Unbabel запустила систему COMET (Crosslingual Optimized Metric for Evaluation of Translation). Она использует модель нейронной сети для сравнения машинного перевода с человеческим переводом, а также с исходным текстом. COMET старается выявить смысл исходного текста, чего не делают BLEU и TER.
  • В 2023 году автоматическая оценка вступила в эпоху больших языковых моделей — была запущена система GEMBA (GPT Estimation Metric Based Assessment). Она использует большие языковые модели для оценки перевода по критериям MQM.

Автоматическая оценка переводов заметно развивается и становится все более полезной, однако по-прежнему не может в полной мере сравниться с оценкой экспертов. Когда большие языковые модели берут на себя оценку качества, возникает проблема предвзятости: модели отдают предпочтение собственным переводам, даже если им не хватает точности. Отчасти это обусловлено субъективностью. По сути, модель ИИ проверяет свою же работу по переводу и решает, что ее решение было лучшим.

WMT25, десятая ежегодная конференция по автоматической оценке, пришла к весьма четкому выводу: «Системы, лидирующие по автоматическим метрикам, не всегда побеждали при оценке людьми, что указывает на постоянную предвзятость метрик и подтверждает: при оценке качества перевода последнее слово должно быть за человеком».

Другими словами, если вы действительно хотите узнать о качестве перевода, обратитесь к эксперту-человеку (именно так и поступает DeepL в ходе сравнительных тестов). Различия в качестве ИИ-переводов становятся менее заметными, поэтому мнение человека о балансе критериев оценки приобретает все большую ценность. Пробелы в качестве уже не столь очевидны. По крайней мере, в стандартных тестах качества.

Что упускают тесты качества перевода: контекст, детерминизм и единообразие

Как я уже упоминала, качество перевода в тестах отличается от качества перевода на практике, особенно когда вы управляете переводом и локализацией в рамках сложной организации. На самом деле на бизнес больше всего влияют те критерии качества перевода, которые тесты не измеряют.

Большинство методологий и систем оценки, упомянутых в этом блоге, «аналитические». Они зачастую сравнивают «сегменты» исходного и переведенного текстов — как правило, отдельные предложения. Кроме того, такие системы оценивают перевод каждого предложения в отдельности, как будто оно никак не связано с другими предложениями.

В реальности же мы воспринимаем перевод совершенно иначе. Наш подход «всесторонний». Мы учитываем не только то предложение, которое читаем в конкретный момент, но и весь текст целиком. Мы также учитываем весь остальной контент соответствующей организации. При таком всестороннем подходе качество отдельного предложения не так важно, как единообразие и связность всех переведенных текстов в целом.

У каждой организации своя характерная лексика: термины и фразы для продуктов и функций, сфер деятельности и обслуживания, стратегических концепций и многого другого. Последовательный перевод этих терминов — важная часть качества перевода. Если перевод в Справочном центре не совпадает с терминами в продуктах или кнопками в интерфейсе, качество перевода низкое. Правильность отдельного перевода с технической точки зрения уже не имеет значения.

Платформа для ИИ-перевода гораздо более ценная, если она определяет терминологию, стиль и форму обращения в масштабе (как это делает DeepL с помощью глоссариев, правил стиля и памятей перевода). В то же время большим языковым моделям общего назначения — таким как Claude, Gemini, ChatGPT — из-за вероятностного устройства не хватает детерминизма, соответствия требованиям и единообразия. Такие модели упускают то, что действительно важно для качества перевода на практике.

Что упускают тесты качества перевода: как достигается качество

Стандартные тесты качества перевода также не затрагивают вопрос достижения качества и его масштабируемость.

Слепые тесты DeepL с участием экспертов показали, что новейшие большие языковые модели общего назначения с высоким уровнем рассуждений способны предоставлять конкурентоспособное качество перевода для определенных языковых пар. Однако для этого им требуются более крупные модели, более широкий спектр задач и более широкие контекстные окна. 

Такие модели используют большое количество токенов (с непредсказуемыми затратами) и работают значительно медленнее (как минимум в 4 раза, а то и в 29 раз медленнее), что критично при внедрении ИИ-перевода в продукты через API. Что наиболее важно с точки зрения качества, такие модели менее предсказуемы в выборе перевода. По сути, они заново изобретают велосипед для перевода каждой задачи, поэтому термины и фразы из одного контекста с гораздо меньшей вероятностью повторятся в другом. 

Если вы переводите в масштабах корпорации, именно этому аспекту следует уделять самое пристальное внимание. Результаты тестов качества не содержат об этом практически никакой полезной информации.

Почему мы разрабатываем всесторонний подход к качеству, который передает клиентам контроль

Можно прийти к выводу, что результаты автоматизированных тестов — весьма ограниченный ориентир качества перевода. Однако они все равно чрезвычайно полезны для контроля качества переводов. Нужно просто использовать эти результаты иначе.

Компания DeepL создала новую модель оценки качества перевода (TQE), которая оценивает качество переводов DeepL с помощью специально разработанной модели ИИ. Она не просто выставляет «оценку» переводу и переходит к следующему. Задача нашей модели — выявить потенциальные ошибки и области перевода, которые можно улучшить за счет привлечения экспертов. Она учитывает, что в конечном счете главное — мнение человека.

Когда наша модель TQE анализирует текст, она учитывает все ваши настройки в DeepL. Она не анализирует качество перевода в отрыве от контекста. Модель проверяет, насколько точно соблюдаются терминология, стиль и форма обращения вашей организации. Модель DeepL дает всестороннее представление о качестве на практике.

Если вам важно качество перевода, — а я считаю, что о нем по-прежнему стоит заботиться, — именно такой подход должен быть в приоритете. Смотрите не только на числа в тестах. Постарайтесь найти подходящую именно вам точку зрения на качество перевода, которая будет эффективна для вашего контента в реальных условиях.

Хотите использовать TQE для оценки качества перевода? Узнайте подробности и варианты подключения к тестовой среде TQE в DeepL AI Labs.

Поделиться