Чи варто й надалі приділяти увагу якості перекладу?
Запитайте про якість будь-якого сервісу перекладу на основі ШІ, і вам, імовірно, назвуть ту чи іншу цифру. Зазвичай це число від 1 до 100. Часто його розраховують за однією зі стандартних формул для оцінювання якості перекладу. Здавалося б, це простий, об’єктивний і остаточний показник того, переклади якого постачальника є «найкращими». І майже напевно переклади того постачальника, з яким ви розмовляєте, опиняться на першому місці. Після десятиліть повторення мантри «дані правлять світом» ми тепер знаємо й те, що дані можна інтерпретувати так, як це найбільш вигідно тому, хто розповідає історію.
Скажу чесно. Якщо ви запитаєте DeepL про якість перекладу, то отримаєте таку саму відповідь. Ми поділимося з вами результатами поглибленого порівняльного аналізу якості, який ми провели в березні на основі 48 000 сліпих тестів за участю лінгвістів. Цей аналіз показав, що DeepL виграв у 94 % тестових груп з 16 мовних пар та серед усіх п’яти основних конкурентів, включно з найпотужнішими великими мовними моделями (LLM). І ми цим пишаємось.
Проте є дещо, що не хоче визнавати ніхто у сфері перекладу на основі ШІ. Це незручна правда, яку приховують щоразу, коли оприлюднюють результати тестів. Ми вимірюємо розриви в якості, які постійно зменшуються. Вони настільки малі, що дехто може стверджувати, що вони вже не мають значення.
Наразі всі переклади письмового тексту на основі ШІ загалом є якісними. Помилок, які нефахівець помітив би з першого погляду, майже немає. Відмінності є незначними, ледь помітними та досить суб’єктивними. Саме в цьому полягає одна з причин того, чому існує так багато різних рейтингів і чому провідним моделям легко знайти рейтинг, який виставляє їх у вигідному світлі.
Отже, якщо ви обираєте постачальника послуг перекладу на основі ШІ, чи варто вам і надалі звертати увагу на якість як на вирішальний фактор? Я вважаю, що варто, але якість, виміряна за результатами тестів, — це не те, на чому слід зосереджуватися.
Існує дедалі більша різниця між тим, як переклад на основі ШІ працює в стандартизованих тестах на якість, і тим, як він працює на практиці — саме для вашої організації та вашого контенту. У тестах розбіжності в якості здаються незначними. У реальному світі ці відмінності набагато більші, і вони мають цілком реальні наслідки для бізнесу.
Що вимірюють тести якості перекладу на основі ШІ
Щоб пояснити, що я маю на увазі, розгляньмо детальніше, що насправді вимірюють стандартизовані тести якості, як вони це роблять і, що найважливіше, чого вони не враховують.
Коли лінгвісти-люди оцінюють переклад, вони зазвичай використовують систему MQM (Multidimensional Quality Metrics), яка включає вісім різних вимірів якості перекладу. Прив’язуючи показники до цих різних вимірів та обираючи, як їх зважувати, можна створити формулу, яка математично відображає якість у вигляді єдиного числового балу.
Виміри MQM включають точність (наскільки точно переклад цільовою мовою відповідає контенту тексту вихідною мовою), а також такі елементи, як плавність перекладу (наскільки природно звучить переклад цільовою мовою), галузева термінологія (чи правильно вживаються спеціалізовані терміни), наскільки добре відтворено стиль, чи дотримано місцевих норм тощо.
Що означають різні формули якості перекладу
Залучення досвідчених лінгвістів для оцінювання перекладів — складний і дорогий процес. На практиці багато рейтингів якості перекладу, пов’язаних із постачальниками ШІ, взагалі не включають оцінювання людиною. Натомість вони використовують одну з перелічених нижче автоматизованих систем оцінювання. З роками ці системи стають дедалі досконалішими.
- 2001 року компанія IBM представила систему BLEU (Bilingual Evaluation Understudy). Вона аналізує, наскільки машинний переклад збігається з перекладом того самого вихідного тексту людиною. У чому проблема? Вона припускає, що цей еталонний переклад є найкращим з можливих, а будь-яке відхилення від нього є помилкою.
- 2006 року її було адаптовано для оцінювання за методом Translation Edit Rate (TER), що підраховує кількість правок, які було б необхідно внести перекладачу-людині, щоб перетворити машинний переклад на людський. Ця система схожа на BLEU, але в ній нижчі показники вважаються кращими.
- 2020 року компанія Unbabel запустила COMET (Crosslingual Optimized Metric for Evaluation of Translation) — систему, що використовує модель нейронної мережі для порівняння машинного перекладу як з перекладом, виконаним людиною, так і з вихідним текстом. Вона посилається на оригінальний текст, щоб спробувати з’ясувати значення, чого не роблять системи BLEU та TER.
- Автоматизоване оцінювання ввійшло в епоху LLM 2023 року із запуском системи GEMBA (GPT Estimation Metric Based Assessment), яка дає LLM вказівки застосовувати різні виміри MQM до перекладу та визначати його якість.
Автоматизоване оцінювання перекладів стає дедалі кориснішим, але все ще не може повністю замінити судження експертів-людей. Коли LLM беруть на себе основний тягар оцінювання якості, вони стикаються з проблемою упередженості, послідовно віддаючи перевагу перекладам, створеним їхньою власною моделлю, навіть якщо їм певною мірою бракує точності. Частково це пов’язано із суб’єктивним характером якості перекладу. Фактично модель ШІ оцінює власне завдання з перекладу й вирішує, що її власне рішення було найкращим.
WMT25, десята щорічна конференція з автоматизованого оцінювання, дійшла щодо цього дуже чіткого висновку: «Системи, які посідали перші місця за автоматизованими показниками, не завжди вигравали під час оцінювання людьми. Це свідчить про стійку упередженість показників і підтверджує, що оцінювання людиною має залишатися останньою інстанцією у визначенні якості перекладу».
Іншими словами, якщо ви справді хочете дізнатися про якість перекладу, запитайте експерта-людину (як це робить DeepL у наших порівняльних тестах). У міру того як різниця в якості перекладів на основі ШІ зменшується, людське судження щодо того, як збалансувати різні їх елементи, стає дедалі ціннішим. Різниця в якості вже не є очевидною. Принаймні не в стандартних тестах якості.
Чого не враховують тести якості перекладу: контекст, детермінізм та узгодженість
Проте, як я вже згадувала, якість перекладу, виміряна за допомогою тестів, —це не та сама якість перекладу, яку ви відчуваєте на практиці, особливо коли керуєте перекладом і локалізацією в складній організації. Насправді саме ті аспекти якості перекладу, які тести не вимірюють, мають найбільший вплив на бізнес.
Більшість платформ і систем оцінювання, про які я згадувала в цьому блозі, є «аналітичними». Вони часто працюють шляхом порівняння «сегментів» оригінального та перекладеного тексту, які зазвичай є просто поодинокими реченнями. Вони також оцінюють якість перекладу кожного речення окремо, нібито воно не має нічого спільного з реченнями в інших частинах тексту.
Наш реальний досвід сприйняття перекладеного контенту зовсім не такий. Він є «цілісним». Він охоплює не лише речення, яке ми читаємо в конкретний момент, а й весь текст, частиною якого воно є. Крім того, він включає всю іншу інформацію, яку ми отримуємо від організації. У цій цілісній реальності якість окремого перекладеного речення, ймовірно, має менше значення, ніж узгодженість і логічна послідовність у всьому перекладеному матеріалі в цілому.
Кожна організація має свій власний характерний лексикон: термінологію й фрази щодо продуктів і функцій, сфер бізнесу, аспектів обслуговування, стратегічних концепцій тощо. Узгоджений переклад цих термінів є надзвичайно важливим аспектом якості перекладу. Якщо переклад у центрі допомоги не відповідає термінам, що використовуються в продуктах або на кнопках заклику до дії, то якість перекладу є низькою. Не має значення, чи є технічно правильними окремі переклади.
Коли платформа для перекладу на основі ШІ визначає термінологію, стиль і тон у необхідному масштабі (як це робить DeepL за допомогою глосаріїв, правил стилю та пам’яті перекладів), її цінність значно зростає. Натомість фундаментально ймовірнісний характер великих універсальних LLM (Claude, Gemini, ChatGPT) поступається детермінізмом, відповідністю вимогам та узгодженістю. Вони втрачають те, що насправді має значення, коли йдеться про якість перекладу на практиці.
Що не враховують тести якості перекладу: як досягається якість
Стандартні тести якості перекладу також не враховують, як саме досягається висока якість і наскільки це реально масштабується.
Власні сліпі тести DeepL із залученням експертів-людей показують, що найновіші універсальні LLM при налаштуванні на високий рівень міркування можуть забезпечувати конкурентну якість перекладу для певних мовних пар. Проте вони роблять це за допомогою більших моделей, ширших областей завдань та ширших контекстних вікон.
Це означає, що вони використовують багато токенів (з непередбачуваними витратами) та працюють значно довше (щонайменше в 4 рази, а то й до 29 разів повільніше). Це має великий вплив, якщо ви впроваджуєте переклад на основі ШІ у своїх продуктах через API. Найголовніше з точки зору якості — ці моделі за своєю суттю менш передбачувані у виборі перекладів. По суті, вони «винаходять колесо перекладу» заново для кожного завдання, тому терміни й фрази, які вони використовують в одному контексті, з набагато меншою ймовірністю повторяться в іншому.
Якщо ви керуєте перекладом у масштабах підприємства, саме на цей аспект якості вам слід звернути найбільшу увагу. Результати тестів якості майже нічого корисного про це не говорять.
Чому ми розробляємо цілісний підхід до якості, що надає клієнтам контроль
З цих причин результати автоматизованих тестів є дуже обмеженим показником якості перекладу. Проте це не означає, що вони не є дуже корисним інструментом, коли йдеться про контроль якості ваших перекладів. Вони насправді надзвичайно цінні, якщо визначити їхню роль інакше.
У DeepL ми створили нову модель оцінювання якості перекладу (TQE), яка використовує спеціально розроблену модель ШІ для оцінювання якості перекладів DeepL. Однак найголовніше, що вона не просто присвоює перекладу «оцінку» й на цьому зупиняється. Її роль полягає в тому, щоб виділити потенційні помилки й ті частини перекладу, які можна вдосконалити, залучивши експертів-людей. Вона враховує, що саме людське судження, зрештою, має вирішальне значення.
Коли наша модель TQE аналізує текст, вона робить це з урахуванням усіх налаштувань персоналізації, з якими ви працюєте в DeepL. Вона не аналізує якість перекладу ізольовано. Вона перевіряє, як у контексті застосовуються термінологія, стиль і тон вашої організації. Це дає цілісне уявлення про якість, що справді має значення на практиці.
Якщо вам важлива якість перекладу — а я вважаю, що так і має бути — саме на це слід звертати увагу. Справа не в тестах. Ідеться про те, щоб знайти той підхід до оцінювання якості перекладу, який підходить саме вам і працює для вашого контенту в реальних умовах.
