DeepL AI Labs
Переклад мовлення в режимі реального часу — це не просто переклад із новою формою введення або виведення. Це принципово новий, інший і захоплюючий виклик для досліджень у галузі ШІ. Його мета — забезпечити зовсім інший користувацький досвід, який змінює пріоритети перекладу, вводить нові обмеження та вимагає від ШІ нових форм оцінки та прийняття рішень.
Саме цей виклик приймають менеджер з досліджень Саша Брінкер та науковий співробітник Крістіна Гайслер у складі нашої команди з досліджень у сфері Voice. Вони входять до групи, яка вдосконалює високоякісну модель ШІ DeepL для перекладу тексту, щоб встановити новий стандарт у перекладі мовлення в режимі реального часу. Зараз вони розвивають цей ранній успіх за допомогою нових моделей та методів навчання, які відкривають абсолютно нові можливості для багатомовного перекладу мовлення в режимі реального часу.
Ми почали з гарної основи: якості та контекстуального розуміння існуючої моделі перекладу тексту DeepL. Команда Voice змогла досягти важливих перших успіхів, застосувавши цю модель та скоригувавши стратегію інференції для підвищення швидкості перекладу. Потім вони розробили спеціальні моделі для голосового перекладу, які можуть визначати найкращий момент для виведення перекладу, використовуючи розуміння DeepL взаємозв’язків між мовними парами та застосовуючи нові рівні навчання.
Мета полягає в тому, щоб знайти правильний баланс між затримкою та швидкістю перекладу (що має вирішальне значення для можливості користувачів стежити за розмовою та брати в ній участь у міру її розвитку), з одного боку, та точністю й стабільністю — з іншого. Опанування цього балансу означає, що DeepL не мусить чекати на кінець речення, перш ніж його перекласти. Водночас це мінімізує «мерехтіння», яке виникає, коли моделі змушені виправляти перекладені субтитри. Ці фактори мають величезне значення для користувацького досвіду.
Адаптація та вдосконалення нашої моделі перекладу тексту дозволили нам досягти значних успіхів. Настільки, що Slator наразі визнає DeepL беззаперечним лідером як за якістю, так і за стабільністю голосового перекладу в режимі реального часу. Однак усунення необхідності транскрибувати текст перед перекладом може допомогти нам просунутися ще далі й швидше. Наразі команда розробляє моделі, здатні генерувати перекладене мовлення безпосередньо з аудіоданих, оминаючи проміжний етап перетворення на текст.
Ми можемо досягти ще більших успіхів, надавши нашій моделі більше контексту щодо розмов, які вона перекладає: про що йдеться, хто про це говорить, а також конкретні фрази та термінологію, яку вони, ймовірно, використовуватимуть. Це відтворює значну частину процесу навчання, який проходять перекладачі найвищого рівня перед важливими подіями чи зустрічами. Так само, як і у їхньому випадку, це дає змогу нашим моделям перекладати те, що хтось збирається сказати, з того моменту, як людина починає формувати слово.
Ці нові моделі прямого перекладу мовлення усувають деякі з найважливіших обмежень, з якими зараз стикається голосовий переклад. Таким чином, вони відкривають нові, надзвичайно цікаві можливості.
Оскільки більше не потрібно перекладати мову в текст і назад, ми можемо заощадити цілі секунди на час, необхідний для надання усного перекладу. У контексті відстеження мовлення в реальному часі це дуже значне прискорення, яке матиме великий вплив на користувацький досвід та досвід аудиторії.
І це ще не все. Робота безпосередньо з аудіоданими означає, що ми можемо навчити модель розпізнавати акценти, діалекти та нюанси, притаманні манері мовлення людей. Додатковий час на обробку та багатші аудіодані дозволяють нам створювати голосові результати, що передають емоції та глибший зміст того, що люди говорять.
Майбутнє голосового перекладу в режимі реального часу за допомогою ШІ — це не лише більша швидкість. Воно також є більш глибоко людським: воно охоплює більше рівнів, на яких люди спілкуються під час розмови. Це перетворює DeepL із перекладацького двигуна на голосовий шар у режимі реального часу, здатний забезпечити найприроднішу форму людського спілкування таким чином, що мова перестає бути джерелом тертя.
Саме це робить цю сферу однією з найцікавіших у дослідженні ШІ в DeepL.