Jak DeepL Voice radzi sobie z wyjątkowymi wyzwaniami związanymi z tłumaczeniem mowy na żywo

Najważniejsze wnioski

  • Tłumaczenie mowy w czasie rzeczywistym wymaga szybkości, dokładności i umiejętności radzenia sobie z niekompletnymi zdaniami – to wyzwania, z którymi tłumaczenie tekstu się nie spotyka.
  • Język mówiony zawiera potknięcia językowe, kolokwializmy i krótkie potwierdzenia, które trzeba odfiltrować, a nie tłumaczyć dosłownie.
  • Dopasowanie się do tempa mowy sprawia, że uczestnicy spotkania przestają być biernymi słuchaczami, a stają się aktywnymi uczestnikami.
  • DeepL Voice minimalizuje „migotanie” poprzez generowanie elastycznych tłumaczeń, które potrafią uwzględniać nowe informacje w trakcie zdania.
  • Informacja z zakresu lingwistyki pomaga DeepL Voice w odpowiednim rozmieszczeniu czasowników, budowaniu struktur zdań i ocenie kontekstu w różnych językach.
  • DeepL nawiązało współpracę z firmami i ekspertami lingwistycznymi, aby zapewnić, że DeepL Voice odzwierciedla rzeczywiste priorytety komunikacyjne.
  • NEC Corporation stała się pierwszą firmą, która w pełni wdrożyła DeepL Voice po jego premierze.
  • Pakiet technologii językowej AI DeepL, obejmujący DeepL Voice, Tłumacza DeepL i DeepL Write, zapewnia globalnym przedsiębiorstwom narzędzia do jasnej komunikacji.

Ludzie nie mówią tak samo, jak piszą. Nie odbierają też rozmów w taki sam sposób, jak czytanie e-maila czy artykułu. 

Nasza zdolność do wzajemnego zrozumienia w momencie rozmowy – łączenie wszelkiego rodzaju komunikacji werbalnej i niewerbalnej, aby natychmiast uchwycić, co ktoś ma na myśli – to prawdziwy balans na linie w ludzkiej ekspresji. 

Kiedy cofniesz się o krok i zastanowisz się, co dzieje się podczas rozmowy, to niesamowite, jak wiele informacji przekazujemy w tak krótkim czasie. 

Kiedy stawiasz sobie za zadanie tłumaczenie interakcji ustnych w czasie rzeczywistym, tak jak zrobił to DeepL w naszym rozwiązaniu DeepL Voice, odkrywasz mnóstwo fascynujących spostrzeżeń na temat tego, co odróżnia tłumaczenie języka mówionego od tłumaczenia tekstu. 

W tym poście podzielę się niektórymi z tych spostrzeżeń i wyjaśnię jak wykorzystujemy je, aby zmienić sposób prowadzenia spotkań i rozmów.

Tłumaczenie mowy w czasie rzeczywistym jest już dostępne: dowiedz się, jak DeepL Voice to umożliwia.

Dlaczego tłumaczenie mowy w czasie rzeczywistym jest trudniejsze niż tłumaczenie tekstu

Natychmiastowa komunikacja w formie rozmowy jest czymś typowo ludzkim i niezwykle trudnym do odtworzenia przez technologię – nawet tak zaawansowaną jak AI.

Jeśli chcesz tworzyć rozwiązania dla firm biznesowych, które pomogą ludziom śledzić rozmowy w wielu językach i brać w nich udział, musisz zacząć od dogłębnego zrozumienia związanych z tym wyzwań.

Wśród tych wyzwań jest odtworzenie ludzkiej umiejętności przewidywania tego, co ktoś powie, zanim jeszcze to powie. 

Kiedy tłumaczysz mowę na żywo, musisz też przewidzieć, jak najlepiej wyrazić czyjeś słowa w innym języku. Co najważniejsze, musisz to zrobić, zanim na pewno wiesz, jak zakończy się oryginalne zdanie, żeby uniknąć długich opóźnień. 

Wyzwaniem jest to, że coś, co wydaje się dokładnym tłumaczeniem kilku słów, może okazać się niedokładne, gdy rozmówca dokończy zdanie. 

Kiedy zabraliśmy się za tworzenie DeepL Voice, wiedzieliśmy, że samej technologii nie wystarczy, by osiągnąć wysoką jakość tłumaczenia mowy na żywo. Wymaga to głębokiego zainteresowania i zrozumienia różnych sposobów funkcjonowania języka

Dlatego zgromadziliśmy ekspertów w dziedzinie lingwistyki stosowanej w rozmowach ustnych. Wykorzystaliśmy też potężne zrozumienie kontekstowe DeepL dotyczące tego, jak działają różne języki

Ponadto nawiązaliśmy współpracę z firmami, aby poznać ich priorytety oraz doświadczenie związane z tłumaczeniem mowy, które przynosi im największą wartość.

Dowiedz się, jak AI DeepL zmienia tłumaczenia, umożliwiając prowadzenie biznesu bez granic.

Dlaczego szybkość jest najważniejsza w tłumaczeniu mowy w czasie rzeczywistym

Jedną z pierwszych rzeczy, których się nauczyliśmy, jest to, że czas ma kluczowe znaczenie jeśli chodzi o tłumaczenie w czasie rzeczywistym podczas spotkania lub rozmowy.

Jeśli uda ci się zbliżyć do tempa mowy – wyświetlając tłumaczenie zdania w momencie, gdy mówca je skończy – możesz znacząco wpłynąć na to, jak integracyjne mogą być te spotkania

Christine Aubry, międzynarodowa koordynatorka globalnego producenta wypieków Brioche Pasquier, wyjaśniła to dokładniej podczas DeepL Dialogues

Zauważyła, że szybsze tłumaczenia sprawiają, że ludzie przechodzą z trybu biernego do aktywnego udziału. Zamiast zmagać się z nadążaniem za tym, co mówią inni w innym języku, czują się w pełni na bieżąco. Podobnie jak osoby posługujące się językiem nativnym, mają okazję wtrącać się, kształtować rozmowę i aktywnie uczestniczyć

Sekunda robi ogromną różnicę.

Dlatego szybkość jest priorytetem przy tłumaczeniu mowy w czasie rzeczywistym. Trzeba jednak znaleźć równowagę między szybkością a innymi priorytetami, które również mają duży wpływ na wrażenia użytkowników. Tłumaczenia muszą być jak najdokładniejsze, aby uniknąć nieporozumień i zamieszania

W miarę możliwości tłumaczenia muszą minimalizować „migotanie”, które pojawia się, gdy trzeba poprawiać wcześniej przetłumaczony tekst, bo zmieniło się jego znaczenie. Im niższy wskaźnik migotania, tym łatwiej jest komuś śledzić rozmowę w naturalny sposób.

Czym różni się język mówiony od pisanego – i dlaczego ma to znaczenie dla tłumaczenia

Aby dokładnie przetłumaczyć mowę na żywo, ważne jest zrozumienie wielu różnic między wzorcami języka pisanego a rytmem mowy.

Na przykład sposób, w jaki ludzie mówią, jest o wiele bardziej indywidualny i mniej spójny niż sposób, w jaki piszą. Używają charakterystycznych zwrotów i kolokwializmów, które mogą wynikać zarówno z regionalnych dialektów, jak i z ich osobowości czy wizerunku własnego. 

Ponadto ludzie konstruują i poprawiają zdania w trakcie mówienia, co prowadzi do niepłynności, gdzie jeden niepoprawny gramatycznie termin natychmiast następuje po innym, bardziej poprawnym. Dosłowne odtwarzanie tego w tłumaczeniu nie pomaga komuś, kto próbuje zrozumieć znaczenie. 

W trakcie rozmów ludzie wypowiadają też krótkie potwierdzenia (takie jak „uh-huh”), żeby zapewnić rozmówcę, że rozumieją lub zgadzają się z tym, co mówi. Pomaga to w płynności samej rozmowy. Jednak dla osób próbujących śledzić rozmowę w innym języku sprawiają one, że tłumaczenie staje się nieuporządkowane. 

Warto odfiltrować te elementy języka mówionego z tłumaczenia.

Zapanuj nad terminologią i niuansami dzięki Glosariuszom DeepL.

Jak DeepL Voice optymalizuje zarówno dokładność, jak i szybkość

Wyzwanie staje się jeszcze ciekawsze, gdy weźmiesz pod uwagę, że platforma tłumaczeń w czasie rzeczywistym nie tłumaczy pełnych zdań. Musi przetłumaczyć zdanie w trakcie, gdy ktoś je wypowiada, kiedy ostateczne znaczenie tego zdania nie jest jeszcze jasne. 

To wymaga od nas nieco innego podejścia do optymalizacji tłumaczeń. Nie zależy nam tylko na jak najdokładniejszym tłumaczeniu. Chcemy dokładnego tłumaczenia, które jest na tyle elastyczne, by uwzględnić nowe informacje, które mogą zmienić kierunek wypowiedzi rozmówców.

Oto przykład. 

Wyobraź sobie, że tłumaczymy wirtualne spotkanie, podczas którego jeden z uczestników mówi po angielsku, a drugi śledzi to, co mówi, dzięki napisom w języku niemieckim. 

Osoba mówiąca po angielsku przerywa rozmowę, mówiąc: „I found it”. Jeśli założymy, że to pełne zdanie, najlepszym niemieckim tłumaczeniem byłoby: „Ich habe es gefunden”. 

Jednak ponieważ jest to mowa na żywo, nie możemy mieć pewności, czy zdanie jest kompletne, czy nie.

W tym przypadku lepszym rozwiązaniem mogłoby być użycie tłumaczenia typu „Ich fand es”. Dlaczego? Kiedy osoba mówiąca po angielsku dodaje: „I found it frustrating”, tłumaczenie „ich fand es” idealnie nadaje się do tego, żeby po prostu dodać słowo „frustrierend”.

Gdyby pierwsze trzy słowa przetłumaczono jako „Ich habe es gefunden”, musielibyśmy poprawić całe tłumaczenie. 

To właśnie ten rodzaj poważnych „zakłóceń”, które utrudniają intuicyjne śledzenie rozmowy. I właśnie tego rodzaju problemów DeepL stara się unikać, gdzie tylko to możliwe.

Jak rozmieszczenie czasowników w różnych językach wpływa na tłumaczenie w czasie rzeczywistym

Dokładne tłumaczenie mowy w czasie rzeczywistym wymaga szerokiego zakresu takich kontekstowych ocen, które najlepiej przeprowadzać, gdy technologia jest kierowana przez ludzką wiedzę ekspercką. Ta wiedza obejmuje zrozumienie tego, gdzie w różnych językach najczęściej umieszcza się czasowniki kluczowe dla znaczenia zdania. 

Jeśli znajdują się one na początku (jak w języku francuskim i hiszpańskim), możliwe jest wyświetlenie tłumaczenia szybciej niż w przypadku, gdy znajdują się na końcu. 

Wszystko to pomaga systemowi zatrzymać się na tyle długo, by zapewnić dokładność, ale nie na tyle długo, by niepotrzebnie opóźniać zrozumienie.

Przeczytaj historie sukcesu klientów DeepL: firm, które zaufały naszej technologii językowej AI.

Dlaczego wiedza z zakresu lingwistyki sprawia, że DeepL Voice jest dokładniejszy

To połączenie ludzkiej wiedzy lingwistycznej z bardzo dokładnym tłumaczeniem pozwala DeepL Voice znacząco wpłynąć na jakość spotkań oraz rozmów w biznesowych firmach.

Wśród tych firm jest japoński międzynarodowy koncern informatyczno-elektroniczny NEC Corporation. Została ona pierwszą firmą, która w pełni wdrożyła DeepL Voice zaledwie kilka tygodni po jego premierze. 

Entuzjazm wokół DeepL Voice pokazuje, że to przełomowy moment dla tłumaczenia mowy. Możliwość dekodowania i tłumaczenia tego, co ludzie mówią w trakcie rozmowy, zwielokrotnia wartość, jaką możemy stworzyć dla międzynarodowych firm biznesowych

Zmienia to sposób, w jaki zespoły mogą współpracować, buduje silniejsze relacje i gwarantuje, że różne pomysły i perspektywy są zawsze brane pod uwagę. 

Postępy, jakie dotychczas osiągnęliśmy, już teraz mają ogromny wpływ na sposób działania organizacji. A to dopiero początek!

Dowiedz się, dlaczego 96% profesjonalnych lingwistów wybrało DeepL Voice jako najlepszy tłumacz napisów oparty na AI.

Poznaj przyszłość komunikacji wielojęzycznej z DeepL

Udostępnij