DeepL AI Labs

Wprowadzenie Mixhalo na platformę DeepL to nie tylko nowe możliwości w zakresie tłumaczenia mowy na mowę w czasie rzeczywistym na dużą skalę. To całkowicie zmienia zakres tego, co możemy stworzyć w dziedzinie rozpoznawania mowy. Kiedy możesz kontrolować szybkość przesyłania dźwięku i wyeliminować to jako ograniczenie, to, co wcześniej było niemożliwe, szybko staje się częścią planu rozwoju produktu.

Nasze zespoły wspólnie tworzą warstwę języka mówionego, która będzie dostępna dla każdego rodzaju doświadczeń i interakcji. Dzięki DeepL Voice API dają innowatorom na całym świecie możliwość wdrażania wielojęzycznego głosu na żywo, w czasie rzeczywistym, do każdego rodzaju ścieżki klienta i odbiorcy.

Obejmuje to oddanie wszystkich emocji komentatora piłkarskiego opisującego gola lub przyłożenie, natychmiastowo dostępne doświadczenia głosowe, które eliminują poczucie izolacji osób niebędących rodzimymi użytkownikami języka w placówkach opieki zdrowotnej, staranne projektowanie rozmów z obsługą klienta w celu wyeliminowania stresu i frustracji, a także wielojęzyczne doświadczenia związane z wydarzeniami na żywo, które zapewniają tłumaczenie mowy znacznie szybciej niż potrafią to zrobić ludzcy tłumacze.

Podstawy wielojęzycznego audio w czasie rzeczywistym

Współzałożyciel Mixhalo, Vik Singh, oraz szef działu głosowego w DeepL, Leo Doin, podchodzą do wyzwania, jakim jest zmniejszenie opóźnień w wielojęzycznym audio, z dwóch uzupełniających się stron. Mixhalo narodziło się w branży muzycznej, transmitując dźwięk perkusisty uderzającego w werbel do stadionu pełnego tysięcy fanów szybciej, niż same fale dźwiękowe mogłyby do nich dotrzeć. Modele językowe DeepL potrafią przetwarzać tłumaczenie dźwięku w czasie rzeczywistym od początku do końca, bez przekazywania danych do różnych interfejsów API, co pozwala obniżyć opóźnienie tłumaczenia do absolutnego minimum.

Tworzenie tłumaczonych doświadczeń audio, które działają na poziomie emocjonalnym

Specjalnie zaprojektowane demony do przechwytywania dźwięku, niestandardowe protokoły sieciowe, wykrywanie błędów w czasie rzeczywistym, silniki audio zoptymalizowane pod kątem szybkości odtwarzania: wszystkie te innowacje techniczne dają czas i przestrzeń na zaprojektowanie bardziej zoptymalizowanego doświadczenia tłumaczenia audio na żywo. Dodaj do tego inteligencję językową, a optymalizacja ta może nastąpić natychmiast – dzięki modelom, które wiedzą, kiedy najlepiej przetłumaczyć, i jak zsynchronizować języki o różnych strukturach gramatycznych.

Idealne doświadczenie tłumaczenia na żywo nie oznacza natychmiastowego odtwarzania przetłumaczonego dźwięku. Chodzi o inteligentne dostosowywanie odtwarzania dzięki AI, która dogłębnie rozumie, jak działa każdy język.

Wszystko to łączy się w tłumaczeniu mowy na mowę na żywo dla call center. To jedno z najpotężniejszych zastosowań interfejsu API DeepL Voice. Vik i zespół Mixhalo pracują nad tym, by klienci zawsze czuli więź z konsultantami, a tłumaczenie nigdy nie osłabiało poczucia, że są wysłuchani.

Wydarzenia na żywo, tłumaczone z prędkością, której żaden człowiek nie jest w stanie dorównać

Być może największy wpływ połączenia DeepL i Mixhalo będzie widoczny podczas wydarzeń na żywo: konferencji z tysiącami uczestników i setkami prelegentów, którzy będą mogli dzielić się pomysłami i śledzić sesje w swoim ulubionym języku dzięki dźwiękowi przesyłanemu strumieniowo na ich urządzenia w całym obiekcie.

To właśnie w takich sytuacjach naprawdę widać wartość wielojęzycznej warstwy głosowej działającej w czasie rzeczywistym. Dźwięk o ultra niskim opóźnieniu oznacza, że uczestnicy mogą słuchać wybranego prelegenta, poruszając się po sali. Mogą śledzić sesje, nawet gdy nie są w sali. Tłumaczenie mowy na żywo i w czasie rzeczywistym sprawia, że każdy uczestnik słyszy język, który rozumie najlepiej, z zachowaniem wszystkich emocji i niuansów wypowiedzi. Oznacza to również, że każdy prelegent może dzielić się swoimi pomysłami w języku, w którym je sformułował

Najbardziej uderzająca będzie jednak chyba szybkość, z jaką to wszystko się dzieje. Opracowujemy nowe, innowacyjne sposoby, dzięki którym modele AI DeepL będą mogły wychwytywać i przetwarzać kontekst wystąpień głównych, dyskusji panelowych i innych sesji prelegentów – podobnie jak robią to tłumacze podczas wydarzeń na żywo, przygotowując się z wyprzedzeniem. W połączeniu z większą szybkością przetwarzania AI pozwala nam to wygenerować tłumaczenia na żywo z języka na język znacznie szybciej, niż są w stanie to zrobić tłumacze. To całkowicie zmieni oczekiwania dotyczące tego, jak powinno wyglądać korzystanie z treści wielojęzycznych. Będzie to wydawało się futurystyczne, a nawet magiczne. I zacznie to zmieniać oczekiwania dotyczące tego, jak działa komunikacja ustna.

Dowiedz się więcej o planach Mixhalo i DeepL w tym wpisie na blogu.

Udostępnij

Bądźmy w kontakcie

Zobacz zapowiedzi naszych najnowszych innowacji w dziedzinie AI.