DeepL AI Labs
Mengintegrasikan Mixhalo ke dalam platform DeepL tidak hanya menambahkan kemampuan baru seputar penerjemahan ucapan suara-ke-suara real-time dalam skala besar. Hal ini mengubah cakupan apa yang dapat kami bangun di bidang Voice. Ketika Anda dapat mengontrol kecepatan pengiriman audio dan menghilangkannya sebagai batasan, hal yang sebelumnya mustahil dapat dengan cepat menjadi bagian dari peta jalan produk.
Bersama-sama, tim kami sedang membangun lapisan bahasa lisan yang tersedia untuk setiap jenis pengalaman dan interaksi. Melalui DeepL Voice API, mereka memberdayakan para inovator di mana pun untuk mengintegrasikan suara multibahasa secara langsung dan real-time ke dalam setiap jenis perjalanan pelanggan dan audiens.
Hal ini mencakup penangkapan seluruh emosi seorang komentator sepak bola saat mendeskripsikan gol atau touchdown, pengalaman suara yang dapat diakses seketika yang menghilangkan rasa terisolasi bagi penutur non-pribumi di lingkungan layanan kesehatan, desain yang cermat atas pengalaman panggilan dukungan pelanggan untuk menghilangkan stres dan frustrasi, serta pengalaman multibahasa dalam acara langsung yang menyajikan terjemahan ucapan jauh lebih cepat daripada yang dapat dilakukan oleh penerjemah manusia.
Vik Singh, salah satu pendiri Mixhalo, dan Leo Doin, Kepala Divisi Voice di DeepL, telah menghadapi tantangan mengurangi latensi untuk audio multibahasa dari dua arah yang saling melengkapi. Mixhalo lahir di industri musik, menyiarkan suara seorang drummer yang memukul snare ke stadion yang dipenuhi ribuan penggemar, lebih cepat daripada gelombang suara itu sendiri dapat mencapai mereka. Model bahasa DeepL mampu menangani terjemahan audio real-time, dari awal hingga akhir, tanpa perlu mengalihkan ke API lain, sehingga latensi terjemahan dapat ditekan seminimal mungkin.
Daemon perekaman audio khusus, protokol jaringan kustom, deteksi kesalahan real-time, serta mesin audio yang dioptimalkan untuk kecepatan pemutaran: semua inovasi teknis ini menciptakan ruang dan waktu untuk merancang pengalaman terjemahan audio langsung yang lebih optimal. Tambahkan kecerdasan bahasa, dan pengoptimalan tersebut dapat terjadi secara instan, melalui model yang mengetahui waktu terbaik untuk menerjemahkan, serta cara menyinkronkan bahasa dengan struktur tata bahasa yang berbeda.
Pengalaman terjemahan langsung yang ideal tidak berarti memutar audio terjemahan secara instan. Ini tentang menyesuaikan pemutaran secara cerdas, melalui AI yang memahami secara mendalam bagaimana setiap bahasa bekerja.
Semua ini terintegrasi dalam terjemahan langsung dari ucapan ke ucapan untuk pusat panggilan. Ini adalah salah satu aplikasi paling kuat dari DeepL Voice API. Vik dan tim Mixhalo sedang mengembangkannya untuk memastikan pelanggan selalu merasa terhubung dengan agen yang mendukung, dan bahwa terjemahan tidak pernah mengganggu perasaan bahwa mereka didengarkan.
Mungkin dampak terbesar dari penggabungan DeepL dan Mixhalo akan terasa di berbagai acara langsung: konferensi dengan ribuan peserta dan ratusan pembicara, yang semuanya dapat berbagi ide dan mengikuti sesi dalam bahasa pilihan mereka, melalui audio yang dialirkan ke perangkat mereka, di seluruh venue.
Dalam skenario seperti inilah nilai lapisan suara multibahasa secara real-time menjadi sangat jelas. Audio dengan latensi sangat rendah memungkinkan peserta mendengarkan pembicara pilihan mereka saat mereka berpindah-pindah. Mereka dapat mengikuti sesi bahkan saat tidak berada di dalam ruangan. Penerjemahan ucapan langsung dan instan berarti setiap peserta mendengar bahasa yang paling mereka pahami, dengan semua emosi dan ekspresi implisit yang tertangkap. Ini juga berarti bahwa setiap pembicara dapat membagikan ide-idenya dalam bahasa yang mereka gunakan saat merumuskannya
Namun, yang mungkin paling mencolok adalah kecepatan di mana semua ini terjadi. Kami sedang mengembangkan cara-cara baru yang inovatif agar model AI DeepL dapat menangkap dan menyerap konteks seputar pidato utama, diskusi panel, dan sesi pembicara lainnya, dengan cara yang hampir sama seperti yang dilakukan oleh penerjemah acara langsung dalam persiapan mereka. Ketika hal ini dipadukan dengan kecepatan pemrosesan AI yang lebih tinggi, kami mampu menghasilkan terjemahan langsung dari satu bahasa ke bahasa lain jauh lebih cepat daripada yang mampu dilakukan penerjemah manusia. Hal ini akan mengubah ekspektasi tentang seperti apa seharusnya pengalaman konten multibahasa. Rasanya akan terasa futuristik, bahkan ajaib. Dan hal ini akan mulai mengubah ekspektasi tentang bagaimana komunikasi lisan seharusnya bekerja.