DeepL AI Labs
Gerçek zamanlı sözlü çeviri, sadece yeni bir girdi veya çıktı biçimine sahip bir çeviri değildir. Bu, yapay zeka araştırmaları için temelde yeni, farklı ve heyecan verici bir zorluktur. Bu, çeviri önceliklerini değiştiren, yeni kısıtlamalar getiren ve bir yapay zeka modelinden yeni yargılama ve karar verme biçimleri gerektiren, çok farklı bir kullanıcı deneyimi sunmayı amaçlamaktadır.
Araştırma Müdürü Sascha Brinker ve Araştırma Bilimcisi Kristina Geißler, Voice araştırma ekibimizin bir parçası olarak bu zorlu görevi üstleniyor. İkili, gerçek zamanlı ses çevirisinde yeni bir standart belirlemek üzere DeepL’in metin çevirisi için geliştirdiği üstün kaliteli yapay zeka modelini geliştiren grubun bir parçasıdır. Şu anda, çok dilli gerçek zamanlı konuşma için yepyeni olanaklar sunan yeni modeller ve eğitim teknikleriyle bu ilk başarıyı daha da ileriye taşıyorlar.
İyi bir başlangıç noktasına sahiptik: DeepL’in mevcut metin çevirisi modelinin kalitesi ve bağlamsal anlama yeteneği. Voice ekibi, bu modeli devreye alarak ve çeviri hızını artırmak için çıkarım stratejisini ayarlayarak erken aşamada önemli kazanımlar elde etmeyi başardı. Ardından, DeepL’in dil çiftleri arasındaki ilişkileri anlama yeteneğinden yararlanarak ve yeni eğitim katmanları uygulayarak, çevirilerin ne zaman çıktısının alınmasının en uygun olduğunu belirleyebilen, Voice için özel olarak tasarlanmış modeller geliştirdiler.
Buradaki amaç, gecikme süresi ile çeviri hızı (kullanıcıların konuşmayı anında takip edip etkileşimde bulunabilmeleri için hayati önem taşır) arasında doğru dengeyi, doğruluk ve istikrarla birleştirmektir. Bu dengeyi sağlamak, DeepL’in bir cümleyi çevirmeden önce cümlenin sonunu beklemek zorunda kalmaması anlamına gelir. Aynı zamanda, modellerin çevrilmiş altyazıları düzeltmek zorunda kalması durumunda ortaya çıkan “titreme”yi de en aza indirir. Bu unsurlar, kullanıcı deneyimiнде büyük bir fark yaratır.
Metin çevirisi modelimizi uyarlayıp geliştirerek büyük ilerleme kaydettik. Öyle ki, Slator şu anda DeepL’i hem gerçek zamanlı Voice çevirilerinin kalitesi hem de istikrarı açısından açık ara lider olarak gösteriyor. Ancak, çeviri öncesinde metni transkripsiyona tabi tutma gerekliliğini ortadan kaldırmak, bizi daha da ileriye ve daha hızlı bir şekilde götürebilir. Ekipimiz şu anda, ara metin aşamasına geçmeden doğrudan ses girişinden çevrilmiş konuşma çıktısı üretebilen modeller geliştiriyor.
Modele, çevirdiği konuşmalarla ilgili daha fazla bağlam bilgisi sağlayarak daha da ilerleme kaydedebiliriz: neyin tartışıldığı, kimlerin tartıştığı ve kullanmaları muhtemel belirli ifadeler ve terminoloji gibi. Bu, üst düzey insan tercümanların önemli etkinlikler veya toplantılar öncesinde yaptıkları yoğun eğitim çalışmalarının çoğunu taklit eder. Tıpkı onlar gibi, bu da modellerimizin bir kişinin söylemek üzere olduğu şeyi, kelimeyi ilk oluşturmaya başladığı andan itibaren çevirmesini sağlar.
Bu yeni, doğrudan konuşma-konuşma modelleri, sesli çevirinin şu anda karşılaştığı en önemli kısıtlamalardan bazılarını ortadan kaldırıyor. Böylece, çok heyecan verici yeni olasılıklar ortaya çıkıyor.
Metin çevirisini konuşmaya dönüştürme gerekliliği ortadan kalktığı için, sözlü çevirinin sunulması için gereken süreden tam saniyeler kazanabiliriz. Konuşmayı gerçek zamanlı olarak takip etme bağlamında bu, kullanıcı deneyimi ve dinleyici deneyimleri üzerinde büyük bir etki yaratacak çok önemli bir hız artışıdır.
Dahası da var. Ses girişiyle doğrudan çalışmak, modelleri insanların konuşma tarzında yer alan aksanları, lehçeleri ve nüansları algılayacak şekilde eğitebileceğimiz anlamına gelir. Ekstra çıkarım süresi ve daha zengin ses girişleri sayesinde, insanların söylediklerinin duygusunu ve daha derin anlamını yakalayan konuşma çıktıları oluşturabiliriz.
Yapay zeka aracılığıyla gerçek zamanlı sesli çevirinin geleceği sadece daha hızlı olmakla kalmıyor. Aynı zamanda daha derinden insani: İnsanların konuşurken iletişim kurdukları birçok düzeyin daha fazlasını yakalıyor. Bu, DeepL’i bir çeviri motorundan, dili bir engel unsuru olmaktan çıkararak en doğal insan iletişimini mümkün kılan gerçek zamanlı bir Voice katmanına dönüştürüyor.
İşte bu, bu alanı DeepL’deki yapay zeka araştırmalarının en heyecan verici alanlarından biri haline getiriyor.