مختبرات الذكاء الاصطناعي مِن DeepL
لم يقتصر إدخال Mixhalo إلى منصة DeepL على إضافة إمكانيات جديدة للترجمة الصوتية من لغة إلى أخرى في الوقت الفعلي وعلى نطاق واسع فحسب. بل إنه يغير نطاق ما يمكننا إنشاؤه في مجال الصوت. عندما تتمكن من التحكم في سرعة توصيل الصوت، وإزالة هذا العائق، فإن ما كان مستحيلاً في السابق يمكن أن يصبح بسرعة خطة تطوير المنتج.
تعمل فرقنا معًا على بناء طبقة اللغة المنطوقة متاحة لكل أنواع التجارب والتفاعلات. من خلال API DeepL Voice، فإنهم يمكّنون المبتكرين في كل مكان من دمج الصوت المباشر والمتعدد اللغات في الوقت الفعلي في كل نوع من رحلات العملاء والجمهور.
ويشمل ذلك التعبير عن كل المشاعر التي يمر بها معلق كرة القدم وهو يصف هدفًا أو هبوطًا، وتجارب صوتية يمكن الوصول إليها على الفور تزيل الشعور بالعزلة لدى غير الناطقين باللغة الأم في بيئات الرعاية الصحية، والتصميم الدقيق لتجارب مكالمات مساعدة العملاء للقضاء على التوتر والإحباط، وتجربة متعددة اللغات للأحداث الحية تقدم ترجمة الكلام بسرعة أكبر بكثير مما يستطيع المترجمون الفوريون البشر.
يعمل كل من فيك سينغ، المؤسس المشارك لشركة Mixhalo، وليو دوين، رئيس قسم Voice في DeepL، على مواجهة التحدي المتمثل في تقليل زمن الاستجابة للصوت متعدد اللغات من اتجاهين متكاملين. نشأت Mixhalo في صناعة الموسيقى، حيث كانت تبث صوت عازف الطبول وهو يضرب على الطبلة إلى ملعب مكتظ بآلاف المشجعين، بسرعة تفوق سرعة وصول الموجات الصوتية نفسها إليهم. تستطيع نماذج اللغة في DeepL معالجة ترجمة الصوت في الوقت الحقيقي، من البداية إلى النهاية، دون الحاجة إلى الترحيل إلى APIات مختلفة، مما يخفض زمن انتقال الترجمة إلى أدنى مستوى ممكن.
برامج خفية مخصصة لالتقاط الصوت، وبروتوكولات شبكية مخصصة، واكتشاف الأخطاء في الوقت الفعلي، ومحركات صوتية مُحسَّنة لسرعة التشغيل: كل هذه الابتكارات التقنية توفر الوقت والمساحة لتصميم تجربة أكثر تحسينًا للترجمة الصوتية الحية. أضف إلى ذلك الذكاء اللغوي، وستتم هذه التحسينات على الفور، من خلال نماذج تعرف أفضل وقت للترجمة، وكيفية مزامنة اللغات ذات الهياكل النحوية المختلفة.
التجربة المثالية للترجمة الحية لا تعني تشغيل الصوت المترجم على الفور. بل تتعلق بضبط التشغيل بذكاء، من خلال الذكاء الاصطناعي الذي يفهم بعمق كيفية عمل كل لغة.
يتجسد كل هذا في الترجمة الفورية للكلام من لغة إلى لغة لمراكز الاتصال. إنها واحدة من أقوى تطبيقات واجهة برمجة تطبيقات DeepL Voice. يعمل فيك وفريق Mixhalo على تطويره لضمان أن يشعر العملاء دائمًا بالتواصل مع موظفي مساعدة العملاء، وأن الترجمة لا تؤثر أبدًا على شعورهم بأن أصواتهم مسموعة.
ربما سيكون التأثير الأكبر لتوحيد جهود DeepL وMixhalo ملموسًا في الفعاليات الحية: المؤتمرات التي تضم آلاف الحاضرين ومئات المتحدثين، حيث يتمكن الجميع من تبادل الأفكار ومتابعة الجلسات بلغةهم المفضلة، من خلال الصوت الذي يتم بثه إلى أجهزتهم في جميع أنحاء المكان.
في سيناريوهات مثل هذه، تظهر قيمة الطبقة الصوتية متعددة اللغات في الوقت الفعلي بوضوح تام. يعني الصوت ذو زمن الاستجابة المنخفض للغاية أن الحاضرين يمكنهم الاستماع إلى المتحدث الذي يختارونه أثناء تنقلهم في المكان. ويمكنهم متابعة الجلسات حتى عندما لا يكونون داخل القاعة. الترجمة الحية والفورية للكلام تعني أن كل مشارك يسمع اللغة التي يفهمها بشكل أفضل، مع التقاط كل المشاعر والتعبيرات الضمنية. كما يعني أيضًا أن كل متحدث يمكنه مشاركة أفكاره باللغة التي صاغها بها
ولكن ربما يكون الأمر الأكثر إثارة للدهشة هو السرعة التي يحدث بها كل هذا. نحن نعمل على تطوير طرق جديدة ومبتكرة لنماذج الذكاء الاصطناعي في DeepL لالتقاط واستيعاب السياق المحيط بالكلمات الرئيسية وحلقات النقاش وجلسات المتحدثين الأخرى، بنفس الطريقة التي يستعد بها مترجمو الفوريون في الأحداث الحية مسبقًا. وعندما يقترن ذلك بسرعة المعالجة الفائقة للذكاء الاصطناعي، نصبح قادرين على إنشاء ترجمات فورية من لغة إلى أخرى أسرع بكثير مما يستطيع المترجمون البشريون. سيؤدي هذا إلى إعادة تعريف التوقعات بشأن شكل تجربة المحتوى متعدد اللغات. ستبدو التجربة مستقبلية، بل وحتى سحرية. وستبدأ في تغيير التوقعات بشأن كيفية عمل التواصل الشفهي.