DeepL AI Labs
Die Integration von Mixhalo in die DeepL-Plattform hat nicht nur neue Möglichkeiten für die Sprach-zu-Sprache-Übersetzung in Echtzeit und in großem Maßstab hinzugefügt. Sie verändert den Umfang dessen, was wir im Bereich der Voice-Technologie entwickeln können. Wenn man die Geschwindigkeit der Audioübertragung steuern und diese als Einschränkung beseitigen kann, wird das bisher Unmögliche schnell zu einem Teil der Produkt-Roadmap.
Gemeinsam entwickeln unsere Teams eine Schicht für die Spracheingabe, die für jede Art von Erlebnis und Interaktion verfügbar ist. Mithilfe der DeepL Voice API befähigen sie Innovatoren weltweit, Live-Sprachausgabe in Echtzeit und in mehreren Sprachen in jede Art von Kunden- und Nutzererlebnis zu integrieren.
Dazu gehören die Wiedergabe aller Emotionen eines Fußballkommentators, der ein Tor oder einen Touchdown beschreibt, sofort verfügbare Voice-Erlebnisse, die das Gefühl der Isolation für Nicht-Muttersprachler im Gesundheitswesen beseitigen, die sorgfältige Gestaltung von Gesprächen zum Support für Kunden zur Vermeidung von Stress und Frustration sowie ein mehrsprachiges Erlebnis bei Live-Veranstaltungen, bei dem übersetzte Sprache weitaus schneller bereitgestellt wird, als es menschliche Dolmetscher könnten.
Vik Singh, Mitbegründer von Mixhalo, und Leo Doin, Leiter des Bereichs „Voice“ bei DeepL, haben sich der Herausforderung, die Latenz bei mehrsprachigem Audio zu reduzieren, aus zwei sich ergänzenden Richtungen genähert. Mixhalo hat seinen Ursprung in der Musikbranche und überträgt den Klang eines Schlagzeugers, der auf eine Snare-Trommel schlägt, in ein Stadion voller Tausender Fans – schneller, als die Schallwellen selbst diese erreichen könnten. Die Sprachmodelle von DeepL sind in der Lage, die Übersetzung von Echtzeit-Audio durchgängig zu bewältigen, ohne dass eine Übergabe an verschiedene APIs erforderlich ist, wodurch die Latenz der Übersetzung auf ein Minimum reduziert wird.
Maßgeschneiderte Audioaufzeichnungs-Daemons, benutzerdefinierte Netzwerkprotokolle, Fehlererkennung in Echtzeit, auf schnelle Wiedergabe optimierte Audio-Engines: All diese technischen Innovationen schaffen Zeit und Raum, um ein optimiertes Erlebnis der Live-Audioübersetzung zu gestalten. Hinzufügen von Sprachintelligenz: Diese Optimierung kann sofort erfolgen – durch Modelle, die den besten Zeitpunkt für die Übersetzung erkennen und wissen, wie Sprachen mit unterschiedlichen grammatikalischen Strukturen synchronisiert werden.
Das ideale Live-Erlebnis einer Übersetzung bedeutet nicht, übersetzte Audioinhalte sofort abzuspielen. Es geht darum, die Wiedergabe intelligent anzupassen – mithilfe von KI, die die Funktionsweise jeder Sprache tiefgreifend versteht.
All dies vereint sich in der Live-Sprach-zu-Sprach-Übersetzung für Callcenter. Dies ist eine der leistungsstärksten Anwendungen der DeepL Voice API. Vik und das Mixhalo-Team entwickeln diese Lösung, um sicherzustellen, dass Kunden stets das Gefühl der Verbundenheit mit den Mitarbeitern, die den Support unterstützen, spüren und dass die Übersetzung niemals das Gefühl beeinträchtigt, dass ihnen zugehört wird.
Die vielleicht größte Auswirkung der Zusammenarbeit zwischen DeepL und Mixhalo wird sich bei Live-Veranstaltungen zeigen: Konferenzen mit Tausenden von Teilnehmern und Hunderten von Referenten, bei denen alle in der Lage sind, Ideen auszutauschen und den Vorträgen in ihrer bevorzugten Sprache zu folgen – über Audio, das im gesamten Veranstaltungsort auf ihre Geräte gestreamt wird.
Gerade in solchen Szenarien wird der Wert einer mehrsprachigen Echtzeit-Voice-Überlagerung deutlich. Dank Audio mit extrem geringer Latenz können die Teilnehmer dem Redner ihrer Wahl zuhören, während sie sich frei im Raum bewegen. Sie können den Vorträgen auch dann folgen, wenn sie sich nicht im Raum befinden. Dank der sofortigen Live-Sprachübersetzung hört jeder Teilnehmer die Sprache, die er am besten versteht, wobei alle Emotionen und impliziten Ausdrucksformen erhalten bleiben. Es bedeutet auch, dass jeder Redner seine Ideen in der Sprache vermitteln kann, in der er sie entwickelt hat
Am beeindruckendsten dürfte jedoch die Geschwindigkeit sein, mit der all dies geschieht. Wir entwickeln innovative neue Methoden, mit denen die KI-Modelle von DeepL den Kontext von Keynotes, Podiumsdiskussionen und anderen Vorträgen erfassen und verarbeiten können – ähnlich wie sich Dolmetscher bei Live-Veranstaltungen im Vorfeld vorbereiten. In Kombination mit der höheren Verarbeitungsgeschwindigkeit der KI sind wir in der Lage, Live-Übersetzungen von Sprache zu Sprache weitaus schneller zu generieren, als es menschliche Übersetzer könnten. Dies wird die Erwartungen daran, wie das Erlebnis mehrsprachiger Inhalte aussehen soll, grundlegend neu definieren. Es wird sich futuristisch anfühlen, ja sogar magisch. Und es wird die Erwartungen daran verändern, wie mündliche Kommunikation funktioniert.