DeepL AI Labs

Die Integration von Mixhalo in die DeepL‑Plattform hat nicht nur neue Möglichkeiten für breite Speech‑to‑Speech-Übersetzung in Echtzeit geschaffen. Sie verändert auch, was wir im Bereich der Sprachübersetzung entwickeln können. Wenn wir die Geschwindigkeit der Audioübertragung steuern können, stellt sie nicht länger eine Einschränkung dar, und Dinge, die bisher unmöglich waren, werden schnell Teil der Produkt-Roadmap.

Gemeinsam entwickeln unsere Teams eine Ebene für die Spracheingabe, die für jede Art von Erlebnis und Interaktion verfügbar ist. Mithilfe der DeepL Voice API unterstützen sie Innovatoren weltweit dabei, mehrsprachige Echtzeit-Sprachübersetzung in jedes Kunden‑ und Nutzererlebnis zu integrieren.

Diese Übersetzung erfasst die Emotionen eines Fußballkommentators, der ein Tor bejubelt, ermöglicht Nicht‑Muttersprachlern im Gesundheitswesen die direkte Teilnahme an Gesprächen, damit sie sich nicht mehr ausgeschlossen fühlen, unterstützt einen zuverlässigen Kundensupport, der Stress und Frust vermeidet, und bietet mehrsprachige Erlebnisse bei Live-Events, die weitaus schneller übersetzt werden, als es menschliche Dolmetscher könnten.

Die Grundlagen für mehrsprachiges Echtzeit-Audio

Vik Singh, Mitgründer von Mixhalo, und Leo Doin, Head of Voice bei DeepL, haben sich der Herausforderung gestellt, die Latenz bei der mehrsprachigen Audioübertragung zu reduzieren – und zwar aus zwei verschiedenen Richtungen, die sich jedoch gegenseitig ergänzen: Mixhalo hat seinen Ursprung in der Musikbranche, wo es den Klang von Instrumenten an Tausende von Fans überträgt – und zwar schneller, als die Schallwellen das Publikum im Stadion erreichen. Gleichzeitig bieten die Sprachmodelle von DeepL End‑to‑End-Audioübersetzung in Echtzeit, ohne dass eine Übergabe an verschiedene APIs erforderlich ist – hierdurch wird die Latenz der Übersetzung auf ein Minimum reduziert.

Entwicklung übersetzter Audioerlebnisse, die echte Emotionen vermitteln

Maßgeschneiderte Daemons für die Audioaufzeichnung, individuelle Netzwerkprotokolle, Echtzeit-Fehlererkennung sowie Audio-Engines, die auf schnelle Wiedergabe optimiert sind: All diese technischen Innovationen schaffen Zeit und Raum, um optimale Erlebnisse bei der Live-Audioübersetzung zu schaffen. Wenn man dem Ganzen noch Sprachintelligenz hinzufügt, kann diese Optimierung sofort erfolgen – durch Modelle, die den besten Zeitpunkt für die Übersetzung erkennen und genau wissen, wie sie Inhalte in Sprachen mit unterschiedlichen grammatischen Strukturen übersetzen müssen.

Ideale Live-Übersetzungserlebnisse bedeuten nicht einfach nur, übersetzte Audioinhalte sofort wiederzugeben. Es geht auch darum, die Wiedergabe intelligent anzupassen – mithilfe von KI, die die Funktionsweise jeder Sprache im Kern versteht.

All diese Punkte kommen bei der Live-Speech‑to‑Speech-Übersetzung in Callcentern zum Einsatz – einem der leistungsstärksten Anwendungsfälle der DeepL Voice API. Singh und das Mixhalo-Team entwickeln die Technik für diesen Anwendungsfall, um sicherzustellen, dass sich Kunden stets mit Supportteams verbunden fühlen und dass die Übersetzung niemals das Gefühl beeinträchtigt, dass man ihnen zuhört.

Live-Events, die schneller übersetzt werden, als Menschen es könnten

Der vielleicht größte Vorteil der Zusammenarbeit zwischen DeepL und Mixhalo wird sich bei Live-Events zeigen: Konferenzen mit Tausenden von Teilnehmenden und Hunderten von Referenten, bei denen alle in der Lage sind, Ideen auszutauschen und den Vorträgen in ihrer bevorzugten Sprache zu folgen – über eine Audioübersetzung, die am gesamten Veranstaltungsort auf ihre Geräte gestreamt wird.

Gerade in solchen Szenarien wird der Wert einer mehrsprachigen Echtzeit-Sprachebene deutlich: Dank Audioübertragung mit ultraniedriger Latenz können Teilnehmende den Referenten zuhören, während sie sich frei im Raum bewegen. Sie können den Vorträgen sogar dann folgen, wenn sie sich nicht im Raum befinden. Dank der sofortigen Live-Sprachübersetzung hört jeder Teilnehmer die Sprache, die er am besten versteht, wobei alle Emotionen und Ausdrucksformen erhalten bleiben. Und es bedeutet, dass alle Referenten ihre Ideen in der Sprache vermitteln können, in der sie sie entwickelt haben.

Am beeindruckendsten dürfte jedoch die Geschwindigkeit sein, mit der das alles passiert. Wir entwickeln innovative neue Methoden, mit denen die KI‑Modelle von DeepL den Kontext von Keynotes, Podiumsdiskussionen und anderen Vorträgen erfassen und verarbeiten können – ähnlich wie sich Dolmetscher auf Live-Events vorbereiten. In Kombination mit der höheren KI‑Verarbeitungsgeschwindigkeit sind wir so in der Lage, Live-Speech‑to‑Speech-Übersetzungen weitaus schneller zu generieren, als es menschliche Übersetzer könnten. All das wird die Erwartungen daran, wie das Erlebnis mehrsprachiger Inhalte aussehen soll, grundlegend neu definieren. Es wird sich futuristisch anfühlen, vielleicht sogar magisch. Und es wird auch die Erwartungen daran verändern, wie mündliche Kommunikation funktioniert.

Wenn Sie mehr über Mixhalo und die Pläne von DeepL erfahren möchten, lesen Sie diesen Blogbeitrag.

Teilen

Immer auf dem neuesten Stand

Erhalten Sie einen ersten Einblick in unsere neuesten KI‑Innovationen.