Wie DeepL Voice die einzigartigen Herausforderungen der Echtzeit-Sprachübersetzung meistert

Zusammenfassung

  • Echtzeit-Sprachübersetzung erfordert Schnelligkeit, Präzision und die Fähigkeit, unvollständige Sätze zu verarbeiten – allesamt Herausforderungen, die bei der Textübersetzung nicht bestehen.
  • Gesprochene Sprache enthält Aussetzer, Umgangssprache und kurze Bekräftigungen, die herausgefiltert werden müssen, anstatt sie wörtlich zu übersetzen.
  • Indem das Übersetzungstempo der Sprechgeschwindigkeit angenähert wird, werden Meetingteilnehmer von passiven Zuhörern zu aktiven Mitwirkenden.
  • DeepL Voice minimiert „Flackern“ – also die Korrektur bereits angezeigter Übersetzungen –, indem es flexible Übersetzungen generiert, die neue Informationen mitten im Satz aufnehmen können.
  • DeepL Voice basiert auf dem Sprachwissen menschlicher Linguisten, um Verbplatzierung, Satzstruktur und Kontextbeurteilung zwischen Sprachen handzuhaben.
  • DeepL hat mit Unternehmen und Sprachexperten zusammengearbeitet, um sicherzustellen, dass DeepL Voice die Prioritäten der realen Kommunikation widerspiegelt.
  • Die NEC Corporation war das erste Unternehmen, das DeepL Voice nach der Einführung vollständig eingesetzt hat.
  • Die KI‑Sprachsuite von DeepL, bestehend aus Voice, Übersetzer und Write, bietet globalen Unternehmen die nötigen Tools für eine klare Kommunikation.

Menschen sprechen nicht auf dieselbe Weise, wie sie schreiben. Und sie erleben Gespräche nicht so, wie sie eine E‑Mail oder einen Artikel lesen. 

Unsere Fähigkeit, einander im Moment des Sprechens zu verstehen – indem wir alle Arten der verbalen und nonverbalen Kommunikation zusammenführen, um zu begreifen, was jemand meint –, ist der Hochseilakt der menschlichen Ausdrucksweise. 

Wenn man einen Schritt zurücktritt und betrachtet, was in einem Gespräch geschieht, ist es erstaunlich, wie viele Informationen wir in kürzester Zeit vermitteln. 

Wenn man sich die Aufgabe stellt, gesprochene Interaktionen in Echtzeit zu übersetzen, wie DeepL es mit seiner Lösung DeepL Voice getan hat, gewinnt man faszinierende Einblicke in die Unterschiede zwischen der Übersetzung gesprochener Sprache und der Übersetzung von Text. 

In diesem Beitrag werde ich einige dieser Erkenntnisse vorstellen und erklären, wie wir sie nutzen, um die Qualität von Meetings und Gesprächen zu verbessern.

Voice‑to‑Voice-Übersetzung in Echtzeit ist da: Erfahren Sie, wie DeepL Voice das ermöglicht.

Warum Echtzeit-Sprachübersetzung schwieriger ist als Textübersetzung

Sofortige gesprochene Kommunikation ist eine grundlegend menschliche Fähigkeit, die sich mit Technologie nur sehr schwer nachbilden lässt – selbst mit einer so fortschrittlichen Technologie wie KI

Wenn Sie Unternehmenslösungen entwickeln möchten, mit denen Menschen Gespräche in mehreren Sprachen verfolgen und daran teilnehmen können, müssen Sie zunächst ein tiefgreifendes Verständnis für die damit verbundenen Herausforderungen entwickeln.

Zu diesen Herausforderungen gehört die Nachahmung der menschlichen Fähigkeit, zu antizipieren, was Menschen sagen, bevor sie ihren Satz beendet haben. 

Wenn Sie Sprache in Echtzeit übersetzen, müssen Sie auch vorhersehen, wie die Worte einer Person am besten in einer anderen Sprache ausgedrückt werden können. Und das muss bereits passieren, bevor Sie genau wissen, wie der ursprüngliche Satz endet, um große Zeitverzögerungen zu vermeiden. 

Die Herausforderung dabei ist, dass sich eine scheinbar korrekte Übersetzung einiger Wörter als ungenau erweisen kann, sobald die Person ihren Satz beendet hat. 

Als wir mit der Entwicklung von DeepL Voice begonnen haben, wussten wir, dass wir eine hochwertige Live-Übersetzung gesprochener Sprache nicht allein durch Technologie erreichen konnten. Sie erfordert auch ein tiefgreifendes Verständnis für die verschiedenen Funktionsweisen von Sprache

Deshalb haben wir mit Sprachwissenschaftlern im Bereich gesprochener Konversationen zusammengearbeitet und das tiefgreifende Kontextverständnis von DeepL hinsichtlich der Funktionsweise verschiedener Sprachen genutzt. 

Und wir haben mit Unternehmen zusammengearbeitet, um ihre Prioritäten zu ermitteln und herauszufinden, welche Aspekte der Sprachübersetzung ihnen den größten Wert liefern.

Entdecken Sie, wie DeepL‑KI die Übersetzung revolutioniert, um ein wahrhaft grenzenloses Business zu ermöglichen.

Warum Geschwindigkeit bei der Echtzeit-Sprachübersetzung höchste Priorität hat

Eine der ersten Erkenntnisse, die wir gewonnen haben, lautet: Timing ist entscheidend, wenn es um die Echtzeitübersetzung eines Meetings oder einer Unterhaltung geht.

Wenn man sich der Geschwindigkeit der Sprache annähern kann – indem man die Übersetzung eines Satzes bereits vollständig anzeigt, wenn der Sprecher ihn beendet –, hat das großen Einfluss darauf, wie inklusiv diese Meetings sein können

Christine Aubry, internationale Koordinatorin beim globalen Backwarenhersteller Brioche Pasquier, hat diesen Punkt bei DeepL Dialogues näher erläutert

Sie merkte an, dass schnellere Übersetzungen dafür sorgen, dass Menschen nicht mehr nur passiv zuhören, sondern aktiv teilnehmen können. Anstatt mühsam mit dem mitzuhalten, was andere in einer anderen Sprache sagen, fühlen sie sich voll und ganz im Bilde. Wie ein Muttersprachler haben sie die Möglichkeit, sich einzuschalten, das Gespräch zu gestalten und aktiv teilzunehmen

Eine Sekunde macht einen großen Unterschied.

Entsprechend hat Geschwindigkeit bei der Echtzeitübersetzung höchste Priorität. Sie muss jedoch gegen andere Prioritäten abgewogen werden, die ebenfalls großen Einfluss auf die Erfahrung der Zuhörer haben. Übersetzungen müssen so genau wie möglich sein, um Missverständnisse und Verwirrung zu vermeiden

Und wo immer möglich, müssen Übersetzungen das „Flackern“ minimieren, das auftritt, wenn bereits übersetzter Text korrigiert werden muss, weil sich die Bedeutung geändert hat. Je geringer dieses Flackern ist, desto leichter fällt es jemandem, einem Gespräch auf natürliche Weise zu folgen.

Wie sich gesprochene von geschriebener Sprache unterscheidet – und warum diese Unterschiede für die Übersetzung so wichtig sind

Um Gespräche genau zu übersetzen, ist es wichtig, die vielen Unterschiede zwischen den Mustern der Schriftsprache und dem Rhythmus der gesprochenen Sprache zu verstehen.

Beispielsweise sprechen Menschen viel individueller und unbeständiger, als sie schreiben. Sie verwenden unterschiedliche Redewendungen und Umgangssprache, die sowohl durch regionale Dialekte als auch durch ihre Persönlichkeit oder ihr Selbstbild geprägt sind. 

Darüber hinaus bilden und korrigieren Menschen Sätze während des Sprechens, was zu Aussetzern führt, bei denen auf einen grammatikalisch falschen Begriff sofort ein anderer, korrekterer folgt. Diese Aussetzer wörtlich in der Übersetzung wiederzugeben, ist für jemanden, der die Bedeutung verstehen möchte, nicht hilfreich. 

Während eines Gesprächs geben Menschen auch kurze Bekräftigungen von sich (wie „Mhm“), um dem Sprecher zu versichern, dass sie das Gesagte verstehen oder ihm zustimmen. Diese Bekräftigungen helfen zwar dem Gesprächsfluss, erschweren aber die Übersetzung für Menschen, die versuchen, dem Gespräch in einer anderen Sprache zu folgen. 

Deshalb ist es hilfreich, diese Elemente der gesprochenen Sprache aus der Übersetzung herauszufiltern.

Behalten Sie mit DeepL-Glossaren die Kontrolle über Terminologie und sprachliche Nuancen.

Wie DeepL Voice gleichzeitig Genauigkeit und Geschwindigkeit optimiert

Die Herausforderung wird noch interessanter, wenn man bedenkt, dass eine Echtzeit-Übersetzungsplattform keine vollständigen Sätze übersetzt. Sie muss einen Satz übersetzen, noch während er gesprochen wird, wobei die endgültige Bedeutung dieses Satzes noch nicht klar ist. 

Und das erfordert eine etwas andere Art der Übersetzungsoptimierung. Wir wollen nicht nur die genaueste Übersetzung, sondern eine genaue Übersetzung, die flexibel genug ist, um neue Informationen einzubeziehen, die die Bedeutung des Gesagten verändern könnten.

Hier ein Beispiel: 

Stellen Sie sich vor, wir übersetzen ein virtuelles Meeting, in dem einer der Teilnehmer Englisch spricht und einer der anderen Teilnehmer das Gesagte mit deutschen Untertiteln verfolgt. 

Unser englischer Sprecher unterbricht das Gespräch und sagt: „I found it.“ Wenn wir nun davon ausgehen, dass dies ein vollständiger Satz ist, wäre die bestmögliche deutsche Übersetzung: „Ich habe es gefunden.“ 

Da es sich jedoch um eine Live-Aussage handelt, können wir nicht sicher sein, ob der Satz vollständig ist oder nicht.

In diesem Fall wäre es besser, stattdessen eine Übersetzung wie „Ich fand es“ zu verwenden. Warum? Wenn der englische Sprecher fortfährt und letztlich „I found it frustrating“ sagt, kann die Übersetzung „Ich fand es“ einfach durch das Wort „frustrierend“ ergänzt werden.

Würden die ersten drei Wörter mit „Ich habe es gefunden“ übersetzt, müsste die gesamte Übersetzung überarbeitet werden. 

Das ist die Art von „Flackern“, die das intuitive Verfolgen eines Gesprächs behindert. Und genau dieses Problem will DeepL so weit wie möglich minimieren.

Wie die Verbplatzierung in verschiedenen Sprachen die Echtzeitübersetzung beeinflusst

Eine genaue Echtzeitübersetzung gesprochener Sprache erfordert eine Vielzahl solcher kontextbezogener Entscheidungen, die am besten getroffen werden können, wenn die Technologie von menschlichem Fachwissen geleitet wird. Zu diesem Fachwissen gehört auch das Verständnis dafür, wo verschiedene Sprachen die Verben positionieren, die für die Bedeutung eines Satzes entscheidend sind. 

Wenn sie am Anfang stehen (wie im Französischen und Spanischen), kann die Übersetzung schneller angezeigt werden, als wenn sie am Ende stehen. 

All das hilft einem System, gerade so lange zu pausieren, dass die Übersetzung genau ist, aber nicht so lange, dass sie das Verständnis unnötig hinauszögert.

Lesen Sie Erfolgsgeschichten von DeepL-Kunden, die auf unsere KI‑Sprachtechnologie vertrauen.

Wie das Fachwissen menschlicher Linguisten DeepL Voice präziser macht

Dank der Kombination aus menschlicher Sprachkompetenz und präziser Übersetzung kann DeepL Voice schon jetzt die Meetings und Gespräche internationaler Unternehmen erheblich verbessern. Dazu gehört auch die NEC Corporation, die DeepL Voice bereits wenige Wochen nach der offiziellen Markteinführung als erstes Unternehmen vollständig implementiert hat. 

Die Begeisterung für DeepL Voice zeigt, dass dies ein bahnbrechender Moment für die Sprachübersetzung ist. Die Möglichkeit, Äußerungen zu analysieren und zu übersetzen, noch während sie gesprochen werden, steigert den Wert, den wir für internationale Unternehmen schaffen können. Es verändert die Art und Weise, wie Teams zusammenarbeiten, stärkt Beziehungen und stellt sicher, dass unterschiedliche Ideen und Perspektiven berücksichtigt werden. 

Die Fortschritte, die wir bisher erzielt haben, verändern die Arbeitsweise von Unternehmen bereits erheblich. Und wir haben noch viel mehr vor!

Teilen