Comment DeepL Voice relève les défis spécifiques à la traduction vocale en temps réel

Points essentiels

  • La traduction vocale en temps réel exige de la vitesse, de la précision et la capacité à gérer des phrases incomplètes : autant de défis auxquels la traduction de texte n'est pas confrontée.
  • La langue parlée comporte des hésitations, des expressions familières et des affirmations brèves qui doivent être filtrées plutôt que traduites littéralement.
  • S'approcher de la vitesse réelle de la voix transforme les participants aux réunions : d'auditeurs passifs, ils deviennent des contributeurs actifs.
  • DeepL Voice minimise les « saccades » en générant des traductions souples capables d’intégrer de nouvelles informations en cours de phrase.
  • L'expertise linguistique humaine guide la manière dont DeepL Voice gère le placement des verbes, la structure des phrases et l'interprétation contextuelle d'une langue à l'autre.
  • DeepL s'est associé à des entreprises et à des experts en linguistique pour s'assurer que DeepL Voice réponde aux challenges de communication du monde réel.
  • NEC Corporation a été la première entreprise à déployer pleinement DeepL Voice après son lancement.
  • La suite d’IA linguistique de DeepL, comprenant Voice, Traducteur et Write, offre aux entreprises internationales les outils nécessaires pour communiquer clairement.

On ne parle pas de la même façon qu'on écrit. Et on ne vit pas une conversation orale de la même manière que la lecture d'un e-mail ou d'un article. 

Notre capacité à nous comprendre mutuellement au moment où nous parlons, en combinant toutes sortes de communications verbales et non verbales pour saisir instantanément ce que quelqu'un veut dire, est le véritable exercice d'équilibriste de l'expression humaine. 

Lorsqu'on prend du recul et qu'on analyse ce qui se passe lors d'une conversation, il est fascinant de voir la quantité d'informations que nous transmettons en si peu de temps. 

Lorsqu’on se donne pour mission de traduire des interactions orales en direct, comme DeepL le fait avec la solution DeepL Voice, on découvre de nombreux aspects passionnants sur ce qui différencie la traduction de la langue parlée de celle du texte. 

Dans cet article, je partagerai certaines de ces découvertes et j'expliquerai comment nous les utilisons pour transformer l'expérience des réunions et des conversations.

La traduction vocale en temps réel est là : découvrez comment DeepL Voice la rend possible.

Pourquoi la traduction vocale en temps réel est plus difficile que la traduction de texte

La communication instantanée et conversationnelle est fondamentalement humaine et extrêmement difficile à reproduire par la technologie, même pour une technologie aussi avancée que l'IA.

Si vous voulez créer des solutions pour les entreprises afin d'aider les collaborateurs à suivre et à participer à des conversations en plusieurs langues, vous devez commencer par comprendre en profondeur les défis que cela implique.

Parmi ces défis figure la reproduction d'une compétence purement humaine : celle d'anticiper ce que les gens vont dire avant même qu'ils n'aient fini de le dire. 

Lorsque vous traduisez la parole en direct, vous devez également anticiper la meilleure façon d'exprimer les mots de quelqu'un dans une autre langue. Surtout, vous devez le faire avant de savoir avec certitude comment la phrase d'origine va se terminer afin d'éviter de longs temps de latence. 

Le défi réside dans le fait que ce qui semble être une traduction exacte de quelques mots peut s'avérer inexact une fois que la personne a terminé sa phrase. 

Lorsque nous avons commencé à développer DeepL Voice, nous étions conscients que la technologie seule ne suffirait pas à obtenir une traduction vocale en direct de haute qualité. Cela repose sur un intérêt sincère et une compréhension profonde des différents mécanismes de la langue

C’est pourquoi nous avons réuni des experts en linguistique spécialisés dans les conversations orales. Nous avons également utilisé la puissante compréhension contextuelle de DeepL sur le fonctionnement des différentes langues

De plus, nous avons collaboré avec des entreprises pour analyser leurs priorités et identifier l'expérience de traduction vocale qui génère le plus de valeur pour elles.

Découvrez comment l'IA de DeepL transforme la traduction pour permettre un développement international sans limites.

Pourquoi la vitesse est la priorité absolue dans la traduction vocale en temps réel

L'un des premiers enseignements que nous avons tirés est que le timing fait tout lorsqu'il s'agit de traduire en temps réel une réunion ou une conversation.

Si vous parvenez à vous rapprocher de la vitesse de la parole, en affichant la traduction d'une phrase au moment même où l'interlocuteur la termine, vous pouvez considérablement renforcer l'inclusivité de ces réunions

Christine Aubry, coordinatrice internationale pour le fabricant mondial de viennoiseries Brioche Pasquier, l'a expliqué plus en détail lors de DeepL Dialogues

Elle a souligné que des traductions plus rapides font passer les participants d'un mode passif à une participation active. Plutôt que d’essayer de comprendre ce que les autres disent dans une autre langue, ils se sentent sur la même longueur d'onde. Tout comme un locuteur natif de la langue, ils ont la possibilité d’intervenir, d’orienter la conversation et de participer activement

Une seconde ou deux font une énorme différence.

Par conséquent, la vitesse est une priorité absolue lors de la traduction de la parole en temps réel. Mais il est indispensable de trouver un équilibre entre la vitesse et d'autres priorités qui influencent tout autant l'expérience des utilisateurs. Les traductions doivent être aussi précises que possible afin d’éviter les malentendus et la confusion

Et dans la mesure du possible, les traductions doivent minimiser les « saccades », qui se produisent lorsqu'il faut corriger un texte déjà traduit parce que le sens a évolué entre-temps. Plus le taux de saccades est faible, plus il est facile pour une personne de suivre naturellement une conversation.

En quoi le langage parlé diffère du langage écrit, et pourquoi cela compte pour la traduction

Pour traduire avec précision la parole en direct, il est essentiel de comprendre les nombreuses différences entre les structures de la langue écrite et les rythmes de la parole.

Par exemple, la façon dont les gens parlent est beaucoup plus personnelle et moins uniforme que leur façon d'écrire. Ils emploient des tournures de phrases et des expressions familières distinctes qui peuvent provenir à la fois de dialectes régionaux, de leur propre personnalité ou de l'image qu'ils veulent renvoyer. 

De plus, les individus construisent et corrigent leurs phrases au fur et à mesure qu’ils parlent, ce qui entraîne des hésitations où un terme grammaticalement incorrect est immédiatement suivi d'un autre, plus correct. Reproduire ces éléments littéralement dans la traduction n'est d'aucune utilité pour l'auditeur qui tente d'en saisir le sens. 

Tout au long des conversations, les gens émettent également de courtes affirmations (comme « hmm-hmm ») pour rassurer l'interlocuteur et lui montrer qu'ils comprennent ou qu'ils sont d'accord. Ces éléments facilitent le déroulement de la conversation elle-même. En revanche, ils encombrent visuellement les traductions pour les personnes qui essaient de suivre dans une autre langue. 

Il est donc pertinent de filtrer ces éléments propres au langage parlé afin de ne pas saturer la traduction.

Gardez le contrôle de votre terminologie et de vos nuances grâce aux glossaires DeepL.

Comment DeepL Voice optimise à la fois la précision et la vitesse

Le défi devient encore plus captivant lorsque l'on réalise qu'une plateforme de traduction en temps réel ne traduit pas des phrases complètes. Elle doit traduire une phrase au moment où la personne l'exprime, alors que le sens de cette phrase n'est pas encore clair. 

Cela nous oblige à optimiser les traductions d’une manière légèrement différente. Nous ne recherchons pas seulement la traduction la plus précise. Nous voulons une traduction précise et suffisamment souple pour intégrer de nouvelles informations susceptibles de modifier l'orientation des propos tenus.

Voici un exemple. 

Imaginez que nous traduisions une réunion virtuelle dans laquelle l'un des participants parle anglais, et un autre suit ses propos grâce à des sous-titres en allemand. 

Notre interlocuteur anglophone interrompt la conversation pour dire : « I found it. » À ce stade, si l'on suppose qu'il s'agit d'une phrase complète, la meilleure traduction possible en allemand serait : « Ich habe es gefunden. » 

Cependant, s'agissant de la parole en direct, il est impossible de savoir avec certitude si la phrase est terminée ou non.

Dans ce cas, une meilleure option consisterait plutôt à utiliser une traduction telle que « Ich fand es ». Pourquoi ? Si l'interlocuteur anglophone poursuit en disant : « I found it frustrating », la traduction « ich fand es » est idéalement positionnée pour y ajouter simplement le mot « frustrierend ».

Si les trois premiers mots avaient été traduits par « Ich habe es gefunden », il aurait alors fallu corriger l'intégralité de la phrase. 

C'est précisément ce type de souci majeur qui empêche de suivre une conversation de manière intuitive. Et c'est le genre de problème que DeepL s'efforce de minimiser autant que possible.

Comment la place du verbe selon les langues façonne la traduction en temps réel

Une traduction vocale en temps réel précise implique un grand nombre de jugements contextuels de ce type, qui s'avèrent bien plus pertinents lorsque l'expertise humaine guide la technologie. Cette expertise inclut notamment la connaissance de l'endroit où les différentes langues ont tendance à placer les verbes essentiels au sens d'une phrase. 

Si le verbe apparaît au début de la phrase (comme en français ou en espagnol), il est possible d'afficher une traduction plus rapidement que s'il se trouve à la toute fin. 

Tout cela permet au système de marquer un temps d'arrêt juste assez long pour être précis, mais pas trop, afin de ne pas retarder inutilement la compréhension.

Découvrez les réussites de nos clients : les entreprises qui font confiance à l'IA linguistique de DeepL.

Comment l'expertise linguistique humaine rend DeepL Voice plus précis

Cette alliance entre l'expertise linguistique humaine et une traduction de haute précision permet déjà à DeepL Voice de transformer radicalement l'expérience des réunions et des conversations au sein des entreprises internationales. C'est notamment le cas de NEC Corporation, qui est devenue la première entreprise à déployer pleinement DeepL Voice, quelques semaines seulement après notre lancement officiel. 

L'enthousiasme suscité par DeepL Voice témoigne du fait qu'il s'agit d'un moment historique pour la traduction vocale. La capacité de décoder et de traduire les propos de vos collaborateurs en direct démultiplie la valeur que nous pouvons apporter aux entreprises internationales. Cela transforme la façon dont les équipes collaborent, renforce les relations professionnelles et garantit que les idées et perspectives de chacun soient toujours prises en compte. 

Les progrès accomplis jusqu'à présent marquent déjà un tournant majeur dans le fonctionnement quotidien des organisations. Et ce n'est que le début !

Partager