DeepL Voice가 실시간 음성 번역의 고유한 과제를 어떻게 해결하는지

핵심 사항
- 실시간 음성 번역은 속도, 정확성, 그리고 불완전한 문장을 처리할 수 있는 능력을 요구하는데, 이는 텍스트 번역에서는 겪지 않는 과제들입니다.
- 음성 언어는 말더듬, 구어체 표현, 짧은 동의 표현 등을 포함하며, 이러한 요소들은 문자 그대로 번역하기보다는 필터링되어야 합니다.
- 음성의 속도에 가까워지면 회의 참가자들은 수동적인 청취자에서 적극적인 참여자로 변모합니다.
- DeepL Voice는 문장 도중 새로운 정보를 흡수할 수 있는 유연한 번역을 생성하여 "번역의 끊김"을 최소화합니다.
- DeepL Voice가 언어 간 동사 위치, 문장 구조, 문맥 판단을 처리하는 방식은 인간의 언어학 전문 지식을 바탕으로 합니다.
- DeepL은 DeepL Voice가 실제 의사소통의 우선순위를 반영할 수 있도록 비즈니스 및 언어학 전문가들과 협력했습니다.
- NEC Corporation은 DeepL Voice 출시 후 이를 전면 도입한 최초의 기업이 되었습니다.
- Voice, 번역기, Write를 포함한 DeepL의 언어 AI 제품군은 글로벌 기업들에게 명확한 의사소통을 위한 도구를 제공합니다.
People don’t speak the same way they write. 또한 사람들은 이메일이나 기사를 읽는 것과 같은 방식으로 대화를 경험하지도 않습니다.
말하는 순간 서로를 이해하는 능력, 즉 모든 종류의 언어적, 비언어적 의사소통을 종합하여 상대방의 의도를 즉시 파악하는 능력은 인간 표현의 고난도 묘기입니다.한 걸음 물러서서 대화에서 일어나는 일을 생각해보면, 우리가 얼마나 많은 정보를 얼마나 빠르게 전달하는지 놀라울 정도입니다.
한 걸음 물러서서 대화에서 일어나는 일을 생각해보면, 우리가 얼마나 많은 정보를 순식간에 전달하는지 놀라울 따름입니다.
DeepL이 DeepL Voice 솔루션을 통해 그랬던 것처럼, 말하는 상호작용을 실시간으로 번역하는 작업을 스스로에게 맡기면, 음성 언어 번역이 텍스트 번역과 어떻게 다른지에 대한 온갖 흥미로운 통찰력을 발견하게 됩니다.
이 글에서는 그러한 통찰 중 일부를 공유하고, 이를 통해 회의와 대화의 경험을 어떻게 변화시키고 있는지 설명해 드리겠습니다.
실시간 음성 대 음성 번역이 현실이 되었습니다: DeepL Voice가 이를 어떻게 가능하게 하는지 알아보세요.
실시간 음성 번역이 텍스트 번역보다 어려운 이유
순간적이고 대화형인 소통은 본질적으로 인간적인 특성이며, 기술이 이를 재현하기는 매우 어렵습니다—심지어 AI처럼 진보된 기술이라 해도.
비즈니스용 솔루션을 만들고 싶다면, 먼저 관련된 과제들을 깊이 이해해야 합니다.
이러한 과제에는 사람들이 말을 끝내기 전에 무슨 말을 할지 예측하는 인간의 능력을 재현하는 것이 포함됩니다.
실시간 상황에서 음성을 번역할 때는, 상대방의 말이 다른 언어로 어떻게 표현되는 것이 가장 적절한지 예측해야 합니다. 중요한 점은, 긴 시간 지연을 피하기 위해 원문 문장이 어떻게 끝날지 확실히 알기 전에 이 작업을 수행해야 한다는 것입니다.
여기서 어려운 점은 몇 단어에 대한 정확한 번역으로 보이는 것이, 상대방이 문장을 끝마친 후에는 부정확한 번역으로 판명될 수 있다는 것입니다.
DeepL Voice를 개발하기 시작했을 때, 우리는 기술만으로는 고품질의 실시간 음성 번역을 달성할 수 없다는 것을 알고 있었습니다. 이는 언어가 작동하는 다양한 방식에 대한 깊은 관심과 이해에 달려 있습니다.
그렇기 때문에 우리는 구어 대화와 관련된 언어학 전문가들을 한데 모았습니다. 또한 DeepL이 보유한 다양한 언어의 작동 방식에 대한 강력한 문맥 이해 능력을 활용했습니다.
또한, 비즈니스들과 협력하여 그들의 우선 순위와 그들에게 가장 큰 가치를 창출하는 음성 번역 경험을 탐구했습니다.
DeepL AI가 어떻게 번역을 혁신하여 진정한 국경 없는 비즈니스를 가능하게 하는지 알아보세요.
실시간 음성 번역에서 속도가 최우선인 이유
우리가 얻은 첫 번째 통찰 중 하나는 타이밍이 모든 것을 좌우한다는 점 회의나 대화의 실시간 번역에 있어서는 특히 그렇다는 것입니다.
말하는 속도에 근접하여—화자가 말을 마치기 전에 문장의 번역 결과를 표시할 수 있다면—그 회의가 얼마나 포용적인 공간이 될 수 있는지에 큰 영향을 미칠 수 있습니다.
글로벌 제과 제조업체 브리오슈 파스키에(Brioche Pasquier)의 국제 코디네이터인 크리스틴 오브리는 DeepL Dialogues<3>에서 이에 대해 더 자세히 설명했습니다.
그녀는 더 빠른 번역이 사람들의 태도를 수동적인 참여에서 능동적인 참여로 전환시킨다고 언급했다. 다른 언어로 하는 다른 사람들의 말을 따라가기 위해 애쓰기보다는, 대화에 완전히 동참하고 있다는 느낌을 받게 됩니다. 모국어를 사용하는 사람처럼, 그들은 대화에 끼어들고, 대화의 흐름을 주도하며, 적극적으로 참여할 기회를 갖게 됩니다.
1초 정도의 차이가 엄청난 차이를 만듭니다.
따라서 실시간 음성을 번역할 때 속도는 최우선 순위입니다. 그러나 속도와 사람들의 경험에 큰 영향을 미치는 다른 우선 순위들 사이의 균형을 맞춰야 합니다. 오해와 혼동을 피하기 위해 번역은 가능한 한 정확해야 합니다.
또한 가능한 경우, 의미의 변화로 인해 이전에 번역된 텍스트를 수정해야 할 때 발생하는 "깜빡임"을 최소화해야 합니다. 깜빡임 현상이 적을수록 사용자는 대화를 자연스럽게 따라가기 쉽습니다.
음성 언어와 문어의 차이점, 그리고 이것이 번역에 중요한 이유
실시간 대화를 정확하게 번역하려면 문어의 패턴과 음성의 리듬 사이의 많은 차이점을 이해하는 것이 중요합니다.
예를 들어, 사람들이 말하는 방식은 글쓰기 방식보다 훨씬 더 개인적이고 일관성이 적습니다. 사람들은 지역 방언이나 개개인의 성격, 자아상에서 비롯된 독특한 표현과 구어체를 사용합니다.
또한, 사람들은 말하면서 문장을 구성하고 수정하기 때문에, 문법적으로 틀린 단어가 더 올바른 단어 바로 뒤에 이어지는 유창하지 못한 표현이 나오기도 합니다. 이러한 현상을 번역에서 문자 그대로 재현하는 것은 의미를 이해하려는 사람에게 도움이 되지 않습니다.
대화를 하는 동안 사람들은 상대방의 말을 이해하거나 동의한다는 것을 알리기 위해 짧은 확인의 말(예: "네")을 하기도 합니다. 이는 대화의 흐름을 원활하게 하는 데 도움이 됩니다. 그러나 이는 다른 언어로 대화를 따라가려는 사람들에게는 번역문을 복잡하게 만듭니다.
번역에서 이러한 음성 언어 요소를 걸러내는 것이 도움이 됩니다.
DeepL 용어집으로 용어와 뉘앙스를 완벽하게 관리하세요.
DeepL Voice가 정확성과 속도를 동시에 최적화하는 방법
실시간 번역 플랫폼이 완전한 문장을 번역하는 것이 아니라는 점을 고려하면 이 과제는 더욱 흥미로워집니다. 누군가가 말을 하는 동안, 그 문장의 최종적인 의미가 아직 명확하지 않은 상태에서 문장을 번역해야 하기 때문입니다.
이를 위해서는 약간 다른 방식으로 번역을 최적화해야 합니다. 우리는 단순히 가장 정확한 번역만을 원하는 것이 아닙니다. 우리는 사람들이 말하는 내용의 방향을 바꿀 수도 있는 새로운 정보를 반영할 수 있을 만큼 유연한 정확한 번역을 원합니다.
예를 들어 보겠습니다.
한 참가자가 영어로 말하고, 다른 참가자가 독일어 자막을 통해 그 말을 따라가는 가상 회의를 번역한다고 상상해 보세요.
영어를 사용하는 참가자가 대화를 중단하고 "I found it."이라고 말합니다. 이 문장이 완전한 문장이라고 가정할 경우, 가장 적절한 독일어 번역은 "Ich habe es gefunden"이 될 것입니다.
그러나 이것은 실시간 음성 대화이므로, 문장이 완전한지 아닌지 확신할 수 없습니다.
이 경우, “Ich fand es”와 같은 번역을 사용하는 것이 더 나은 선택일 수 있습니다. 그 이유는 무엇일까요? 영어를 사용하는 사람이 이어서 “I found it frustrating”이라고 말할 때, “ich fand es”라는 번역은 단순히 “frustrierend”라는 단어를 덧붙이기만 하면 완벽하게 어울립니다.
만약 처음 세 단어를 “Ich habe es gefunden”으로 번역했다면, 번역문 전체를 수정해야 할 것입니다.
이것이 바로 대화를 직관적으로 따라가는 데 방해가 되는 주요한 “불일치”의 유형입니다. 그리고 이것이 바로 DeepL이 가능한 한 최소화하고자 하는 문제 유형입니다.
언어 간 동사 위치가 실시간 번역에 미치는 영향
정확한 실시간 음성 번역에는 인간의 전문 지식이 기술을 이끌 때 가장 효과적으로 이루어지는 광범위한 맥락적 판단이 수반됩니다. 이러한 전문 지식에는 문장의 의미에 중요한 동사가 각 언어에서 어디에 위치할 가능성이 높은지에 대한 통찰력이 포함됩니다.
동사가 문장의 시작 부분에 오는 경우(프랑스어와 스페인어 등), 동사가 문장의 끝에 오는 경우보다 더 빠르게 번역을 표시할 수 있습니다.
이 모든 것이 시스템이 정확성을 확보하기에 충분한 시간만큼만 일시 정지하고, 불필요하게 이해를 지연시키지 않도록 돕습니다.
DeepL 고객사의 성공 사례를 읽어보세요: DeepL의 언어 AI를 신뢰하는 기업들.
인간의 언어학 전문 지식이 DeepL Voice의 정확도를 높이는 이유
이러한 인간의 언어학 전문성과 매우 정확한 번역의 결합 덕분에 DeepL Voice는 회의 및 대화의 경험을 국제 비즈니스 기업들에게 획기적으로 변화시키고 있습니다.
이러한 비즈니스에는 일본의 다국적 정보기술 및 전자 기업인 NEC Corporation이 포함됩니다. 이 기업은 DeepL Voice가 출시된 지 불과 몇 주 만에 이를 전면 도입한 최초의 기업이 되었습니다.
DeepL Voice에 대한 열광은 이것이 음성 번역의 획기적인 순간임을 반영합니다. 사람들이 말하는 내용을 말하는 즉시 해독하고 번역할 수 있는 능력은 국제 비즈니스를 위해 우리가 창출할 수 있는 가치를 배가시킵니다.
이는 팀의 협업 방식을 변화시키고, 더 강력한 관계를 구축하며, 다양한 아이디어와 관점이 항상 반영되도록 보장합니다.
지금까지 이룬 발전은 이미 조직의 운영 방식에 큰 변화를 가져오고 있습니다. 앞으로 더 많은 발전이 있을 것입니다!