DeepL AI Labs
실시간 음성 번역은 단순히 새로운 형태의 입력이나 출력을 사용하는 번역이 아닙니다. 이는 AI 연구에 있어 근본적으로 새롭고, 색다르며, 흥미로운 도전 과제입니다. 이는 번역의 우선순위를 바꾸고, 새로운 제약 조건을 도입하며, AI 모델에 새로운 형태의 판단과 의사 결정을 요구하는, 매우 색다른 형태의 사용자 경험을 제공하는 것을 목표로 합니다.
이것이 바로 리서치 매니저 Sascha Brinker와 리서치 과학자 Kristina Geißler가 DeepL Voice 연구팀의 일원으로서 맡고 있는 과제입니다. 이들은 실시간 음성 번역의 새로운 표준을 설정하기 위해 DeepL의 우수한 텍스트 번역 AI 모델을 발전시키는 그룹의 일원입니다. 이들은 현재 초기 성공을 발판으로, 다국어 실시간 음성 번역에 완전히 새로운 가능성을 열어줄 새로운 모델과 훈련 기법을 개발하고 있습니다.
우리는 DeepL의 기존 텍스트 번역 모델이 가진 품질과 문맥 이해 능력이라는 탄탄한 기반을 바탕으로 시작했습니다. Voice 팀은 이 모델을 배포하고, 번역 속도를 높이기 위해 추론 전략을 조정함으로써 초기 단계에서 중요한 성과를 거둘 수 있었습니다. 그 후, DeepL이 언어 쌍 간의 관계를 이해하는 능력을 활용하고 새로운 훈련 단계를 적용하여, 음성 번역 결과를 출력하기에 가장 적절한 시점을 파악할 수 있는 음성 전용 모델을 개발했습니다.
여기서 목표는 지연 시간과 번역 속도(사용자가 대화를 실시간으로 따라가고 참여하는 데 매우 중요함)와 정확성 및 안정성 사이에서 적절한 균형을 찾는 것입니다. 이러한 균형을 잘 잡음으로써 DeepL은 문장이 끝날 때까지 기다리지 않고도 번역할 수 있게 되었습니다. 동시에, 모델이 번역된 자막을 수정해야 할 때 발생하는 ‘깜빡임’ 현상도 최소화합니다. 이러한 요소들은 사용자 경험에 큰 차이를 만들어 냅니다.
텍스트 번역 모델을 개선하고 발전시킨 덕분에 우리는 큰 진전을 이루었습니다. 그 결과, Slator는 현재 DeepL을 실시간 음성 번역의 품질과 안정성 면에서 확실한 선두 주자로 평가하고 있습니다. 그러나 번역 전에 텍스트를 전사해야 하는 과정을 제거하면 더 빠르고 더 멀리 나아갈 수 있습니다. 현재 팀은 중간 텍스트 단계를 거치지 않고 오디오 입력에서 직접 번역된 음성 출력을 생성할 수 있는 모델을 구축하고 있습니다.
번역할 대화에 대한 더 많은 맥락, 즉 어떤 주제가 논의되고 있는지, 누가 논의하고 있는지, 그리고 그들이 사용할 가능성이 높은 구체적인 문구와 용어 등을 모델에 제공함으로써 더 큰 성과를 거둘 수 있습니다. 이는 최고 수준의 인간 통역사가 주요 행사나 회의 전에 수행하는 집중적인 훈련 과정을 상당 부분 재현한 것입니다. 그들과 마찬가지로, 이를 통해 우리 모델은 누군가가 말을 막 시작하려는 순간부터 그 사람이 말하려는 내용을 번역할 수 있게 됩니다.
이러한 새롭고 직접적인 음성-음성 변환 모델은 현재 음성 번역이 직면한 가장 중요한 제약 사항 중 일부를 해소합니다. 이를 통해 매우 흥미로운 새로운 가능성을 열어줍니다.
텍스트로 번역했다가 다시 음성으로 변환하는 과정이 필요하지 않으므로, 음성 번역이 전달되는 데 걸리는 시간을 몇 초나 단축할 수 있습니다. 실시간으로 음성을 따라가는 상황에서 이는 매우 중요한 속도 향상이며, 사용자 경험과 청중의 경험에 큰 영향을 미칠 것입니다.
그뿐만이 아닙니다. 오디오 입력을 직접 처리한다는 것은 사람들이 말하는 방식에 내재된 억양, 방언, 미묘한 뉘앙스를 감지하도록 모델을 훈련시킬 수 있음을 의미합니다. 추가적인 추론 시간과 더욱 풍부한 오디오 입력을 통해, 우리는 사람들이 말하는 내용의 감정과 더 깊은 의미를 포착하는 음성 출력을 생성할 수 있습니다.
AI를 통한 실시간 음성 번역의 미래는 단순히 속도가 빨라지는 것만이 아닙니다. 또한, 사람들이 말할 때 소통하는 다양한 수준을 더 많이 포착함으로써 더욱 인간적인 면모를 보여줄 것입니다. 이는 DeepL을 단순한 번역 엔진에서 실시간 음성 레이어로 변화시키고 있으며, 언어가 마찰의 원인이 되지 않도록 하여 가장 자연스러운 형태의 인간 의사소통을 가능하게 합니다.
이것이 바로 이 분야가 DeepL의 AI 연구에서 가장 흥미로운 분야 중 하나인 이유입니다.