DeepL AI Labs
Mixhalo를 DeepL 플랫폼에 통합함으로써 대규모 실시간 음성-음성 번역 기능을 추가하는 데 그치지 않았습니다. 이는 Voice 분야에서 우리가 구축할 수 있는 영역의 지평을 넓히고 있습니다. 오디오 전송 속도를 제어하고 이를 제약 요인으로 삼지 않게 되면, 이전에는 불가능했던 것들이 빠르게 제품 로드맵으로 자리 잡을 수 있습니다.
양사의 팀은 모든 유형의 경험과 상호 작용에 활용할 수 있는 음성 언어 레이어를 함께 구축하고 있습니다. DeepL Voice API를 통해, 전 세계의 혁신가들이 모든 종류의 고객 및 청중 여정에 라이브, 실시간, 다국어 음성 기능을 구축할 수 있도록 지원하고 있습니다.
여기에는 골이나 터치다운을 설명하는 축구 해설자의 모든 감정을 담아내는 것, 의료 환경에서 비원어민들이 느끼는 고립감을 해소해 주는 즉시 이용 가능한 음성 경험, 스트레스와 좌절감을 없애기 위해 세심하게 설계된 고객 지원 전화 경험, 그리고 인간 통역사보다 훨씬 빠르게 번역된 음성을 전달하는 라이브 이벤트의 다국어 경험 등이 포함됩니다.
믹스할로(Mixhalo)의 공동 창립자 비크 싱(Vik Singh)과 DeepL Voice의 책임자 레오 도인(Leo Doin)은 다국어 오디오의 지연 시간을 줄이는 과제를 서로 보완적인 두 가지 방향에서 접근해 왔습니다. 믹스할로(Mixhalo)는 음악 산업에서 탄생했으며, 드럼 연주자가 스네어를 두드리는 소리를 수천 명의 팬으로 가득 찬 경기장으로 음파가 도달하는 속도보다 더 빠르게 스트리밍해 왔습니다. DeepL의 언어 모델은 다른 API로 전달할 필요 없이 엔드투엔드 방식으로 실시간 오디오 번역을 처리할 수 있어, 번역 지연 시간을 가능한 한 최저 수준으로 낮춥니다.
맞춤형 오디오 캡처 데몬, 맞춤형 네트워크 프로토콜, 실시간 오류 감지, 재생 속도를 위해 최적화된 오디오 엔진: 이러한 모든 기술적 혁신은 라이브 오디오 번역 경험을 더욱 최적화할 수 있는 시간과 여지를 만들어 줍니다. 여기에 언어 지능을 추가하면 번역에 가장 적합한 시기와 서로 다른 문법 구조를 가진 언어를 어떻게 동기화해야 할지 파악하는 모델을 통해 이러한 최적화가 즉시 이루어질 수 있습니다.
이상적인 실시간 번역 경험이란 번역된 오디오를 즉시 재생하는 것을 의미하지 않습니다. 각 언어의 작동 방식을 깊이 이해하는 AI를 통해 재생 속도를 지능적으로 조정하는 것이 핵심입니다.
이 모든 것이 콜센터의 실시간 음성-음성 번역에 통합되어 있습니다. 이는 DeepL Voice API의 가장 강력한 응용 분야 중 하나입니다. Vik과 Mixhalo 팀은 고객이 지원 담당자와의 유대감을 항상 느낄 수 있도록, 그리고 번역으로 인해 자신의 말이 제대로 전달되고 있다는 느낌이 훼손되지 않도록 이 기술을 개발하고 있습니다.
DeepL과 Mixhalo의 결합이 가져올 가장 큰 영향은 라이브 이벤트에서 느껴질 것입니다. 수천 명의 참석자와 수백 명의 연사가 참여하는 컨퍼런스에서, 모든 참가자는 행사장 전역에서 자신의 기기로 스트리밍되는 오디오를 통해 자신이 선호하는 언어로 아이디어를 공유하고 세션을 따라갈 수 있습니다.
바로 이러한 상황에서 실시간 다국어 Voice 레이어의 가치가 진정으로 드러납니다. 초저지연 오디오를 통해 참석자들은 이동 중에도 원하는 연사의 말을 들을 수 있습니다. 같은 회의실에 있지 않아도 세션을 따라갈 수 있습니다. 실시간 음성 번역 기능을 통해 모든 참가자는 감정과 미묘한 표현까지 고스란히 담긴, 자신이 가장 잘 이해하는 언어로 음성을 들을 수 있습니다. 또한 모든 연사가 자신이 구상한 아이디어를 자신이 구상한 언어로 공유할 수 있음을 의미합니다.
하지만 아마도 가장 놀라운 점은 이 모든 것이 이루어지는 속도일 것입니다. 라이브 이벤트 통역사가 사전에 준비하는 방식과 매우 유사하게, DeepL의 AI 모델이 기조 연설, 패널 토론 및 기타 연사 세션과 관련된 맥락을 포착하고 흡수할 수 있는 혁신적인 새로운 방법을 개발하고 있습니다. 이것이 AI의 뛰어난 처리 속도와 결합되면, 우리는 인간 통역사가 할 수 있는 것보다 훨씬 더 빠르게 실시간 음성-음성 번역을 생성할 수 있게 됩니다. 이는 다국어 콘텐츠 경험에 대한 기대치를 완전히 새롭게 재정의할 것입니다. 마치 미래에서 온 듯한, 심지어 마법 같은 느낌을 줄 것입니다. 그리고 이는 구두 의사소통이 이루어지는 방식에 대한 기대치를 변화시키기 시작할 것입니다.