여전히 번역 품질을 신경 써야 할까요?

어떤 AI 번역 서비스의 품질에 관해 묻는다면, 대개 가장 먼저 제시되는 것은 숫자입니다. 보통 100점 만점의 점수로, 표준화된 번역 품질 평가 지표 중 하나를 사용해 산출됩니다. 이러한 점수는 어떤 서비스가 ‘최고’인지 단순하고 객관적으로 보여주는 결정적인 기준처럼 보입니다. 그리고 대부분은 여러분에게 해당 점수를 제시하는 제공업체의 서비스가 가장 높은 순위를 차지하고 있을 것입니다. 수십 년 동안 ‘데이터가 왕이다’라는 말이 반복되어 온 지금, 우리는 이제 데이터를 어떤 기준으로 해석하느냐에 따라 전혀 다른 이야기를 들려줄 수 있다는 사실을 알고 있습니다.

솔직히 말씀드리겠습니다. DeepL에 번역 품질에 대해 물어본다면, 저희 역시 숫자로 답할 것입니다. 지난 3월, DeepL은 언어 전문가들을 대상으로 48,000건의 블라인드 테스트를 진행했으며 심층적인 품질 벤치마킹 분석 결과를 여러분과 공유할 예정입니다. 이 분석 결과, DeepL은 16개 언어 쌍과 가장 강력한 LLM을 포함한 5개의 주요 경쟁사 모두를 제치고 테스트 그룹의 94%에서 1위를 차지했습니다. 이 결과를 자신 있게 말씀드리는 데 주저하지 않겠습니다.

하지만 AI 번역 업계에서는 누구도 인정하고 싶어 하지 않는 사실이 하나 있습니다. 이는 테스트 결과가 발표될 때마다 드러나지 않는 불편한 진실입니다. 바로 번역 품질의 격차가 점점 좁아지고 있다는 것입니다. 실제로 그 격차는 너무 작아져서 번역 품질 자체가 더 이상 중요하지 않다고 주장하는 사람들도 있습니다.

현재 대부분의 AI 번역은 일반적인 텍스트를 훌륭하게 번역합니다. 비전문가가 언뜻 보고 알아차릴 만한 오류는 거의 없습니다. 서비스 간 차이는 미미하고 미묘하며 상당히 주관적입니다. 시중에 다양한 순위표가 존재하고, 주요 모델마다 자신이 우위를 차지한 평가 결과를 어렵지 않게 찾을 수 있는 것도 이 때문입니다.

그렇다면 AI 번역 서비스 제공업체를 선택할 때 여전히 품질을 차별화 요소로 고려해야 할까요? 제 답은 ‘그렇다’이지만, 테스트 점수로 측정된 품질 자체에만 집중해서는 안 됩니다.

표준화된 품질 테스트에서 AI 번역이 보여주는 성능과, 실제 조직 및 콘텐츠에서 실제로 AI 번역이 발휘하는 성능 사이에는 점점 더 큰 간극이 생기고 있습니다. 테스트에서는 품질 차이가 미미해 보일 수 있습니다. 실제 비즈니스 환경에서는 그 차이가 훨씬 더 크게 나타나며, 비즈니스 성과에도 매우 실질적인 영향을 미칩니다.

AI 번역 품질 테스트가 측정하는 것

앞서 말씀드린 내용을 더 명확히 설명하기 위해, 표준화된 품질 테스트가 실제로 무엇을 어떻게 측정하는지, 그리고 무엇보다 측정 대상에서 무엇이 빠져 있는지 자세히 살펴보겠습니다.

인간 언어 전문가가 번역 품질을 평가할 때는 일반적으로 번역 품질을 8가지 차원으로 나누어 평가하는 MQM(Multidimensional Quality Metrics, 다차원 품질 측정 지표) 프레임워크를 사용합니다. 각 차원에 평가 지표와 가중치를 적용하면, 번역 품질을 하나의 수치로 나타내는 평가 체계를 만들 수 있습니다.

MQM은 원문의 의미가 도착 언어에 얼마나 정확하게 전달되었는지 평가하는 정확도, 번역문이 도착 언어에서 얼마나 자연스럽게 읽히는지를 평가하는 유창성, 도메인별 전문 용어의 적절한 사용, 스타일의 일관성, 현지 관례 준수 여부 등 다양한 요소를 평가합니다.

다양한 번역 품질 평가 지표의 의미

전문가가 번역물을 평가하는 작업은 복잡하고 비용이 많이 듭니다. 실제로 AI 서비스 제공업체에 부여되는 번역 품질 순위 중 상당수는 인간의 평가를 전혀 거치치 않고, 다음과 같은 자동화된 품질 평가 지표를 사용합니다. 수년에 걸쳐 이러한 시스템은 꾸준히 발전해 왔습니다.

  • 2001년, IBM은 BLEU(Bilingual Evaluation Understudy)를 도입했습니다. 이 시스템은 기계번역이 동일한 원문에 대한 인간 번역과 얼마나 일치하는지를 측정합니다. 문제는 무엇일까요? 이 시스템은 기준 번역이 최상의 번역이라고 가정하고, 기준 번역과 다른 부분은 모두 오류로 간주합니다.
  • 2006년에는 이 방식이 TER(Translation Edit Rate) 평가에 적용되었는데, 이 평가는 기계 번역문을 인간 번역문과 일치시키기 위해 얼마나 많은 수정이 필요한지 측정합니다. BLEU와 비슷하지만, 이 시스템에서는 점수가 낮을수록 더 좋은 결과를 의미합니다.
  • 2020년 Unbabel은 COMET(Crosslingual Optimized Metric for Evaluation of Translation)을 출시했으며, 신경망 모델을 사용하여 기계번역을 인간 번역 및 원문과 비교합니다. 이 지표는 BLEU나 TER와는 달리 원본 텍스트를 참조하여 의미를 파악하려 시도합니다.
  • 2023년 GEMBA(GPT Estimation Metric Based Assessment)가 출시되면서 자동 평가는 LLM 시대로 접어들었습니다. GEMBA는 LLM이 번역에 다양한 MQM 지표를 적용하여 그 성능을 판단하도록 유도합니다.

자동 번역 평가는 점점 더 유용해지고 있지만, 여전히 인간 전문가의 판단을 완전히 대체하지는 못하고 있습니다. LLM에 품질 평가를 맡길 경우, 정확도가 다소 떨어지더라도 자체 모델이 생성한 번역물을 일관되게 선호하는 편향이 나타날 수 있습니다. 이는 부분적으로 번역 품질 평가에 주관적인 판단이 개입될 수밖에 없기 때문이기도 합니다. 결국 AI 모델은 자신이 제출한 번역 과제를 채점하면서, 자신의 답이 가장 우수하다고 판단하는 셈입니다.

자동 평가에 관한 연례 컨퍼런스의 10회째 행사인 WMT25에서는 이에 대해 매우 명확한 결론을 내렸습니다. “자동 평가 지표에서 1위를 차지한 시스템들이 인간 평가에서는 일관되게 우위를 보이지는 않았는데, 이는 지표에 여전한 편향이 존재함을 나타내며 번역 품질에 대한 최종 판단에는 여전히 인간의 평가가 필요함을 다시 한번 확인시켜 줍니다.”

다시 말해, 번역 품질을 제대로 평가하려면 결국 인간 전문가의 판단이 필요합니다. DeepL이 자체 벤치마크 테스트에 인간 전문가의 블라인드 평가를 활용하는 것도 이 때문입니다. AI 번역 품질 간의 격차가 점점 좁아지는 상황에서는 다양한 요소를 종합적으로 판단하는 인간의 전문성이 더욱 중요해지고 있습니다. 이제 품질 차이는 더 이상 명백하지 않습니다. 적어도 표준화된 품질 테스트만 놓고 보면 그렇습니다.

번역 품질 테스트가 간과하는 요소: 문맥, 결정론, 일관성

하지만 앞서 언급했듯이, 테스트에서 측정된 번역 품질은 실제 환경에서 경험하는 번역 품질과 동일하지 않습니다. 특히 복잡한 조직 전반의 번역과 현지화를 관리하는 담당자의 경우에는 더욱 그렇습니다. 사실, 테스트에서 측정하지 못하는 번역 품질의 요소들이 비즈니스에 가장 큰 영향을 미칩니다.

이 글에서 살펴본 대부분의 프레임워크와 채점 시스템은 ‘분석적’ 방식에 기반합니다. 이러한 프레임워크와 채점 시스템은 원문과 번역문을 ‘세그먼트’(대개는 개별 문장)로 나누어 비교하고 평가합니다. 이 과정에서 각 문장은 전체 텍스트 내 다른 문장들과는 별개인 것처럼 독립적으로 평가되는 경우가 많습니다.

번역된 콘텐츠를 소비하는 우리의 실제 경험은 이와 전혀 다릅니다. ‘전체론적’이기 때문입니다. 지금 읽고 있는 문장뿐만 아니라, 그 문장이 포함된 전체 콘텐츠의 맥락 속에서 번역을 받아들입니다. 또한 여기에는 해당 조직에서 접하는 다른 모든 커뮤니케이션도 포함됩니다. 이러한 전체론적인 관점에서 보면, 개별 문장의 번역 품질보다 번역된 콘텐츠 전체가 얼마나 일관되고 논리적으로 연결되는지가 더 중요할 수 있습니다.

모든 조직에는 제품과 기능, 비즈니스 분야, 서비스 측면, 전략적 개념 등에 대한 고유한 어휘, 즉 용어와 구문이 있습니다. 이러한 용어를 일관되게 번역하는 것은 번역 품질을 결정하는 매우 중요한 요소입니다. 예를 들어, 고객센터의 번역이 제품에 사용된 용어나 CTA 버튼 용어와 일치하지 않는다면, 개별 번역이 기술적으로 정확하더라도 전체 번역 품질은 높다고 할 수 없습니다.

AI 번역 플랫폼이 용어, 스타일 및 어조를 대규모로 적용할 수 있다면 그 가치는 엄청나게 높아집니다. DeepL이 용어집, 스타일 규칙, 번역 메모리를 통해 이러한 일관성을 구현하는 것도 바로 이 때문입니다. 반면, 대규모 범용 LLM(Claude, Gemini, ChatGPT)의 근본적인 확률적 특성은 결정론, 규정 준수 및 일관성을 보장하기 어렵습니다. 실제 환경에서 번역 품질을 좌우하는 핵심 요소를 놓칠 수 있기 때문입니다.

번역 품질 테스트가 간과하는 점: 품질을 달성하는 방식

표준화된 번역 품질 테스트는 높은 품질이 어떻게 달성되는지, 그리고 해당 방식이 실제로 얼마나 높은 확장성을 가졌는지까지는 고려하지 않습니다.

DeepL이 전문 번역가를 대상으로 실시한 블라인드 테스트에 따르면, 최신 범용 LLM은 높은 추론 설정에서 특정 언어 쌍에 대해 경쟁력 있는 번역 품질을 제공할 수 있는 것으로 나타났습니다. 그러나 이를 위해서는 더 큰 모델, 더 광범위한 작업 영역, 더 넓은 문맥 창을 활용해야 합니다. 

이는 많은 토큰을 소비하여 비용 예측이 어려워지며 처리 시간도 훨씬 더 오래 걸린다는 것을 의미합니다. 실제 최소 4배에서 최대 29배까지 더 느려질 수 있습니다. API를 통해 제품에 AI 번역을 적용하는 경우, 이 차이는 큰 영향을 미칩니다. 품질 측면에서 가장 중요한 점은, 이러한 모델들이 선택하는 번역 결과가 본질적으로 예측하기 어렵다는 것입니다. 본질적으로 각 작업마다 번역 휠을 새로 고안하기 때문에, 한 문맥에서 사용된 용어나 구문이 다른 문맥에서 동일하게 유지될 가능성은 훨씬 낮습니다. 

기업 규모로 번역을 운영한다면, 특히 품질 측면에서 이 부분에 주목해야 합니다. 일반적인 품질 테스트 점수만으로는 이러한 차이를 거의 파악할 수 없습니다.

고객에게 주도권을 제공하는 포괄적인 품질 평가를 개발하는 이유

이러한 이유로 자동화된 테스트 점수만으로는 번역 품질을 판단하는 데 한계가 있습니다. 그러나 자동화된 테스트 점수가 번역 품질을 관리하는 데 있어 전혀 유용하지 않다는 의미는 아닙니다. 그 역할을 다르게 정의한다면, 사실 이 점수들은 매우 가치 있는 도구가 됩니다.

DeepL은 DeepL 번역의 품질을 평가하기 위해 특별히 설계된 AI 모델을 사용하는 새로운 번역 품질 평가(TQE) 모델을 구축했습니다. 하지만 무엇보다 중요한 점은, 이 모델이 단순히 번역에 대한 ‘점수’를 매기는 데 그치지 않는다는 것입니다. 이 모델은 잠재적인 오류와 전문 번역가의 검토를 통해 개선될 수 있는 부분을 강조합니다. 최종적으로 중요한 것은 인간의 판단이라는 원칙을 바탕으로 설계되었기 때문입니다.

TQE 모델이 텍스트를 분석할 때는 사용자가 DeepL에서 사용하는 모든 맞춤 설정 기능을 함께 고려합니다. 번역 품질을 독립적으로 분석하는 것이 아닌, 기업의 용어, 스타일, 어조가 해당 문맥에 어떻게 적용되었는지 확인합니다. 이를 통해 실제 환경에서 진정으로 중요한 품질에 대한 종합적인 관점을 제공합니다.

번역 품질이 중요하다면, (그리고 저는 여전히 그렇게 생각해야 한다고 믿습니다) 바로 이러한 관점에 주목해야 합니다. 중요한 것은 단순한 테스트가 아닙니다. 실제 콘텐츠와 비즈니스 환경에 적합하고, 일관되게 적용할 수 있는 번역 품질을 갖추는 것이 핵심입니다.

TQE를 사용하여 번역 품질을 평가하고 싶으신가요? DeepL AI Labs에서 자세한 내용과 TQE 테스트 환경에 참여할 수 있는 방법을 확인해 보세요.

공유