기업용 언어 AI에 대한 신뢰 해독. Slator와의 대담

언어 기술 분야의 모든 RFP(제안 요청서)에는 “신뢰에 관한 질문”이 포함되어 있으며, 모든 공급업체는 이에 대한 훌륭한 답변을 내놓으려 애씁니다. 가동 6개월 만에 문제가 발생합니다. 데이터가 잘못된 관할권에 속해 있거나, 아무도 언급하지 않은 모델 업데이트 후 출력이 달라지거나, 비용이 예상치의 3배로 치솟기도 합니다. 단어 자체가 실패한 것은 아닙니다. 단지 ‘신뢰’나 ‘품질’이라는 단어가 회의실에 있던 사람마다 서로 다른 의미를 지녔을 뿐입니다.

최근 "The New Fluency" 팟캐스트 에피소드에서, Slator의 매니징 디렉터 플로리안 파에스와 컨설팅 총괄 알렉스 에드워즈는 기업 구매자들이 “신뢰”라고 말할 때 실제로 무엇을 의미하는지 자세히 설명했습니다.

1. 정확성에 대한 신뢰: 모두가 가장 많이 묻는 주제

정확성은 모든 신뢰 논의의 출발점입니다. 사실, 기준선이 이미 바뀌었기 때문에 이 부분에 시간을 할애하는 것은 가장 비효율적인 일입니다.

“4년 전만 해도 항상 ‘아, 이건 AI가 만든 거잖아. 100% 틀렸을 거야"라고 플로리안은 말했습니다. “AI 산출물에 대한 전반적인 신뢰도는 극적으로 높아졌습니다. 사람들은 AI를 더 폭넓게 신뢰하게 되었으며, 이는 AI 번역도 훨씬 더 폭넓게 신뢰한다는 것을 의미합니다.”

문제는 AI의 산출물이 특정 사용 사례에 충분히 정확한지 여부입니다. 의약품 라벨, 사용자가 작성한 제품 리뷰, 내부 참고용 요약본 등 각 사용 사례와 콘텐츠 유형마다 정확도에 대한 기준이 다릅니다.

특정 콘텐츠 유형을 명시하지 않는 구매자는 중요도가 낮은 콘텐츠에 대해 품질을 과도하게 높일 수도 있고, 실제로 중요한 부분에서는 요구 사항을 충분히 명시하지 못할 수도 있습니다.

2. 일관성에 대한 신뢰: 규제 대상 구매자의 진정한 문제

금융 서비스, 제약 및 법무 팀의 경우, 완벽한 정확성이 필수적이라는 전제가 깔려 있습니다. 더 어려운 질문은 알렉스가 다음과 같이 설명한 내용입니다:

"규제 대상 구매자와 대화할 때, 일관성과 신뢰성에 대한 강조가 더 두드러질 수 있습니다. 제공하는 내용이 일관되고 신뢰할 수 있을 것이라는 확신을 갖는 것이 아마도 해당 고객들에게 더 큰 관심사일 것입니다."

따라서 문제는 결과물이 아니라 시스템 자체에 더 초점이 맞춰지게 됩니다. 2분기에 귀사에 알리지 않고 모델을 업데이트한 공급업체는 규제 당국에 제출할 자료에 있어 신뢰할 수 없는 업체입니다.

3. 보안 신뢰: 정보 보안 검토 과정에서 거래를 무산시키는 문제

데이터를 확보한 후, 그 데이터는 어디에 저장됩니까? 누가 볼 수 있나요? 알렉스가 다음과 같이 지적했습니다:

"현지화된 콘텐츠가 사람에 의해 제작되었는지, 아니면 그렇지 않은지에 대한 신뢰 — 이러한 투명성을 고객에게 제공하는 것은 감사 가능성과 보안 조치만큼이나 중요합니다. 이는 데이터가 어디에 저장되고 어떻게 처리되는지와 더불어 신뢰 형성에 중요한 요소입니다."

이 요구사항은 종종 늦게야 드러납니다. 기능 평가가 완료되고 이해관계자들의 의견이 조율된 후, 정보보안(InfoSec) 담당자가 RFP에 포함시킬 생각조차 하지 못했던 한 가지 질문을 던집니다. 이제 AI 공급업체들은 이전에는 온프레미스 환경이나 엄격하게 제한된 LSP(언어 서비스 제공업체) 관계 내에서 처리되던 콘텐츠를 다루게 되었습니다. 이로 인해 노출 위험이 증가하며, EU, 미국 및 APAC의 데이터 요구 사항이 명확하게 일치하지 않습니다.

4. 신뢰의 확장: “데모에서는 잘 작동한다”는 것이 보장은 아닙니다

"사람들은 AI 번역이 대규모로도 제대로 작동한다고 믿을 수 있어야 합니다. 단순한 장난감이 아니며, 데모나 시범 프로젝트에서만 작동하는 것이 아니라, 수백만 단어를 처리할 때도 실제로 작동한다는 점을 신뢰해야 합니다. 따라서 실제 운영 환경에서는 제대로 작동하지 않을 수도 있습니다."

플로리안은 구매자들이 흔히 간과하는 비용 측면을 언급했습니다.

“첫 달에 클로드(Claude) 토큰에 150만 달러를 지출한 기업들의 사례를 들어본 적이 있습니다.”

이것 자체만으로는 공급업체의 실패라고 할 수 없습니다. 이는 대규모 신뢰 실패입니다. 구매자가 계약을 체결하기 전에 실제 처리량 기준으로 비용 모델에 대한 부하 테스트를 수행하지 않았기 때문입니다.

5. 결과 신뢰: 대부분의 구매자가 완전히 간과하는 요건

"많은 기업 구매자들이 품질이 후속 프로세스에 어떤 영향을 미치는지 고려하기 시작했습니다. '번역된 웹사이트의 전환율은 얼마인가? 이는 품질이 미치는 영향을 실제로 측정할 수 있는지에 관한 문제입니다. 품질과 비즈니스 성과 간의 영향 및 관계를 이해하기 위해서입니다.”

대부분의 기업 구매 담당자들은 출력 품질 지표(MTQE 점수, 검토 패널 등)를 기준으로 언어 AI를 평가합니다. MTQE 점수, 검토 패널 등입니다. 하지만 번역 품질의 차이가 실제로 비즈니스 성과에 영향을 미치는지 측정하는 경우는 드뭅니다. 그들이 더 면밀히 살펴봐야 할 것은 모국어 사용자와 번역된 언어를 사용하는 사용자 간의 전환율, 지원 문의 감소율, NPS 격차입니다.

지금 이러한 측정 인프라를 구축하는 구매 담당자야말로 대리 지표가 아닌 실제 신호를 바탕으로 공급업체를 선정할 수 있게 될 것입니다.

"신뢰도 용어에서 정확도는 거의 모든 사람이 기본 기준으로 삼고 있습니다,"라고 알렉스는 말했습니다. "하지만 누구와 이야기하느냐에 따라 다릅니다."

바로 그게 문제입니다! 모든 공급업체는 품질에 대한 질문에 정확도 수준에서 답합니다. 그게 바로 그들에게 주어지는 질문이기 때문입니다. 나머지 네 가지 요구사항은 생산 과정에서 드러날 때까지 프레젠테이션 자료 속에 답이 없는 채로 남아 있습니다.

해결책은 더 나은 제안 요청서(RFP)가 아닙니다. 해결책은 조직이 이 다섯 가지 신뢰 지표 중 어떤 것을 절대 타협하지 않을지 파악하는 것입니다.

전체 에피소드를 시청하세요!

플로리안, 알렉스, 모라나가 실험, 품질 프레임워크, 그리고 향후 몇 년간 현지화 업계가 실제로 어떤 모습을 보일지에 대해 더 깊이 있게 다룹니다. YouTube에서 전체 에피소드 시청하기:Slator의 알렉스 에드워즈(Alex Edwards)와 플로리안 파에스(Florian Faes)와 함께 AI 시대의 번역 품질 정의하기더 듣고 싶으신가요? 저희 유튜브에서 The New Fluency 시즌 1 전체를 확인해 보세요. 연간 790억 단어를 어떻게 현지화할까요? Booking.com의 미크 샤이나와 함께합니다.

AI 우선 현지화 프로세스 설계 – Trusted Shops의 클라우디아 뮐러와 함께 제품 마인드로 복잡성의 병목 현상 극복하기 – Maxon의 올가 스토코비에츠와 함께 빠르게 출시하고, 더 빠르게 번역하기 – GitLab의 마리아 호세 살메론 이바녜스와 함께

다양한 문화권에서 브랜드 구축하기, CMO이자 저자인 캐서린 멜키오르 레이와 함께

확장 단계에 있는 조직을 위한 현지화 엔진 구축, 리이나 톨로넨(headout)과 함께

공유