Разобраться в вопросах доверия к языковому ИИ в сфере корпоративных языковых решений. Беседа со Slator

В этой статье
- 1. Доверие к точности: Именно об этом спрашивают все
- 2. Доверие к согласованности: реальная проблема заказчиков, подпадающих под регулирование
- 3. Доверие к безопасности: вопрос, который срывает сделки на этапе проверки информационной безопасности
- 4. Масштабируемое доверие: «в демо-версии всё работает» — это не гарантия
- 5. Доверие к результатам: требование, которое большинство покупателей полностью игнорируют
- Посмотрите полный выпуск!
В каждом запросе предложений в сфере языковых технологий присутствует «вопрос о доверии», и каждый поставщик стремится дать на него убедительный ответ. Через шесть месяцев после запуска в эксплуатацию что-то выходит из строя. Данные оказываются в неправильной юрисдикции, результаты меняются после обновления модели, о котором никто не упомянул, а затраты в три раза превышают прогноз. Дело не в том, что слова подвели вас; просто слова «доверие» или «качество» означали что-то разное для каждого из присутствующих.
В недавнем выпуске подкаста «The New Fluency» управляющий директор компании SlatorФлориан Фаес и руководитель отдела консалтинга Алекс Эдвардс подробно рассмотрели, что на самом деле имеют в виду корпоративные заказчики, когда говорят о «доверии».
1. Доверие к точности: Именно об этом спрашивают все
Точность — это точка отсчёта любого разговора о доверии. И на самом деле это наименее полезное направление, на которое стоит тратить время, поскольку базовые стандарты уже изменились.
«Четыре года назад все говорили: „О, это сделано с помощью ИИ. Здесь наверняка 100 % ошибок», — сказал Флориан. «Общий уровень доверия к результатам работы ИИ резко вырос. Люди просто стали доверять ИИ в целом, а это означает, что они гораздо шире доверяют и машинному переводу».
Вопрос заключается в том, достаточно ли точны результаты работы ИИ для конкретных случаев использования. Этикетка на лекарственном препарате, отзыв о продукте, написанный пользователем, и внутреннее краткое содержание — для каждого конкретного случая использования и типа контента установлены свои пределы допустимой погрешности.
Заказчики, не указывающие конкретный тип контента, могут в итоге уделять чрезмерное внимание качеству контента с низкой степенью важности или, напротив, упускать важные аспекты там, где это действительно имеет значение.
2. Доверие к согласованности: реальная проблема заказчиков, подпадающих под регулирование
Для финансовых служб, фармацевтических и юридических подразделений потребность в абсолютной точности считается само собой разумеющейся. Более сложный вопрос сформулировал Алекс следующим образом:
«При общении с заказчиками из секторов, подпадающих под регулирование, акцент, возможно, делается в большей степени на согласованность и надежность. Уверенность в том, что предоставляемый вами контент будет последовательным и надежным, вероятно, является более важной заботой для таких клиентов».
Таким образом, вопрос касается в большей степени самой системы, а не конечного результата. Поставщик, который обновил свою модель во втором квартале, не уведомив вас об этом, — это поставщик, которому нельзя доверять при подаче документов в регулирующие органы.
3. Доверие к безопасности: вопрос, который срывает сделки на этапе проверки информационной безопасности
Как только данные получены, где они хранятся? Кто имеет к ним доступ? Алекс обратил внимание на следующее:
«Уверенность в том, что ваш локализованный контент создается людьми, а не автоматизированными системами — обеспечение такой прозрачности перед клиентами имеет большое значение, равно как и возможность аудита и меры безопасности. Это также влияет на доверие, наряду с тем, где хранятся ваши данные и как с ними обращаются».
Это требование, которое возникает на позднем этапе. Функциональная оценка завершена, заинтересованные стороны пришли к согласию, и вот тогда отдел информационной безопасности задает один вопрос, который никто не подумал включить в запрос предложений. Поставщики ИИ теперь обрабатывают контент, который ранее обрабатывался локально или в рамках строго ограниченных отношений с поставщиками лингвистических услуг (LSP). Это повышает уязвимость, а требования к данным в ЕС, США и Азиатско-Тихоокеанском регионе не совпадают однозначно.
4. Масштабируемое доверие: «в демо-версии всё работает» — это не гарантия
«Люди должны быть уверены, что перевод с помощью ИИ работает в масштабе. Что это не просто игрушка, не просто нечто, что работает в демо-версии или в тестовом проекте, а действительно функционирует, когда через систему пропускаются миллионы слов. Поэтому в производственной среде система действительно может выйти из строя».
Флориан добавил аспект затрат, который покупатели обычно упускают из виду:
«Мы слышали истории о том, как компании тратили полтора миллиона на токены Claude уже в первый месяц».
Само по себе это не является провалом поставщика. Это провал доверия к масштабируемости; покупатель не проверил модель затрат на реальных объемах перед принятием решения.
5. Доверие к результатам: требование, которое большинство покупателей полностью игнорируют
«Многие корпоративные покупатели начинают задумываться о том, как качество влияет на последующие процессы. Каковы коэффициенты конверсии на моих переведённых веб-сайтах? Речь идет о том, чтобы иметь возможность реально измерить влияние качества. Чтобы понять последствия и взаимосвязь между качеством и бизнес-результатами».
Большинство корпоративных заказчиков оценивают языковые ИИ-решения по показателям качества конечного результата: по показателям MTQE и результатам экспертных оценок. Однако они редко анализируют, действительно ли различия в качестве перевода влияют на бизнес-результаты. Им следует уделять больше внимания показателям конверсии, снижению нагрузки на службу поддержки и различиям в показателе NPS между пользователями, говорящими на родном языке, и пользователями, использующими перевод.
Заказчики, которые создают такую инфраструктуру измерения уже сейчас, смогут принимать решения о выборе поставщиков на основе реальных показателей, а не приблизительных оценок.
«Практически для всех точность является базовым критерием доверия», — сказал Алекс. «Но всё зависит от того, с каким покупателем вы разговариваете».
В этом-то и заключается проблема! Каждый поставщик отвечает на вопрос о качестве, ориентируясь на уровень точности. Ведь именно такой вопрос им задают. Остальные четыре требования остаются в презентации без ответа, пока их не выявит производственный процесс.
Решением проблемы не является составление более качественного запроса предложений. Решение заключается в том, чтобы понять, в отношении каких из этих пяти показателей доверия ваша организация не пойдет на компромисс.
Посмотрите полный выпуск!
Флориан, Алекс и Морана более подробно обсуждают эксперименты, системы обеспечения качества и свои прогнозы относительно того, как на самом деле будет развиваться индустрия локализации в ближайшие несколько лет. Посмотрите полный выпуск на YouTube:Определение качества перевода в эпоху ИИ с Алексом Эдвардсом и Флорианом Фэсом из SlatorХотите узнать больше? Посмотрите все выпуски 1-го сезона The New Fluency на нашем канале YouTube. Как провести локализацию 79 миллиардов слов в год? С Миком Шайной из Booking.com.
Разработка процессов локализации с приоритетом ИИ с Клаудией Мюллер (Trusted Shops) Преодоление «узкого места» сложности с помощью продуктового мышления с Ольгой Стоковец (Maxon) Быстрая доставка, ещё более быстрый перевод с Марией Хосе Сальмерон Ибаньес (GitLab)
Создание брендов в разных культурах с директором по маркетингу и автором Кэтрин Мельхиор Рэй
Создание механизмов локализации для быстрорастущих организаций с Рииной Толонен (Riina Tolonen), headout