Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Средний показатель многоязычного классификатора может скрывать провал на отдельных языках. В препринте Bhanu Prakash Vangala и Vangala Navya, который не прошёл рецензирование и приводит замеры самих авторов, единый порог дал целевое покрытие 90% в среднем, но лишь 77,5% для сомалийского языка; отдельные пороги вернули все языки в диапазон 89,1–91,0%. Значит, порог нужно калибровать и бюджет на ручную проверку считать отдельно для каждого языка.
Как порог решает, передать ли текст человеку
Классификатор выдаёт вероятности возможных меток. На отложенной размеченной выборке система подбирает порог, затем формирует для каждого нового текста набор допустимых меток. Если в наборе осталась одна метка, система применяет её автоматически; если несколько или ни одной — передаёт текст человеку либо более дорогой модели.
Так работает раздельная конформная калибровка. При условии, что калибровочные и рабочие данные приходят из одного распределения, она ограничивает долю ошибочных автоматических решений во всём входящем потоке. Это не то же самое, что точность только среди автоматически обработанных текстов: отложенные случаи тоже входят в поток, но не создают автоматических ошибок.
Обычная реализация объединяет примеры всех языков и получает один порог. На итог сильнее влияют языки с большим числом примеров и более уверенными предсказаниями. Для языков, где модель ошибается чаще, такой порог оказывается слишком мягким.
Языково-условный вариант оставляет модель прежней, но вычисляет порог на примерах конкретного языка. Для этого системе нужно знать язык входящего текста. Переобучать классификатор или содержать отдельную модель для каждого языка не требуется.
Метод проверяли на MasakhaNEWS с 16 языками и AfriSenti с 12 языками, представленными в обучении, а также с двумя ранее не встречавшимися языками. Один дешёвый классификатор представлял тексты через TF-IDF и передавал признаки логистической регрессии; обучение шло на одном ядре CPU. Официальные выборки для разработки и тестирования случайно делили пополам для калибровки и оценки, повторяя разбиение с разными начальными значениями.
Надёжность переносит нагрузку между языками
Общий порог перевыполнял план на языках, где классификатор и без того работал увереннее, и недовыполнял его на сложных языках. Поэтому сводная панель показывала нормальный результат, хотя отдельные группы пользователей получали менее надёжную автоматическую обработку.
Отдельный порог устранил этот разрыв, но показал цену целевого качества. Для сомалийских новостей пришлось передавать человеку около 43% потока вместо 9,5% при общем пороге. Для твитов на амхарском и Xitsonga ручной проверки потребовали более 80% сообщений, тогда как Nigerian Pidgin обходился небольшой долей проверок.
Особенно заметен эффект на языках, которых модель не видела при обучении. Общий порог разрешал ей самостоятельно размечать часть таких сообщений, хотя точность автоматических ответов оставалась около случайного угадывания. Порог для конкретного языка почти весь этот поток отправлял на проверку и тем самым сохранял заданный договор надёжности.
Высокая доля отложенных решений — не недостаток самой калибровки. Она показывает, сколько ручной работы скрывал единый показатель, и помогает решить, где выгоднее собрать больше обучающих данных или заменить базовую модель.
Архитектуру менять не нужно, процесс калибровки — придётся
Для продукта с несколькими языками работа меняет не выбор классификатора, а схему выпуска и наблюдения. Порог следует хранить по языкам, а покрытие и долю ручной проверки выводить в разрезе языка, а не только для всего потока. Тот же слой можно поставить поверх более сложного классификатора или модели, доступной через API, если она возвращает вероятности меток.
Практический объём разметки невелик: в экспериментах хватало 100–200 примеров на язык. Однако эти примеры должны отражать реальный входящий поток. На AfriSenti калибровка на официальной выборке для разработки хуже переносилась на тестовую выборку, тогда как случайное деление общего массива восстанавливало целевое покрытие.
Команде также понадобится надёжно определять язык до выбора порога. Для редких языков сам маршрутизатор может ошибаться, поэтому его результат стоит проверять отдельно и предусматривать безопасный путь для неопределённого языка.
Работа не доказывает, что такие же объёмы ручной проверки получатся у другой модели или на другой предметной области. Она показывает более общий инженерный риск: средняя гарантия не переносится автоматически на каждую языковую группу. Если продукт обещает одинаковый уровень качества, этот уровень нужно проверять там же, где он должен выполняться.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



