Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Обновление модели научились проверять на регрессию без разметки всего потока запросов. В препринте Vishnu Bindu Balachandran, который не рецензирован и где числа получены самим автором, DISCERN подтвердил 56% безопасных обновлений вообще без меток. Такой аудит можно встроить в выпуск моделей вместо повторной разметки случайной выборки трафика.
DISCERN одновременно запускает действующую и новую модели на одних входных данных. Если предсказания совпали, разница между их ошибками равна нулю, поэтому истинный ответ для этой точки не нужен. Когда доля расхождений достаточно мала относительно допустимого ухудшения, протокол сразу выдаёт сертификат отсутствия регрессии.
Если одной доли расхождений недостаточно, DISCERN отправляет на разметку только часть спорных примеров. Последовательная доверительная граница остаётся корректной, даже если команда постоянно смотрит на результат и останавливает аудит сразу после достижения нужной уверенности. Правило отбора примеров можно менять по ходу проверки, в том числе поручить его отдельной модели-оценщику: это влияет на расход меток, но не на корректность вердикта.
В основной серии экспериментов аудит с разметкой тратил в медиане 327 меток против 2 906 при равномерной разметке. Каждый запуск формирует машиночитаемую запись с допуском, уровнем уверенности, вердиктом, моментом остановки и историей отбора меток. Её можно сохранить вместе с версией модели и позднее перепроверить решение о выпуске.
Метод проверили на 785 парах обновлений, включая классификационные LoRA-донастройки языковых моделей размером до 1,4 млрд параметров. Гарантии относятся к ограниченным функциям потерь, которые зависят от предсказания и правильного ответа; оценка открытых текстов внешним судьёй в эту схему не входит. При изменении распределения трафика работа предлагает отдельные проверки по временным окнам, поскольку единая граница оценивает средний результат за весь накопленный поток.
Источники
Иллюстрация: рисунок из статьи «Pay Only for Disagreement: Certified No-Regression Verdicts for Model Updates with Matching Label-Complexity Bounds», Vishnu Bindu Balachandran, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



