Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Старые аудиты модели-оценщика могут ускорить проверку новой версии продукта, но без доказанной стабильности не заменяют свежую разметку. Препринт Joyanta Jyoti Mondal и соавторов не прошёл рецензирование; приведённые числа получили сами авторы: предложенная портфельная проверка потребовала на CIFAR-10N на 53,5% меньше доверенных меток, чем сопоставимый монитор. Для процесса выпуска это разделяет историю на доказательство безопасности и подсказку, которая лишь помогает экономнее собирать новые метки.
Авторы рассматривают три режима. Если ошибка оценщика может незаметно измениться, дешёвые автоматические оценки не позволяют проверить, сохранилась ли точность старого аудита. Если команда заранее задаёт обоснованную границу такого изменения, история может прямо подтвердить допустимый риск без новых меток. Во всех остальных случаях старые результаты разрешено использовать только для выбора следующего примера на ручную проверку.
Для третьего режима предложена портфельная проверка. Она объединяет две стратегии: одна опирается на прежний аудит, другая учится только на текущих доверенных метках. Итог считается по их фиксированной смеси, поэтому ошибочная история не нарушает допустимую вероятность ложного выпуска. При намеренно искажённых подсказках метод тратил не более чем на 8% больше меток по сравнению с лучшей из двух стратегий, тогда как полное доверие истории увеличивало расход до 1,66 раза.
На DICES-990 портфельная проверка сократила число меток относительно сопоставимого монитора на 26% и не дала наблюдаемых ложных подтверждений. Дополнительный опыт показал, что смена инструкции у одного фиксированного LLM-оценщика меняет его оценки сильнее, чем повторные запуски с той же инструкцией. Значит, даже неизменная модель не гарантирует переносимость старого аудита.
Основные замеры проводили на CIFAR-10N и DICES-990, а изменение инструкции оценщика проверяли на DICES-990 и ToxicChat. Гарантия метода требует равномерно выбирать строки для проверки, заранее фиксировать пороги и работать с ограниченной величиной ошибки. Эксперимент менял инструкцию одной LLM, а не саму модель, поэтому вывод относится прежде всего к дрейфу процедуры оценки.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



