Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Одну оценочную модель научили предсказывать качество новой LLM по журналам старой, не переобучая её под каждый новый критерий. В препринте RBC Borealis, University of Toronto и Vector Institute, который не проходил рецензирование и содержит замеры самих авторов, PFN-OPE показал наименьшую ошибку в 11 из 12 сравнений, где не видел заранее ни целевую LLM, ни модель награды. Для потока контрольных точек и меняющихся правил оценки это открывает путь к одному переиспользуемому оценщику.
Почему новый критерий обесценивает старый оценщик
Команда может хранить запросы пользователей, ответы работающей модели и их оценки. Но эти данные описывают уже развёрнутую модель, а не кандидата: новая LLM отвечает иначе, и оценок для её ответов в журнале нет.
Попытка предсказать результат кандидата по таким данным называется оценкой вне политики (off-policy evaluation). В этой постановке запрос служит контекстом, ответ — действием, а человеческая оценка или балл модели награды — результатом. Задача ограничена одним ответом на запрос и не охватывает многошаговые диалоги и агентов, где последующие действия зависят от предыдущих.
Классические методы часто требуют знать вероятность каждого ответа при старой и новой моделях. Закрытые API её обычно не отдают, а точные ответы кандидата почти не повторяются в журнале, поэтому пересчёт весов становится ненадёжным.
На практике остаётся прямой метод: обучить модель награды на старых ответах и применить её к ответам кандидата. Здесь возникают два сдвига. Первый создаёт новая LLM, распределение ответов которой отличается от старого. Второй появляется, когда бизнес меняет критерий — например, начинает сильнее штрафовать многословие. При каждом новом журнале или критерии прямой метод приходится обучать заново, хотя именно на новых ответах его нельзя проверить до запуска.
Как пул ответов превращается в набор учебных задач
PFN-OPE сначала обучают на большом наборе искусственно собранных задач оценки. Авторы один раз получили ответы нескольких LLM на подготовленные запросы и пропустили их через несколько функций награды. Получился конечный пул, в котором известны ответы разных моделей и их оценки по нескольким признакам.
Новые критерии строят как смеси сохранённых наград. Одни признаки можно усиливать, другие ослаблять или превращать в штраф. Изменения модели имитируют двумя способами: перераспределяют вероятность в пользу ответов с высокой наградой и смешивают это распределение с поведением исходной модели. Так в обучении появляются переходы от небольшого обновления к полной смене LLM.
Поскольку все возможные ответы внутри такой задачи уже сохранены и оценены, правильный средний результат целевой модели можно вычислить как взвешенную сумму. PFN-OPE получает журнал старой модели и по одному сгенерированному ответу кандидата на те же запросы. Награды кандидата скрыты.
Модель предсказывает не итоговый балл напрямую, а поправку к среднему баллу в журнале. Это заставляет её оценивать, насколько смена ответов сдвинет результат, вместо того чтобы переносить старое среднее на кандидата. После предварительного обучения новая выборка поступает на вход целиком, а оценка появляется за один прямой проход без настройки параметров.
Когда PFN-OPE меняет план оценки
Метод проверяли на HelpSteer2 и UltraFeedback с семействами Qwen, Llama и Gemma. В основной постановке оценщик видел до 512 строк журнала. Сравнивали смену модели, смену награды и их сочетание, включая целевые LLM и модель награды, которых не было при предварительном обучении.
При смене критерия PFN-OPE снизил среднеквадратичную ошибку в 2,0–9,3 раза относительно лучшего базового метода. Эта метрика сильнее штрафует крупные промахи. На задачах с большим расхождением между старой и новой моделью PFN-OPE с 64 строками оказался точнее базовых оценщиков с 2048 строками: дополнительная разметка не устранила их ошибку экстраполяции.
Работа меняет план команд, которые регулярно сравнивают контрольные точки, модели от разных поставщиков или меняют правила ранжирования. Вместо обучения отдельного оценщика под каждый запуск можно заранее собрать общий пул ответов и наград, а затем подавать новые журналы в одну модель.
Экономия не возникает автоматически. Для нового критерия PFN-OPE всё равно нужны оценки старых ответов по текущему правилу, а для кандидата — сгенерированный ответ на каждый запрос. Метод сокращает повторное обучение оценщика, но не отменяет генерацию, работу модели награды или человеческую разметку.
Главный риск заложен в набор учебных задач. В разборе компонентов выигрыш в основном давало разнообразие сдвигов между моделями, а ошибки росли там, где предварительный набор не покрывал поведение тестовой задачи. Поэтому внедрение начинается не с архитектуры трансформера, а с проверки, отражает ли пул реальные обновления моделей и критериев продукта.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



