Журнал · Rit.work

Данные предпочтений задают предел оптимизации по модели награды

Закон масштаба связывает объём данных о предпочтениях с допустимым отклонением LLM от исходной политики и показывает, когда усиление оптимизации перестаёт помогать.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Оптимизацию LLM по модели награды нельзя без пользы усиливать быстрее, чем растёт объём данных о предпочтениях. В препринте MIT, который не рецензирован и приводит замеры самих авторов, найденная зависимость описала 99,2% разброса результата в основном эксперименте. Она даёт ориентир для выбора бюджета постобучения до запуска дорогих прогонов.

Ali Aouad, Aymane El Gadarri и Vivek F. Farias связали прирост истинной награды с двумя величинами: числом парных сравнений M и бюджетом отклонения K. Последний задаёт допустимое KL-расхождение обученной политики с исходной. Прирост подчиняется закону Θ(√min{log M, K}): сначала его ограничивает сила оптимизации, затем — количество сведений о предпочтениях.

Из закона следует практическая граница: бюджет отклонения стоит увеличивать примерно как логарифм числа сравнений. Если K растёт медленнее, часть доступного улучшения остаётся неиспользованной. Если быстрее, модель сильнее подстраивается под ошибки приближённой модели награды, а истинная награда выходит на плато или начинает снижаться.

Зависимость проверили с Llama-3.3-Nemotron-70B-Reward в роли эталонной модели награды и моделями Qwen3 размером от 0,6B до 4B параметров в роли приближённых. Объём обучающих данных меняли от 600 до 300 000 сравнений. Результат сохранялся при шумных метках и двух способах оптимизации: выборе лучшего ответа из набора и экспоненциальном перевзвешивании ответов.

Эксперимент охватывает синтетические предпочтения от модели, 128 тестовых запросов и выбор среди заранее сгенерированных ответов. Поэтому закон уже подходит как ориентир для расчёта сравнений и силы оптимизации, но работа не проверяет его на человеческих оценках и полноценном обучении политики.

Источники

Иллюстрация: рисунок из статьи «Revisiting scaling laws for reward optimization», Ali Aouad, Aymane El Gadarri, Vivek F. Farias, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу