Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Wenhe Sun, Cunxiang Wang, Zijun Yao и Yixin Cao предложили способ отделять новое поведение после RL от более эффективного выбора уже доступных модели решений, описанный в препринте, не прошедшем рецензирования. На опорном эксперименте правило авторов предсказывало кривую RL-модели со средней ошибкой 3,41 процентного пункта. Работа важна командам, которые выбирают между дополнительным обучением модели и увеличением вычислений во время вывода.
Что сделали
Авторы исследовали обучение с подкреплением и проверяемой наградой: модель получает вознаграждение за ответ, правильность которого можно определить программно или по формальному правилу. Они сравнили базовые модели с соответствующими версиями после RL из SimpleRL-Zoo.
Обычное сравнение фиксирует способ генерации и вычислительный бюджет, а затем измеряет разницу между моделями. В этой работе вопрос поставлен иначе: можно ли воспроизвести результат RL-модели, если оставить базовую модель неизменной, но подобрать для неё другой способ поиска и бюджет.
Для такого сравнения авторы создали SearchLens, или унифицированную среду декодирования UDF. Она описывает генерацию как рабочую точку из двух частей: политики поиска и бюджета. Политика определяет, как выбирать токены, ветвить рассуждения, оценивать промежуточные варианты и распределять вычисления. Бюджет задаёт количество прогонов — отдельных сгенерированных траекторий ответа. Основная сетка экспериментов ограничивалась бюджетом до 16 прогонов.
Результаты генерации оценивали отдельно от политики. В частности, pass@k показывает, найден ли хотя бы один правильный ответ среди нескольких попыток; самосогласованность выбирает ответ большинства; best-of-N использует внешнюю модель-оценщик; успех первого завершения учитывает, насколько рано получен допустимый ответ.
После этого авторы искали не отдельные совпадения с RL-моделью, а последовательный путь рабочих точек базовой модели. Его описывает правило BOPTR:
NBase ≈ α × NRL^β
Оно связывает бюджет базовой модели с бюджетом RL-модели. Коэффициент и показатель степени зависят от режима задачи и модели. Такая форма нужна, чтобы не выбирать подходящий результат задним числом для каждого бюджета независимо.
Что показали
По замерам авторов, RL-модели чаще выигрывали при малом бюджете. С увеличением числа попыток базовая модель могла приблизиться к ним или превзойти их по pass@k. На опорной комбинации Qwen2.5-7B и Math500 целевая кривая RL находилась внутри области результатов, достижимых базовой моделью с UDF.
При повторении эксперимента с разными начальными значениями генератора случайных чисел средняя ошибка BOPTR составила 3,07 процентного пункта. На ранее не использованных для настройки бенчмарках ошибка переноса достигла 5,03 процентного пункта. В варианте без какой-либо RL-сигнализации при построении прогноза авторы получили 5,08 процентного пункта.
Авторы интерпретируют это как поведенческий признак «внутреннего поиска»: в проверенном режиме RL во многом повышает вероятность удачных траекторий, которые уже можно получить от базовой модели внешним поиском. Это не означает, что параметры RL-модели буквально реализуют UDF или BOPTR.
Ограничения
Работа проверяет совпадение наблюдаемых ответов, а не внутренний механизм модели. Если базовая модель с поиском достигает той же точности, из этого нельзя заключить, что RL и поиск изменяют рассуждение одинаковым способом. Метод также не доказывает, что RL никогда не создаёт решений, недоступных базовой модели.
Эксперименты охватывают десять моделей из четырёх семейств и восемь бенчмарков, но основная часть пар Base/RL получена по одному рецепту SimpleRL-Zoo. В работе не проверен перенос правила без повторной настройки на произвольные RL-рецепты, другие распределения обучающих задач и более длительное обучение.
Сравнение строится вокруг числа прогонов, а не нормализованной задержки или стоимости эксплуатации. Разные политики поиска при одинаковом бюджете могут требовать разного объёма вычислений. Поэтому работа не показывает, будет ли внешний поиск дешевле RL для конкретной инфраструктуры и нагрузки. Кроме того, выбранная политика и часть параметров BOPTR остаются зависимыми от модели.
Что это значит
Работа не даёт оснований заменять запланированное RL внешним поиском автоматически. Она предлагает диагностический этап перед обучением: построить для базовой модели несколько кривых «качество — бюджет» и проверить, входит ли ожидаемый результат RL в доступную область. Если разрыв закрывается декодированием и дополнительными попытками, команда получает альтернативу обучению, которую можно оценить по задержке и стоимости.
Для продукта с жёстким ограничением на время ответа вывод может быть противоположным. По наблюдениям авторов, преимущество RL заметнее при малом бюджете, поэтому обучение способно сжать поиск в один более результативный режим генерации. Для пакетной обработки, где допустимы параллельные попытки, базовая модель с поиском может оказаться практичным вариантом, но экономика такого решения в статье не рассчитана.
BOPTR без RL-чекпойнта целевой модели полезен как предварительная оценка, а не как прогноз с гарантированной точностью. Его применение всё ещё опирается на закономерности, найденные в когорте других моделей. Командам, которые строят на этом систему, стоит разделять политику генерации, бюджет и метрику качества в собственных испытаниях. Тогда выигрыш после RL можно сравнивать не только с базовым запуском, но и с лучшей доступной конфигурацией поиска.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



