Журнал · Rit.work

Внешние подсказки для GRPO стоит ослаблять по ходу обучения

GA-GRPO связывает пользу внешних подсказок со сдвигом распределения и предлагает вычислять их вес вместо постоянной настройки вручную.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Внешние подсказки при обучении LLM полезны в начале, но по мере обучения их вес нужно снижать: иначе сдвиг данных накапливает ошибку в градиенте. В нерецензированном препринте, где все числа получили сами авторы, GA-GRPO достиг той же целевой точности с меньшими затратами GPU-часов, чем TAPO. Для команд это превращает постоянный вес подсказок из настройки на глаз в вычисляемое расписание.

Как измерили вред от подсказки

Работу подготовили Sofia Torres, Gabriel Almeida, Carter Adams и Camila Rocha. Они объединили в одной схеме несколько способов направлять обучение: экспертные цепочки рассуждений в LUFFY, самообъяснения в ExPO, найденные шаблоны рассуждений в TAPO и обратную связь об ошибках восприятия в PAPO.

Обычный GRPO генерирует ответы текущей моделью и обновляет её по проверяемой награде, например за правильное решение задачи. Внешняя подсказка меняет вход или источник примеров, поэтому модель обучается уже не на том распределении ответов, которое создала бы самостоятельно.

GA-GRPO описывает величину этого сдвига через δ — расстояние между распределением собственных ответов модели и распределением ответов с подсказкой. Чем выше δ, тем сильнее подсказка уводит оценку градиента от исходной цели GRPO. Смещение также растёт с длиной ответа, потому что различия накапливаются по цепочке токенов.

При этом подсказка может снижать разброс обновлений: модель реже исследует заведомо неудачные пути. Получается обмен между смещением и разбросом. Малый вес подсказки сохраняет чистоту GRPO, большой ускоряет обучение, но сильнее меняет его цель.

Оптимальный вес авторы записывают так: λ* = σ₀² / (σ₀² + Rmax² δ² T). Здесь σ₀² — разброс градиента без подсказки, Rmax — максимальная награда, а T растёт вместе с обучением. Если распределения близки, λ приближается к единице; если сдвиг или длительность обучения растут, формула уменьшает вес подсказки.

Это не только верхняя оценка ошибки. Авторы доказывают нижнюю границу с тем же порядком зависимости от δ: полностью убрать внесённое подсказкой смещение нельзя. Постоянно держать большой λ безопасно лишь тогда, когда подсказка почти не меняет распределение ответов.

Динамический вес сэкономил треть вычислений

Эксперименты провели на Qwen2.5-Math-7B-Base, которую обучали на сложных уровнях MATH. Затем модель проверяли на математических тестах и задачах за пределами обучающего распределения. Сравнение охватывало GRPO, LUFFY, ExPO, TAPO и PAPO.

GA-GRPO потребовал на 31% меньше GPU-часов, чем TAPO, чтобы достичь заданного уровня на AIME 2024. Итоговая доля задач, решённых с первой попытки, составила 36,7% против 33,5% у TAPO. Отказ от внешней подсказки, то есть возврат к обычному GRPO, снизил результат на 9,4 процентного пункта.

Отдельные опыты подтвердили предполагаемую форму компромисса. При слишком слабой подсказке модель теряла выигрыш в исследовании решений, а при слишком сильной — накапливала смещение и становилась менее стабильной к концу обучения. Расчётный вес оказался близок к лучшему значению, найденному перебором.

Проверка охватывает одну базовую модель, математическое обучение и проверяемую награду. Поэтому экономию вычислений нельзя напрямую переносить на модели другого масштаба, обучение агентов или задачи с субъективной оценкой ответа.

Когда стоит менять план обучения

Работа меняет план команд, которые уже добавляют в GRPO экспертные решения, найденные шаблоны или самообъяснения. Такой сигнал не стоит включать с постоянным весом на всём протяжении обучения. В цикл нужно добавить оценку сдвига δ и разброса обычного градиента, а затем периодически пересчитывать λ.

Практически это означает два отдельных потока примеров: ответы без подсказки и ответы с ней. По ним можно отслеживать, насколько различаются распределения и как меняется разброс обновлений. Если подсказка всё сильнее расходится с поведением модели, её долю следует сокращать, даже когда ранние замеры показывали прирост.

Формула не устраняет настройку полностью. Команде всё равно нужны способ оценивать δ, стабильная проверяемая награда и контроль качества самих подсказок. Но вместо полного перебора постоянных весов остаётся измерить несколько величин и построить убывающее расписание.

Для проекта на чистом GRPO срочно менять архитектуру не требуется: при нулевом весе внешнего сигнала GA-GRPO сводится к исходному методу. Главный вывод касается систем, где подсказки уже входят в обучение: их нужно рассматривать как временный способ снизить разброс, а не как безусловно полезные данные на каждом шаге.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу