Журнал · Rit.work

GAR различает правильные рассуждения по градиентам модели

GAR использует экспертные решения как ориентиры для вознаграждения при обучении LLM и добавляет ограниченные вычислительные расходы к GRPO.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи из Tsinghua University и других университетов предложили Gradient-Aligned Reward, или GAR, для обучения рассуждающих LLM с проверяемым вознаграждением, хотя работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, GAR превосходит обычный GRPO на всех представленных математических тестах и переносит улучшения на задачи вне обучающего домена. Работа важна командам, которые дообучают открытые модели на задачах с проверяемым ответом и располагают эталонными цепочками рассуждений.

Что сделали

В обучении с подкреплением на основе проверяемого вознаграждения модель получает балл за правильный конечный ответ. Такой сигнал надёжен, когда ответ можно проверить программно, но он не различает несколько правильных решений. Если все сгенерированные варианты пришли к верному результату, GRPO — алгоритм, сравнивающий ответы внутри одной группы, — не видит, какое рассуждение стоит усиливать.

GAR добавляет к проверке результата плотное вознаграждение: разные правильные ответы получают разные оценки. Ориентиром служит экспертная цепочка рассуждений, уже входящая в обучающий набор. Для неё и для каждого правильного ответа модель вычисляет направления градиентов — изменений параметров, которые уменьшили бы ошибку предсказания этого текста.

Полный обратный проход по модели был бы дорогим, поэтому авторы ограничили вычисление выходным проекционным слоем. Скрытые состояния основной части модели отсоединяются от графа вычислений, после чего градиент считается только на границе с выходным слоем. Его покомпонентно умножают на активации и усредняют по токенам ответа.

Полученный вектор сравнивают с вектором экспертного решения по косинусной близости, то есть по совпадению направлений. Чем ближе направления, тем выше добавка к вознаграждению. Авторы математически раскладывают этот сигнал на совпадение профилей ошибок предсказания и совпадение активаций: высокая оценка требует согласованности по обоим признакам.

Проверка конечного ответа остаётся жёстким фильтром. Неправильный вариант не получает добавку независимо от направления градиента. Среди правильных вариантов бонус центрируется относительно группы, а отрицательная часть отсекается. GAR поэтому дополняет проверяемое вознаграждение, а не заменяет его моделью-оценщиком или отдельной системой разметки шагов.

Что показали

Авторы обучали Qwen3-4B и Qwen3-8B с GAR поверх GRPO и REINFORCE++, используя одинаковые обучающие данные и вычислительный бюджет для сравниваемых методов. На представленных математических тестах варианты с GAR улучшили метрику pass@k — вероятность получить хотя бы один правильный ответ среди нескольких попыток. Для GAR-GRPO относительный прирост над GRPO в отдельных условиях достигал 35,2%, а заявленные различия в основной таблице были статистически значимыми.

Модели обучались только на математических данных, но авторы также измерили перенос на GPQA Diamond и MMLU-Pro. GAR-GRPO показал лучший результат среди приведённых вариантов во всех опубликованных столбцах этих тестов. Это согласуется с гипотезой авторов, что сигнал зависит не только от формата математического ответа, однако само по себе не устанавливает универсальность метода.

На стенде с 4×A100 дополнительное время одного шага обучения составило 8,3% относительно GRPO. По объяснению авторов, расходы ограничивают обратный проход только через выходной слой, фильтрация неправильных ответов до вычисления градиентов и повторное использование вектора экспертного решения внутри группы.

Ограничения

Эксперименты проводились примерно на 10 тысячах задач NuminaMath-CoT в течение 400 шагов обучения. Проверены две базовые модели одной серии, а основная оценка сосредоточена на соревновательной математике; перенос рассмотрен только на GPQA Diamond и MMLU-Pro. Работа не показывает результаты на других семействах моделей, при существенно большем масштабе обучения или в промышленной эксплуатации — последнее авторы отдельно называют ограничением.

Сравнение выполнено с GRPO, REINFORCE++ и несколькими градиентными методами при одинаковом бюджете, но в работе нет сопоставления с производственными контурами, где экспертные цепочки нужно создавать или проверять отдельно. Заявление об отсутствии дополнительных затрат на разметку относится к наборам, где такие решения уже присутствуют.

GAR намеренно поощряет правильные решения, градиенты которых похожи на градиент одного экспертного ориентира. Анализ авторов показывает, что альтернативные правильные методы получают меньшую близость, но работа не устанавливает, сохраняется ли полезное разнообразие рассуждений при более длительном обучении. Также метод требует доступа к скрытым состояниям и обратному проходу, поэтому приведённые результаты нельзя непосредственно переносить на закрытые модели, доступные только через API.

Что это значит

Для большинства продуктовых команд работа не меняет выбор базовой модели или поставщика API. GAR относится не к выполнению запросов, а к собственному обучению модели с подкреплением. В описанном виде метод требует открытых весов, управляемого обучающего контура, программной проверки ответа и экспертного решения для каждой задачи.

Планы команд, уже строящих RLVR-конвейер, работа меняет на уровне эксперимента с функцией вознаграждения. Если набор содержит эталонные рассуждения, GAR позволяет использовать их без обучения отдельной модели оценки процесса и с ограниченной добавкой к времени шага. Практическая проверка должна сравнить не только итоговую точность, но и разнообразие решений, устойчивость к качеству экспертных ориентиров и стоимость хранения промежуточных активаций.

Метод пока разумно рассматривать как кандидат для контролируемого испытания рядом с обычным GRPO, а не как замену существующего контура. Представленные замеры поддерживают идею различать правильные траектории по внутреннему сигналу модели, но их масштаб недостаточен, чтобы заранее менять архитектуру производственного обучения.

Источники

Иллюстрация: рисунок из статьи «Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards», Leqi Zheng, Jinbo Su, Fang Niu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу