Журнал · Rit.work

DARA усиливает редкие сигналы награды при обучении LLM

DARA меняет вес каждого сигнала награды по тому, как часто он различает ответы, и ускоряет обучение LLM нескольким требованиям без замены алгоритма оптимизации.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научились быстрее подчинять нескольким требованиям одновременно, не меняя основную цель обучения с подкреплением. В препринте команды из восьми организаций, который не прошёл рецензирование и приводит замеры самих авторов, метод DARA достигал целевого поведения заметно раньше GDPO. Для команд это способ сократить обучение там, где редкая награда теряется среди более частых сигналов.

Почему нормализация не уравнивает награды

При обучении по нескольким наградам модель может одновременно получать баллы за правильность, формат, длину и корректный вызов инструмента. GRPO сначала складывает эти баллы, а затем сравнивает ответы внутри группы. Из-за этого разные сочетания наград иногда превращаются в одинаковый итоговый сигнал.

GDPO решает часть проблемы: нормализует каждую награду отдельно и лишь потом складывает результаты. Но награда влияет на обучение только тогда, когда различает ответы внутри одной группы. Если все ответы соблюдают формат или все его нарушают, сигнал формата в этой группе равен нулю.

Авторы называют долю групп с полезным сигналом плотностью активных групп. Они также вводят энергию преимущества — сумму квадратов относительных оценок по всему пакету. В идеализированном GDPO эта энергия прямо пропорциональна плотности: награда, которая различает ответы реже, передаёт меньше сигнала за весь пакет, хотя внутри активной группы уже нормализована.

Так возникает остаточный перекос. Лёгкое требование быстро становится почти всегда выполненным, а сложное — почти всегда проваленным; оба сигнала становятся редкими. Лучше всего обучается требование из середины диапазона, где в одной группе регулярно встречаются и успешные, и неуспешные ответы.

DARA пересчитывает веса для каждого пакета

DARA измеряет плотность каждой награды прямо на текущем пакете и сравнивает её с самой активной наградой. Вес редкого сигнала растёт как квадратный корень отношения плотностей. Так метод выравнивает энергию преимуществ, а не подбирает постоянные коэффициенты вручную.

Вес ограничен сверху, чтобы единичная активная группа не получила чрезмерного влияния. Если награда вообще не различила ответы в пакете, DARA её не усиливает: полезного направления для обновления модели в таком сигнале всё равно нет.

Основной вариант DARA-Asym увеличивает только положительные преимущества. Отрицательные остаются на уровне GDPO, поэтому редкая награда не усиливает штраф за ответ, который оказался полезен по другому требованию. DARA-Sym масштабирует оба знака и точнее следует математическому выравниванию, но может сильнее сдвигать баланс между правильностью и соблюдением ограничений.

После пересчёта метод складывает преимущества и нормализует общий результат по пакету. Алгоритм обновления модели остаётся прежним: DARA меняет только этап объединения наград. Поэтому его можно встроить поверх существующего контура GDPO без отдельной модели ценности и без переработки функции оптимизации.

Ускорение заметно до полного схождения

В задаче вызова инструментов DARA достигал высокого соблюдения формата на 26% быстрее GDPO. В математических задачах модель доходила до почти полного соблюдения ограничения длины на 65% быстрее. Выигрыш рос по мере того, как нужная награда становилась реже и переставала различать большинство групп.

Ускорение сохранилось на отложенных математических тестах: обе версии DARA достигли 95% соблюдения длины на шаге 50, тогда как GDPO потребовалось 70 шагов. При полном схождении разница сокращалась, поэтому работа прежде всего показывает экономию шагов, а не устойчивое превосходство итоговой модели по всем метрикам.

DARA-Sym строже сокращал слишком длинные ответы, но DARA-Asym лучше сохранял точность. Опыт с постоянным повышенным весом награды за длину дал более слабый компромисс: ограничение выполнялось чаще, однако точность снижалась сильнее. Плотность позволяет менять вес вместе с ходом обучения, а не фиксировать его на весь запуск.

Метод проверяли на вызове инструментов и математических рассуждениях, с двумя или тремя наградами, на моделях семейств Qwen и DeepSeek-R1 размером от 1,5 до 7 млрд параметров. В сравнении участвовали GRPO, GDPO, DVAO и GD2PO-Hard; результаты относятся к групповому обучению, где награды оценивают готовый ответ целиком.

Планы стоит менять командам, которые уже используют несколько разреженных наград и тратят запуски на подбор их коэффициентов. Плотность активных групп можно сначала добавить как диагностическую метрику: если один сигнал регулярно активен реже других, DARA предлагает обоснованную замену ручным весам. Если награды плотные или итоговое качество важнее скорости схождения, работа пока не даёт оснований менять действующую схему.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу