Журнал · Rit.work

Прогрев на собственных ошибках помог агенту раньше находить награду

OPW обучает агента на его собственных неудачных траекториях перед RLVR и помогает быстрее получить полезный сигнал от проверяемой награды.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Короткая подготовка под руководством более крупной модели помогла агенту раньше находить успешные траектории и быстрее учиться по редкой награде. В препринте команды Zhejiang University и Ant Group, который не рецензирован, все числа получили сами авторы: на новых задачах ALFWorld итоговый результат оказался на 10,1 процентного пункта выше, чем при прямом обучении через GRPO. Такой прогрев может сократить дорогой период, когда агент почти всегда терпит неудачу и не получает полезного сигнала.

Метод On-Policy Warmup, или OPW, добавляет подготовительный этап перед обучением с подкреплением по проверяемой награде (RLVR). Ученик сам взаимодействует со средой, а фиксированная модель-учитель подсказывает ему действия в состояниях, до которых он дошёл, включая последствия ошибок и попытки восстановиться. Затем учителя отключают и продолжают обучение через GRPO только по результату задачи.

Это отличает OPW от имитации готовых траекторий учителя. Такая имитация показывает в основном правильные состояния, тогда как работающий агент попадает в другие состояния после неудачного вызова инструмента или неверного действия. Если все траектории в группе заканчиваются провалом, GRPO не может отличить более полезное поведение от менее полезного; прогрев повышает вероятность первого успеха и тем самым создаёт различимый сигнал награды.

На Qwen3-4B OPW также вывел успех на знакомых задачах ALFWorld выше 80% за 19,6 GPU-часа с учётом работы учителя. Другим проверенным способам потребовалось не менее 29,6 GPU-часа. Для меньшей модели преимущество по полной стоимости сохранилось не во всех сравнениях.

Метод проверяли на учениках Qwen3-1.7B и Qwen3-4B с учителем Qwen3-32B в интерактивных средах ALFWorld и ScienceWorld. Сравнение охватывало прямой GRPO, обучение на фиксированных примерах и прогрев без учителя. Теоретический результат описывает только поиск начальной награды при достаточно хорошем учителе и близком поведении моделей: он не гарантирует сходимость и не означает, что подготовка всегда снижает общие вычислительные затраты.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу