Журнал · Rit.work

ReSAIL удерживает LLM-агентов от деградации при самообучении

ReSAIL отбирает полезные шаги и сохраняет способность агента учиться с дополнительными данными, повышая успешность после трёх циклов в среднем на 22,5 процентного пункта.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Повторное обучение LLM-агента на собственном опыте удалось провести три цикла без снижения доли успешно выполненных задач. Команда Renmin University of China добавила ReSAIL к двум способам самодистилляции; препринт не рецензирован, а все числа получили сами авторы. В финальном цикле успешность выросла в среднем на 22,5 процентного пункта относительно исходных способов.

При самодистилляции агент учится повторять собственные ответы, полученные с привилегированной информацией (PI): например, итогом всей траектории или кратким разбором опыта. Но обычная цель обучения улучшает поведение без этой подсказки и не сохраняет способность модели использовать её. Когда обновлённая модель становится учителем в следующем цикле, качество подсказок снижается и агент начинает деградировать.

ReSAIL оценивает каждый шаг по тому, насколько дополнительная информация меняет распределение возможных ответов учителя. В основной конфигурации обучение использует верхние 5% шагов, а вклад выравнивается между траекториями, чтобы длинные эпизоды не перевешивали остальные. Отдельная часть цели удерживает ответы ученика с дополнительной информацией близко к ответам замороженного учителя — так следующий цикл получает более стабильный источник обучения.

На ALFWorld вне обучающего распределения связка OEL и ReSAIL с Qwen3-8B завершила третий цикл с успешностью 78,4% против 41,4% у OEL. Полная схема требует больше вычислений: один цикл с Qwen3-4B занял 5,32 GPU-часа на восьми H800 — на 23% больше исходного OEL. Один только отбор шагов, напротив, немного сокращал общие затраты.

Метод проверяли с Qwen3-4B и Qwen3-8B на текстовых средах ALFWorld и TextCraft, сравнивая дополненные версии SDPO и OEL с исходными вариантами и другими способами обучения. Отдельный опыт с Qwen3-VL-4B-Instruct на AITZ показал, что тот же критерий можно применять как фильтр данных для агента, управляющего Android. Результат пока обосновывает ReSAIL как добавку к циклическому офлайн-обучению, где модель по очереди служит исполнителем и учителем.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу