Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Повторное обучение LLM-агента на собственном опыте удалось провести три цикла без снижения доли успешно выполненных задач. Команда Renmin University of China добавила ReSAIL к двум способам самодистилляции; препринт не рецензирован, а все числа получили сами авторы. В финальном цикле успешность выросла в среднем на 22,5 процентного пункта относительно исходных способов.
При самодистилляции агент учится повторять собственные ответы, полученные с привилегированной информацией (PI): например, итогом всей траектории или кратким разбором опыта. Но обычная цель обучения улучшает поведение без этой подсказки и не сохраняет способность модели использовать её. Когда обновлённая модель становится учителем в следующем цикле, качество подсказок снижается и агент начинает деградировать.
ReSAIL оценивает каждый шаг по тому, насколько дополнительная информация меняет распределение возможных ответов учителя. В основной конфигурации обучение использует верхние 5% шагов, а вклад выравнивается между траекториями, чтобы длинные эпизоды не перевешивали остальные. Отдельная часть цели удерживает ответы ученика с дополнительной информацией близко к ответам замороженного учителя — так следующий цикл получает более стабильный источник обучения.
На ALFWorld вне обучающего распределения связка OEL и ReSAIL с Qwen3-8B завершила третий цикл с успешностью 78,4% против 41,4% у OEL. Полная схема требует больше вычислений: один цикл с Qwen3-4B занял 5,32 GPU-часа на восьми H800 — на 23% больше исходного OEL. Один только отбор шагов, напротив, немного сокращал общие затраты.
Метод проверяли с Qwen3-4B и Qwen3-8B на текстовых средах ALFWorld и TextCraft, сравнивая дополненные версии SDPO и OEL с исходными вариантами и другими способами обучения. Отдельный опыт с Qwen3-VL-4B-Instruct на AITZ показал, что тот же критерий можно применять как фильтр данных для агента, управляющего Android. Результат пока обосновывает ReSAIL как добавку к циклическому офлайн-обучению, где модель по очереди служит исполнителем и учителем.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



