Журнал · Rit.work

Почему подсказки для LLM-агентов лучше переносить из функции потерь в выборку

Privileged Self-Practice направляет неудачные попытки LLM-агента подсказками, но сохраняет обычную функцию обучения с подкреплением и стабильно обходит GRPO.

Rit.work
Студия разработки
25 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Подсказки, доступные только во время обучения, лучше помогают многошаговому LLM-агенту, когда направляют его практику, а не служат эталоном для копирования. Хотя препринт не прошёл рецензирование и все числа получили сами авторы, работа Texas A&M University, AWS AI и Amazon показывает: Privileged Self-Practice единственным из проверенных методов стабильно обошёл обычный GRPO. Для команд это меняет схему дообучения: закрытые знания стоит оставлять в контексте успешной попытки, не заставляя модель воспроизводить ответы учителя без исходных данных.

Почему агент копирует уверенность без оснований

Авторы изучают привилегированную информацию (PI): эталонное решение, разбор ошибок или подсказку, которые доступны при обучении, но исчезают при запуске агента. Популярная схема OPSD подаёт такую информацию той же модели, получает более сильную версию учителя и заставляет обычную версию повторять распределение вероятностей её токенов.

Проблема возникает из-за разных входных данных. Учитель выбирает API, фильтр или следующий шаг, опираясь на подсказку. Ученик должен скопировать этот выбор, хотя самой подсказки не видит и не может восстановить основание решения.

В обычной генерации текста такой разрыв может испортить отдельную фразу. У агента каждый ответ становится действием: он вызывает API, меняет среду и получает новое состояние, от которого зависят следующие шаги. Ошибка поэтому не остаётся локальной, а накапливается по всей траектории.

В приведённом авторами примере агент с подсказкой выбирает нужный API, считает элементы и отправляет результат. После OPSD та же модель без подсказки воспроизводит внешнюю форму решения: действует коротко, уверенно завершает задачу и вызывает финальную функцию. Но она обращается не к тому API и отправляет переменную, которой ещё не присвоила значение.

Это не недостаток самой подсказки: с ней агент решает задачу. Ошибка заложена в функции потерь, которая требует от одной версии модели повторять вывод другой версии с более полным контекстом. В экспериментах чистая OPSD из-за этого уступила не только GRPO, но и исходной модели без дообучения.

Как подсказка превращается в дополнительную практику

Privileged Self-Practice, или PSP, не сравнивает токены двух версий модели. Сначала агент несколько раз выполняет задачу без помощи. Если группа попыток почти не содержит успехов, модель-анализатор читает эти траектории вместе с эталонным решением и составляет короткую инструкцию для конкретной задачи.

После этого агент повторяет задачу уже с инструкцией в контексте. Полученные траектории обучают обычным GRPO — методом обучения с подкреплением, который сравнивает награды попыток внутри одной группы. Подсказка остаётся частью входных данных и никогда не превращается в скрытый эталон, который модель должна имитировать без доступа к нему.

Такой порядок важен для задач с итоговой бинарной наградой. Если все самостоятельные попытки провалились, они не дают GRPO полезного различия между хорошими и плохими действиями. Направленная повторная попытка может получить награду и создать обучающий сигнал там, где его раньше не было.

Подсказка при этом определяет лишь небольшую часть траектории. В успешных направленных попытках на сложных обучающих задачах у 78% траекторий она существенно влияла только на один ход и никогда — более чем на три. Награда усиливает всю успешную последовательность, включая шаги, которые агент уже способен воспроизвести самостоятельно.

Шлюз постепенно возвращает обучение к обычному GRPO. Когда самостоятельные попытки начинают удаваться, задача перестаёт получать подсказки. Вариант, который направлял все задачи без разбора, удваивал число траекторий на шаг и не давал устойчивого выигрыша.

Когда команде стоит менять схему обучения

Работу проверяли на AppWorld и SWE-bench Verified с Qwen3-4B, Qwen3-8B и Gemma4-E4B. AppWorld проверяет, достигает ли агент цели через последовательность вызовов приложений, а SWE-bench Verified — исправляет ли он реальные ошибки в репозиториях. Сравнение охватывает обычный GRPO, несколько вариантов дистилляции, перевзвешивание наград и PSP.

На AppWorld средний отрыв PSP от GRPO составил 6,1 процентного пункта для Qwen3-4B, 1,8 для Qwen3-8B и 5,3 для Gemma4-E4B. На SWE-bench Verified преимущество в среднем достигло 2,2 пункта. Меньший выигрыш на более успешной исходной модели согласуется с устройством метода: если агент уже получает награду самостоятельно, дополнительная инструкция нужна реже.

Результат касается команд, которые дообучают многошаговых агентов на эталонных решениях, разборах неудач или внутренних инструкциях. Если учитель знает больше ученика, плотная токенная дистилляция создаёт опасную цель: модель учится повторять решение, не получая фактов, из которых оно следует.

Практическая замена не требует новой функции обучения. Нужно отделить создание подсказки от обновления модели, включать её только для слабых групп, повторно собирать траектории и считать награды внутри того же контекста, в котором агент действовал. Цена такого решения — дополнительные запуски среды и модели-анализатора, поэтому шлюз становится не только частью качества, но и средством контроля вычислительных затрат.

Пока вывод ограничен интерактивными задачами с проверяемым итогом и тремя моделями указанного масштаба. Но для такой конфигурации работа даёт ясное инженерное правило: привилегированная информация должна помогать агенту получить полезный опыт, а не подменять собой данные, доступные ему при рабочем запуске.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу