Журнал · Rit.work

Награда почти не учит LLM-агента на прошлых попытках

Эксперименты KAIST показывают, что LLM-агенты улучшают ответы благодаря самим прошлым попыткам, а не прикреплённым к ним оценкам.

Rit.work
Студия разработки
9 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Награда в памяти LLM-агента почти не влияет на то, чему он учится между попытками. В нерецензированном препринте KAIST, где все числа получили сами авторы, только 3,9% из 360 пар «задача — модель» оказались чувствительны к правильной награде. Поэтому память из сырых попыток и оценок стоит проектировать скорее как набор примеров, чем как замену обучению с подкреплением.

Команда изучила прямое обучение с подкреплением в контексте, или ICRL: модель не обновляет параметры, а получает предыдущие последовательности действий и состояний вместе с числовой оценкой. Исследователи оставляли попытки неизменными, но переворачивали оценки, заменяли их случайными или полностью убирали. Кривые улучшения почти не менялись, в том числе после прямых инструкций учитывать награду.

Главным сигналом оказалась сама попытка. Когда модель видела её в памяти, она чаще воспроизводила похожий ответ; влияние награды на вероятность повторения составляло около 14% от влияния траектории. Даже просьба избегать неудачного действия слабо подавляла повтор, поэтому накопление ошибок само по себе не заставляет агента искать другой путь.

Смысл и правильный порядок действий тоже оказались не обязательны. Перемешанные шаги в ScienceWorld и испорченный код, который не компилируется, помогали примерно так же, как настоящая история попыток. Однако примеры должны относиться к целевой задаче и выглядеть как реальные попытки её решить: траектории из других задач и случайные допустимые действия ухудшали результат.

Работу проверяли на шести открытых и закрытых моделях, двух наборах задач по программированию HumanEval+ и MBPP+ и текстовой среде ScienceWorld. Вывод относится к прямому ICRL с сырыми траекториями: методы, которые сначала превращают опыт в выводы, правила или рефлексию, в эти границы не входят. Для продукта это разделяет два подхода: хранить релевантные демонстрации или отдельно извлекать из опыта инструкции, а не рассчитывать, что поле с оценкой само изменит поведение агента.

Источники

Иллюстрация: рисунок из статьи «Do LLMs Learn from Rewards in Context? : Rethinking the role of reward in In-Context Reinforcement Learning», Minchan Kwon, Seunghee Koh, Sunghyun Baek и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу