Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Языковые агенты часто не связывают прежнее действие с последующим ответом среды, поэтому накопленная история может закреплять ошибку вместо исправления. Jingyu Liu и соавторы показали, что явная связь между действием и результатом повышает долю завершённых задач; в нерецензированном препринте все числа получили сами авторы. Для агентных систем это предлагает практичную замену сырому журналу: подписывать результаты действий или пропускать историю через отдельный модуль-калибратор.
Перемешанные действия почти не испортили результат
Сначала проверили базовое предположение: чем больше агент знает о своих прежних попытках, тем легче ему исправиться. Модель возвращали в раннее состояние неудачной траектории и либо давали только историю до этой точки, либо добавляли последующие действия и ответы среды как справочный материал.
Дополнительная история снизила вероятность восстановить выполнение задачи. Эффект проявился у пяти моделей — от Qwen3-8B до GPT-5.6-Sol — и во всех четырёх средах: ALFWorld, ScienceWorld, WebShop и AppWorld. Медианная длина расширенного запроса составляла около 1,6 тысячи токенов, поэтому результат нельзя объяснить одним лишь переполнением контекста.
Затем прошлые действия перемешали, но оставили ответы среды в исходном порядке. На 10 000 запусках доля успешно завершённых задач снизилась лишь на 2,55 процентного пункта относительно обычной истории. Значит, модели извлекали из журнала сведения о состоянии задачи, но слабо учитывали, какое именно действие привело к каждому результату.
Проверка охватывала те же модели и среды, а условия сравнивали на одинаковых задачах. Это интерактивные сценарии с выбором действий, покупками, работой в приложениях и выполнением инструкций; результат не показывает, как приём поведёт себя в произвольном агенте, который работает с другим набором инструментов или устройством памяти.
Метка результата оказалась полезнее свободной рефлексии
Первое исправление не добавляет агенту новых сведений. Каждый ответ среды явно помечают как результат предыдущего действия: модель видит не просто очередное наблюдение, а причинную пару «сделал — получил».
Такая разметка повысила долю завершённых задач во всех сводных разрезах по моделям и средам. На фиксированных историях агенты также реже повторяли одно и то же действие после двух неудачных попыток. Формат истории повлиял на решение, хотя содержание наблюдений не изменилось.
Попытка поручить рефлексию самому агенту сработала хуже. После каждого шага модель формулировала урок или отказывалась от обновления, а выбранный урок сохранялся в истории. Эти записи иногда пересказывали уже известный результат, а иногда добавляли вывод, которого среда не подтверждала; в итоге свободная рефлексия уступила и обычной истории, и простой разметке результатов.
Поэтому следующий вариант отделяет принятие решения от калибровки. Модуль на базе Qwen3-8B просматривает завершённый шаг и либо записывает короткий урок, либо возвращает команду не обновлять историю. Для обучения отбирали записи, которые улучшали следующее действие у нескольких разных моделей и не ухудшали его у остальных; качество сравнивала модель-оценщик GPT-5.6-Sol.
На отложенных задачах калибратор обошёл обычную историю и разметку результатов во всех сводных группах. Метод удалось встроить и непосредственно в агента: когда Qwen3-8B одновременно формировал калибровку и следующее действие, средняя успешность выросла с 47,21% до 52,21%.
Что менять в архитектуре агента
Работа не требует сразу обучать отдельную модель. Наиболее дешёвый первый шаг — изменить формат журнала: хранить ответ инструмента рядом с действием и явно называть его результатом этого действия. Такой шаблон можно проверить без новых данных и без дополнительного вызова модели.
Если агент выполняет длинные задачи и регулярно застревает, следующий уровень — отдельный калибратор. Он не должен автоматически писать рассуждение после каждого шага. Его задача — решить, появился ли полезный урок, сформулировать его без неподтверждённых правил и сохранить только то, что может изменить последующие действия.
Для продуктовой проверки недостаточно считать повторы действий. Свободная рефлексия сокращала повторы, но не повышала итоговый успех. Основной метрикой должна оставаться доля полностью завершённых задач, а промежуточными — восстановление после ошибки и качество следующего действия на одинаковой истории.
Планы команд меняются прежде всего там, где историю сейчас передают агенту как сплошной диалог. Увеличивать контекст или добавлять автоматические «выводы из опыта» без отбора рискованно: журнал содержит полезные факты, но не гарантирует, что модель правильно свяжет причину со следствием. Явная разметка подходит как локальная доработка, а обученный калибратор — как отдельный компонент для систем, где выигрыш в завершённых задачах оправдывает дополнительный вызов модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



