Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Длинную историю действий ИИ-агента научились сокращать по ходу работы, сохраняя не весь журнал, а ход проверки гипотез и текущее состояние задачи. В препринте Fudan University и Hong Kong Polytechnic University, который не прошёл рецензирование и приводит числа, полученные самими авторами, ARSM сократил расход токенов максимум на 82% и в большинстве опытов сохранил или улучшил результат. Такой подход позволяет ограничивать контекст без обучения отдельной модели сжатия.
Как история превращается в цепочки HAR
Обычный агент чередует рассуждение, вызов инструмента и чтение ответа. При отладке кода один тест или просмотр файла может вернуть длинный журнал, хотя следующему шагу нужны только проверяемая гипотеза, выполненное действие и вывод из результата.
ARSM сохраняет эти элементы как короткую цепочку HAR: гипотеза, действие, результат. Гипотеза описывает цель следующего шага, действие содержит точный вызов инструмента, а результат фиксирует полезный вывод из ответа среды. Полный ответ остаётся в недавней истории, но затем уступает место краткой записи.
На каждом ходе модель выдаёт не только следующее действие, но и метаданные для обновления памяти. Она отмечает, продолжается ли работа, достигнут ли промежуточный результат, закончилась ли ветка неудачей или решена вся задача. Контроллер разбирает этот ответ и обновляет состояние по заданным правилам.
Состояние разделено по назначению. В нём лежат общий план, известные ошибки и запреты, предупреждения о повторяющихся действиях, подтверждённые промежуточные выводы и активная цепочка HAR. При успехе подзадачи контроллер сворачивает активную ветку в подтверждённый факт, а при неудаче сохраняет причину и возвращает рассуждение к последнему проверенному шагу.
Следующий запрос состоит из структурированного состояния, нескольких свежих ответов инструментов и инструкций по формату. Параметр сжатия регулирует, сколько места получит каждый блок: чем он выше, тем меньше исходной истории остаётся рядом с компактным состоянием.
Сжатие помогает не во всех режимах одинаково
На WebShop с моделью семейства Qwen ARSM сократил общий расход токенов на 66%, а награда выросла с 0,2858 до 0,4906. Здесь структурированная память не просто уменьшила запросы: агент также лучше выполнял задания в имитации интернет-магазина.
В Multi-Objective Multi-Hop QA пиковый размер контекста уменьшился на 79%, при этом выросли оценки точных ответов и полноты совпадения. Задача требует последовательно искать факты для нескольких целей, поэтому сохранение промежуточных выводов отдельно от исходных ответов оказалось полезнее простого обрезания истории.
На SWE-Bench Lite компромисс оказался заметнее. При среднем уровне сжатия и крупной модели Qwen расход токенов снизился на 52%, но агент решил меньше задач, чем базовая конфигурация. Более агрессивное удаление исходных ответов экономило ещё больше контекста, однако сильнее ухудшало результат.
Проверка отдельных компонентов объясняет разницу. Обычное структурированное резюме хорошо сжимало историю, но теряло качество. Одни цепочки HAR чаще улучшали решение задач, а один контроллер состояния в основном сокращал память. Лучший баланс давало их совместное использование.
Метод проверяли на WebShop, Multi-Objective Multi-Hop QA и SWE-Bench Lite с моделями семейств Qwen, DeepSeek и GLM. Сравнения включали обычных агентов и системы управления памятью, однако часть альтернатив использовала обучение с подкреплением, поиск по внешней базе или вспомогательную модель. Поэтому таблицы показывают инженерный компромисс, а не полностью равные условия.
Планы меняются на уровне оркестрации, а не выбора модели
ARSM не требует менять поставщика LLM или обучать собственные веса. Команде нужно изменить протокол агента: модель должна возвращать действие, краткий вывод и сигнал для контроллера, а приложение — разбирать этот формат, обновлять состояние и собирать следующий контекст.
Подход имеет смысл проверять там, где инструменты возвращают длинные логи, результаты поиска, содержимое файлов или другие объёмные ответы. Если основную часть расходов создаёт повторная передача старой истории, структурированное состояние может уменьшить запросы без отдельного конвейера суммаризации.
Сжатие нельзя настраивать только по числу токенов. На задачах с кодом исходная деталь иногда нужна через много шагов, а модель может неверно пересказать её при сворачивании. Модель-оценщик дала фактической точности сжатого состояния 76,1%, поэтому HAR-запись нельзя считать безошибочной заменой исходного журнала.
Практический пилот должен сравнивать завершение задач, расход входных токенов и повторение неудачных действий на собственных трассах агента. Если качество держится при сокращении истории, ARSM позволяет заложить ограниченный контекст в архитектуру сразу. Если результат чувствителен к удалению логов, нужно сохранять больше свежих ответов и использовать менее агрессивное сжатие.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



