Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Агента научили сохранять ход длинной задачи в обычных файлах и восстанавливать его после смены активного контекста. В препринте JD.com, который не прошёл рецензирование и где приведённые числа получили сами авторы, CAMG-RL показал средний результат 54,4% против 48,0% у сильнейшего из сопоставленных методов. Для разработчиков агентных систем это аргумент в пользу файлового рабочего пространства вместо отдельного интерфейса памяти.
Файл переживает смену контекста
В длинной задаче история действий рано или поздно перестаёт помещаться в активный контекст модели. Агент может забыть, почему отверг предыдущую правку, какие тесты уже запускал или на каком источнике основан промежуточный вывод.
CAMG даёт агенту постоянное рабочее пространство, которое сохраняется до конца задачи. Через обычную командную оболочку модель создаёт, читает, ищет и редактирует файлы. Перед заменой контекста она записывает текущее состояние в CONTINUATION.md, а после замены читает файл и продолжает работу.
Отдельных команд вроде «сохранить воспоминание» или «извлечь воспоминание» здесь нет. Используются файловые операции, которые уже встречались модели при обучении на коде. Это сокращает разрыв между привычным для модели способом работы и новым интерфейсом, который пришлось бы осваивать с нуля.
Одну политику обучали совместно в Shop, Coding, DeepResearch и AutoResearch. Задачи требовали помнить требования покупателя, результаты диагностики программы, найденные свидетельства или проверенные гипотезы. Награда зависела от итогового результата, поэтому модель сама училась решать, что записать, когда обновить файл и в какой момент прочитать его снова.
Для обучения использовали асинхронный PPO: исполнители отправляли завершённые эпизоды в очередь, а обучение шло независимо от самых медленных задач. Пользу оценивали для ответа целиком, но веса обновляли на уровне отдельных токенов, включая содержимое созданных файлов. Так итоговая награда влияла не только на выбор команды, но и на качество сохранённой заметки.
Преимущество даёт не хранилище, а привычный способ работы
На тестах CAMG файловая память обошла Mem0, Letta Code, AgeMem и обучение сжатия контекста. В покупках CAMG-RL и сжатие контекста работали почти одинаково, а основной разрыв возник в программировании и итеративной разработке моделей — там, где сохранённое состояние приходится дополнять и многократно использовать.
Базовая Qwen3.5 воспринимала файловые действия как более ожидаемые, чем специальные команды AgeMem. После обучения CAMG-RL всё чаще завершал полную цепочку «записать — прочитать — применить», тогда как AgeMem такую цепочку не освоил. Простого подключения внешнего хранилища оказалось недостаточно: агент должен научиться пользоваться записью при дальнейшем решении задачи.
Отдельная проверка усиливает этот вывод. Когда сохранённые файлы стирали или подменяли заметками из другой задачи, вероятность успеха снижалась. Значит, агент не просто совершал файловые действия ради награды, а переносил через границу контекста полезное содержание.
Перенос на внешние тесты тоже сохранился. CAMG-RL-4B набрал в среднем 10,2% на SWE-bench Verified и MLE-bench Lite против 10,1% у Qwen3.5-35B-A3B. CAMG-RL-9B получил 18,4% против 15,6% у Qwen3.5-122B-A10B. Это не делает малую модель универсальной заменой большой, но показывает, что обучение работе с памятью может компенсировать часть разницы в масштабе на длинных агентных задачах.
Что меняется в планах агентных команд
Для агента, у которого уже есть командная оболочка, репозиторий и рабочий каталог, отдельный API памяти теперь выглядит не обязательным первым шагом. Проще сохранить привычный файловый интерфейс, выделить постоянный каталог на время задачи и формализовать запись состояния перед заменой контекста.
- Память должна быть редактируемой. Агенту нужны не только добавление и поиск заметок, но и исправление устаревшего плана, объединение свидетельств и удаление неверной гипотезы.
- Обучать нужно полный цикл. Метрика должна учитывать, записал ли агент факт, вернулся ли к нему и повлиял ли файл на конечный результат. Количество созданных заметок само по себе ничего не доказывает.
- Длинные задачи требуют независимых исполнителей. Асинхронная очередь позволяет не останавливать обучение из-за одного долгого запуска тестов или поиска.
Проверка охватывает одну задачу, одного пользователя и модели семейства Qwen3.5 размером до 9B. Память между задачами и пользователями не изучалась. Поэтому работа меняет архитектурный приоритет для изолированных программных, исследовательских и аналитических агентов, но не подтверждает тот же подход для общей корпоративной памяти.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



