Журнал · Rit.work

GraphMemory сократила цену растущей памяти агента

GraphMemory хранит стратегии агента в графе и загружает только связанный с запросом фрагмент, сокращая расход токенов без резкого падения точности в проверенных финансовых задачах.

Rit.work
Студия разработки
5 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Память агента научились наращивать без подмешивания всего накопленного опыта в каждый новый запрос. GraphMemory сократила расход токенов на построение памяти на 81–85%, сохранив близкое к ACE качество; препринт не рецензирован, а числа получили сами авторы. Для архитектуры агента это означает, что хранилище опыта и активный контекст стоит проектировать как разные части системы.

Память растёт, а активный контекст остаётся ограниченным

Системы вроде ACE хранят извлечённые из прошлых задач правила в общем текстовом сборнике. При обработке следующего примера модель получает этот сборник целиком, поэтому каждый новый фрагмент памяти увеличивает все последующие запросы.

Проблема возникает не из-за самого накопления знаний. Агенту как раз нужно сохранять стратегии, исправления и причины прошлых ошибок. Расход растёт потому, что объём хранилища напрямую определяет объём контекста, который модель перечитывает при каждом вызове.

GraphMemory разрывает эту связь. Каждая стратегия становится узлом графа, а рёбра отмечают стратегии, которые полезно применять вместе. Например, правило выбора финансовой формулы можно связать с проверкой единиц измерения и обработкой пропущенных значений, не объединяя их в один длинный документ.

Перед ответом отдельный модуль читает компактный индекс: идентификаторы узлов и короткие ключи без полного текста. Он выбирает несколько входных узлов, после чего система обходит ближайшие связи в пределах заданного бюджета. Генератор получает только найденный фрагмент графа.

При фиксированном числе извлекаемых узлов объём полной памяти в контексте не зависит от количества обработанных примеров. Сам граф при этом продолжает расти. Строгой постоянной стоимости всей операции нет: индекс тоже увеличивается, хотя его короткие записи занимают меньше места, чем полное содержимое узлов.

Связи между стратегиями обучаются на результате

Цикл GraphMemory состоит из извлечения, генерации ответа, разбора результата и редактирования памяти. Последние три этапа взяты из ACE, но редактор теперь может менять не только текстовые правила, но и связи между ними.

После ответа модуль разбора помечает использованные переходы как полезные, вредные или нейтральные. Эти оценки накапливаются на рёбрах. При следующем обходе система раньше выбирает связи, за которыми чаще следовал полезный результат, а нейтральные наблюдения не меняют приоритет.

Редактор применяет изменения локально: добавляет или уточняет узел, создаёт ребро либо корректирует существующее. Ему не требуется переписывать общий сборник правил. Экономия поэтому появляется и во время обучения памяти, когда система обрабатывает последовательность примеров, и при обычных запросах к уже собранному графу.

Граф здесь не обязателен для самого принципа. Формализация допускает хранилище текстовых фрагментов с поиском по смысловой близости. Особенность GraphMemory в том, что она сначала делает смысловой выбор, а затем дешёво и предсказуемо добавляет связанные правила обычным обходом графа.

Когда GraphMemory меняет архитектурный план

На Formula с Qwen3.8-27B GraphMemory обошла ACE на 1,5 процентного пункта, использовав 19% её бюджета токенов для построения памяти. С Claude Haiku 4.5 результат оказался ниже ACE на четыре пункта. Это не бесплатная экономия, но разрыв качества остаётся меньше разрыва в расходе контекста.

На тестовых запросах расход токенов снизился на 79–92%. Однако каждый ответ формировался примерно в 1,8 раза дольше: перед генерацией GraphMemory запускает отдельное извлечение, тогда как ACE сразу передаёт модели всю память. Для продукта с жёстким пределом задержки этот обмен токенов на время нужно проверять на собственном маршруте запросов.

Проверка охватывает Formula и FiNER, модели Claude Haiku 4.5 и Qwen3.8-27B, один проход по обучающим данным и сравнение с ACE. Обе задачи относятся к финансовым рассуждениям, поэтому выводы прямо описывают такой масштаб и тип нагрузки, а не любую агентную память.

Работа меняет планы команд, у которых агент постоянно пополняет текстовую память и уже приближается к пределу контекстного окна. Вместо увеличения окна или регулярного сжатия общего документа можно заложить отдельное долговременное хранилище, ограниченное извлечение и локальные обновления.

Если память невелика и почти не меняется, дополнительный этап поиска только усложнит систему. GraphMemory становится содержательной архитектурной альтернативой тогда, когда опыт должен расти дольше, чем контекст одного запроса, а правила важно хранить в доступном для проверки и переноса виде.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу