Журнал · Rit.work

MemFit записывает память агента без вызовов LLM

MemFit сохраняет реплики без сжатия, а затем сочетает лексический и смысловой поиск, чтобы снизить стоимость долговременной памяти разговорных агентов.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

MemFit научилась сохранять долговременную память разговорного агента без вызова LLM при записи каждой новой реплики. На трёх бенчмарках система показала лучший результат среди сравненных подходов и в несколько раз сократила время и стоимость построения памяти, хотя препринт Mitchell Piehl и Muchao Ye не рецензирован и все замеры выполнили сами авторы. Архитектура предлагает отделить дешёвую неизменяемую запись от более сложного поиска, а не пересказывать историю при каждом обновлении.

Каждая реплика остаётся в исходном виде

Системы долговременной памяти обычно поручают LLM организовать новые сведения: выбрать важное, объединить похожие факты и сжать историю. Такой конвейер вызывает модель при записи, поэтому добавление очередной реплики требует времени и вычислений. Сжатие также может удалить деталь, которая понадобится в следующем разговоре.

MemFit вместо этого складывает каждый ход диалога без изменений в хранилище только с добавлением. Новые записи появляются в конце, а прежние не заменяются пересказом. Вызов LLM для вставки не нужен, поэтому операция не ждёт генерации текста.

Система всё же создаёт структуру для последующего поиска: реплики индексируются с помощью сводок по сегментам. Эти сводки служат указателями, но не заменяют исходные сообщения. Получается два слоя: полная история хранит детали, а компактное представление помогает найти подходящий фрагмент.

Такое разделение меняет роль сжатия. Оно больше не решает, какая информация навсегда останется в памяти, а какая исчезнет. Если способ индексирования позже изменится, исходные реплики по-прежнему доступны для повторной обработки.

Поиск объединяет слова, смысл и повторное ранжирование

Записать всё недостаточно: перед ответом агенту нужно извлечь из растущей истории несколько полезных эпизодов. MemFit делает это без LLM и запускает несколько путей поиска одновременно.

Лексический путь находит совпадающие слова и выражения. Он полезен для имён, терминов и других формулировок, которые сохранились в запросе почти без изменений. Семантический путь ищет близкий смысл, даже если пользователь выразил ту же мысль другими словами.

После первичного отбора отдельная модель совместно оценивает запрос и каждый найденный эпизод, а затем меняет их порядок. Такой этап точнее сравнивает кандидатов, чем независимые представления запроса и памяти. При этом отсутствие LLM не означает отсутствие обученных моделей: повторное ранжирование остаётся отдельной вычислительной операцией.

Для текстовых и мультимодальных материалов MemFit работает с эпизодами, дополненными подписями. Это позволяет включить разные типы содержимого в общую схему поиска, не превращая всю память в сжатый пересказ.

Отказ от LLM при записи и извлечении не ухудшил итоговую позицию системы: MemFit вышла на лучший уровень на LoCoMo, MemGallery и LongMemEval-S. Результаты относятся к этим бенчмаркам и описанным текстовым и мультимодальным сценариям; поскольку материал подготовлен по абстракту, а не по полному тексту, точную методику, масштаб опытов и состав базовых решений восстановить нельзя.

Планы стоит менять с прототипа контура памяти

Работа не требует сразу менять весь стек агента. Она меняет первую гипотезу для проверки: вместо LLM-конвейера, который переписывает память после каждого сообщения, можно начать с неизменяемого журнала реплик и вынести обработку в индекс и поиск.

Это особенно относится к продуктам, где агент ведёт долгие разговоры, возвращается к старым фактам или работает с мультимодальными эпизодами. Если запись сейчас вызывает LLM, прототип MemFit-подобной схемы должен сравнить качество ответов, задержку записи и её стоимость на реальной истории продукта. Замеры на общих бенчмарках не показывают, как поиск поведёт себя на собственных именах, документах и типичных формулировках пользователей.

У архитектуры есть понятный обмен ресурсов. Хранилище только с добавлением растёт вместе с историей, зато команда не теряет исходные данные из-за раннего сжатия. Вычисления не исчезают полностью: семантический поиск и модель повторного ранжирования остаются в контуре, поэтому их задержку и стоимость нужно считать отдельно.

MemFit также не превращает разговорного агента в систему без LLM. Языковая модель по-прежнему может рассуждать и формировать ответ; без неё работают операции памяти, которые записывают и подбирают контекст. Для архитектурного решения это существенная граница: работа предлагает удешевить инфраструктуру вокруг модели, а не заменить саму модель.

Практический вывод пока ограничен устройством эксперимента. Команде стоит проверить три элемента независимо: запись исходных реплик, индекс на сводках сегментов и многоканальный поиск с повторным ранжированием. Если выигрыш сохранится на продуктовых данных, дорогую обработку каждого нового сообщения можно убрать из критического пути записи.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу