Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
MemFit научилась сохранять долговременную память разговорного агента без вызова LLM при записи каждой новой реплики. На трёх бенчмарках система показала лучший результат среди сравненных подходов и в несколько раз сократила время и стоимость построения памяти, хотя препринт Mitchell Piehl и Muchao Ye не рецензирован и все замеры выполнили сами авторы. Архитектура предлагает отделить дешёвую неизменяемую запись от более сложного поиска, а не пересказывать историю при каждом обновлении.
Каждая реплика остаётся в исходном виде
Системы долговременной памяти обычно поручают LLM организовать новые сведения: выбрать важное, объединить похожие факты и сжать историю. Такой конвейер вызывает модель при записи, поэтому добавление очередной реплики требует времени и вычислений. Сжатие также может удалить деталь, которая понадобится в следующем разговоре.
MemFit вместо этого складывает каждый ход диалога без изменений в хранилище только с добавлением. Новые записи появляются в конце, а прежние не заменяются пересказом. Вызов LLM для вставки не нужен, поэтому операция не ждёт генерации текста.
Система всё же создаёт структуру для последующего поиска: реплики индексируются с помощью сводок по сегментам. Эти сводки служат указателями, но не заменяют исходные сообщения. Получается два слоя: полная история хранит детали, а компактное представление помогает найти подходящий фрагмент.
Такое разделение меняет роль сжатия. Оно больше не решает, какая информация навсегда останется в памяти, а какая исчезнет. Если способ индексирования позже изменится, исходные реплики по-прежнему доступны для повторной обработки.
Поиск объединяет слова, смысл и повторное ранжирование
Записать всё недостаточно: перед ответом агенту нужно извлечь из растущей истории несколько полезных эпизодов. MemFit делает это без LLM и запускает несколько путей поиска одновременно.
Лексический путь находит совпадающие слова и выражения. Он полезен для имён, терминов и других формулировок, которые сохранились в запросе почти без изменений. Семантический путь ищет близкий смысл, даже если пользователь выразил ту же мысль другими словами.
После первичного отбора отдельная модель совместно оценивает запрос и каждый найденный эпизод, а затем меняет их порядок. Такой этап точнее сравнивает кандидатов, чем независимые представления запроса и памяти. При этом отсутствие LLM не означает отсутствие обученных моделей: повторное ранжирование остаётся отдельной вычислительной операцией.
Для текстовых и мультимодальных материалов MemFit работает с эпизодами, дополненными подписями. Это позволяет включить разные типы содержимого в общую схему поиска, не превращая всю память в сжатый пересказ.
Отказ от LLM при записи и извлечении не ухудшил итоговую позицию системы: MemFit вышла на лучший уровень на LoCoMo, MemGallery и LongMemEval-S. Результаты относятся к этим бенчмаркам и описанным текстовым и мультимодальным сценариям; поскольку материал подготовлен по абстракту, а не по полному тексту, точную методику, масштаб опытов и состав базовых решений восстановить нельзя.
Планы стоит менять с прототипа контура памяти
Работа не требует сразу менять весь стек агента. Она меняет первую гипотезу для проверки: вместо LLM-конвейера, который переписывает память после каждого сообщения, можно начать с неизменяемого журнала реплик и вынести обработку в индекс и поиск.
Это особенно относится к продуктам, где агент ведёт долгие разговоры, возвращается к старым фактам или работает с мультимодальными эпизодами. Если запись сейчас вызывает LLM, прототип MemFit-подобной схемы должен сравнить качество ответов, задержку записи и её стоимость на реальной истории продукта. Замеры на общих бенчмарках не показывают, как поиск поведёт себя на собственных именах, документах и типичных формулировках пользователей.
У архитектуры есть понятный обмен ресурсов. Хранилище только с добавлением растёт вместе с историей, зато команда не теряет исходные данные из-за раннего сжатия. Вычисления не исчезают полностью: семантический поиск и модель повторного ранжирования остаются в контуре, поэтому их задержку и стоимость нужно считать отдельно.
MemFit также не превращает разговорного агента в систему без LLM. Языковая модель по-прежнему может рассуждать и формировать ответ; без неё работают операции памяти, которые записывают и подбирают контекст. Для архитектурного решения это существенная граница: работа предлагает удешевить инфраструктуру вокруг модели, а не заменить саму модель.
Практический вывод пока ограничен устройством эксперимента. Команде стоит проверить три элемента независимо: запись исходных реплик, индекс на сводках сегментов и многоканальный поиск с повторным ранжированием. Если выигрыш сохранится на продуктовых данных, дорогую обработку каждого нового сообщения можно убрать из критического пути записи.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



