Журнал · Rit.work

MemFold учит компактную память на собственных ответах модели

MemFold сжимает историю пользователя в постоянное число векторов и учит модель применять эту память по результатам её собственных ответов.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Долгую историю общения с пользователем научились сворачивать в компактную векторную память так, чтобы ассистент лучше соблюдал изменившиеся предпочтения. В препринте MemFold, который не прошёл рецензирование и приводит замеры самих авторов, Qwen3-4B на PersonaMem-128K дал 89,4% точных ответов против 65,7% у обучения только по итоговой награде. Для продукта это обещает постоянный по размеру вход памяти, но не отменяет чтение истории перед каждым ответом.

Память оценивают по ответу, а не по пересказу

Обычные компрессоры учатся восстанавливать исходный текст или повторять эталонный ответ. Такое обучение проверяет модель на заранее заданной последовательности, а не на ошибках, которые она допускает после сжатия истории.

MemFold сначала выделяет из истории сведения, связанные с текущим запросом: предпочтения, их изменения, временные связи и выведенные факты. Затем компрессор превращает эту текстовую выжимку в мягкую память (soft memory) — фиксированный набор непрерывных векторов, которые модель получает вместо исходного текста.

После начальной настройки компрессор замораживают, а модель генерирует несколько собственных ответов. GRPO сравнивает их итоговые оценки внутри группы и повышает вероятность более удачных вариантов. Но одна награда за весь ответ не показывает, в каком месте модель перестала учитывать память.

Второй сигнал даёт замороженная копия той же модели. Она читает полную текстовую выжимку и оценивает каждый токен ответа, уже созданного моделью с векторной памятью. Если текстовая версия увереннее в конкретном токене, этот токен получает больший вес при обучении; влияние сигнала ограничено, потому что эталонная копия сама может ошибаться.

Эталонная модель не генерирует свои ответы и не подменяет выбор ученика. Она только повторно оценивает готовую последовательность, поэтому не требует дополнительного авторегрессионного вывода. При использовании MemFold её полностью убирают: остаются модель, текстовая выжимка и компрессор.

Разрыв растёт вместе с длиной истории

На Qwen2.5-7B MemFold получил 88,0% точности на PersonaMem-32K против 70,0% у GRPO. На более длинном PersonaMem-128K результаты составили 94,4% и 62,2% соответственно. Та же закономерность сохранилась на других проверенных версиях Qwen: преимущество стало заметнее при длинной истории.

Один пример показывает, какую ошибку исправляет обучение. Пользователь ранее дал понять, что не любит носимые устройства, но GRPO и другой метод всё равно посоветовали Fitbit, Apple Watch и фитнес-трекеры. MemFold предложил журнал тренировок, измерения тела и фотографии прогресса. Это иллюстрация механизма, а не оценка частоты таких ошибок.

Проверка охватывает семейства Qwen2.5 и Qwen3. Модель обучали на PersonaMem-32K и отдельно на LoCoMo, а затем без дополнительной настройки переносили на PrefEval и LongMemEval. Для двух переносных тестов ответы оценивала Gemini-3.8-flash; на одном варианте PrefEval MemFold лишь разделил лучший результат с базовыми методами, поэтому перенос работает неравномерно.

Сравнение включало передачу полного текста, GRPO, OPSD и компрессоры xRAG, AutoCompressor и MemGen. Перемешивание векторной памяти между примерами или её удаление заметно ухудшало ответы: модель использовала сведения конкретного пользователя, а не только угадывала по формулировке задачи. Разбор компонентов также показал, что основную прибавку дала награда за результат, а поточечный сигнал эталонной модели добавил меньший эффект.

Когда MemFold меняет архитектурный план

Подход имеет смысл для ассистентов, где история постоянно растёт, а генератору на каждом ходе нужны только актуальные для запроса факты. Вместо переменного объёма текста он получает фиксированный интерфейс, поэтому размер памяти на входе генератора не зависит от длины диалога.

Это не способ перестать обрабатывать длинную историю. Перед ответом MemFold всё равно один раз читает её, чтобы построить текстовую выжимку. Когда бюджет векторов меняли в восемь раз, полные затраты в токеновом эквиваленте на длинном тесте изменились менее чем на 1%: почти вся стоимость приходилась на исходное чтение, а не на компактный вход генератора.

Для команды практический сдвиг состоит в другом: компрессор стоит обучать не только восстанавливать факты, но и поддерживать нужное поведение на ответах самой модели. Это особенно уместно там, где ошибка локальна — например, одна рекомендация противоречит старому возражению пользователя, хотя остальной ответ выглядит уместно.

Проверка пока относится к моделям Qwen и задачам персонализации и долговременной памяти. В план обучения также придётся заложить начальную подготовку компрессора и дополнительные проходы эталонной модели, хотя при рабочем выводе этих расходов уже нет.

Источники

Иллюстрация: рисунок из статьи «MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization», Jingxuan Wu, Yuzhe Yang, Yiqiao Huang и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу