Журнал · Rit.work

MGPO отделяет новый вклад памяти LLM от унаследованной пользы

MGPO оценивает каждое переписывание памяти по его будущей пользе и учит LLM сохранять меньше текста без снижения качества извлечения информации.

Rit.work
Студия разработки
1 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научили оставлять в долговременной текстовой памяти только записи, которые помогают на следующих шагах длинного документа. В работе University of Michigan средняя память сократилась почти в пять раз, а извлечение информации стало точнее, хотя препринт не рецензирован и все числа получили сами авторы. Для продуктовых команд это меняет цель обучения памяти: оценивать нужно вклад конкретного переписывания, а не качество всей накопленной записи.

Как измерили пользу отдельного переписывания

Система читает документ по частям и после каждой обновляет текстовую память с ограниченным объёмом. Проблема возникает при обучении: если итоговая запись помогла ответить правильно, непонятно, принесло ли пользу последнее изменение или ответ уже содержался в прежнем состоянии памяти.

MGPO устраняет эту неоднозначность прямым сравнением. Один и тот же фиксированный читатель решает одну и ту же задачу сначала со старой версией памяти, затем с новой. Разница между результатами показывает, что добавило конкретное переписывание.

Сравнение не заканчивается на ближайшей задаче. Новая деталь может оказаться бесполезной сразу после записи, но помочь позже, когда модель встретит вторую часть доказательства. Поэтому MGPO проверяет старую и новую память на всех последующих фрагментах документа и суммирует разницу.

Так метод отделяет новую пользу от унаследованной. Переписывание получает награду не за весь результат читателя, а только за изменение результата, которое оно вызвало сейчас или в будущем.

Обучают только модель-писатель, которая решает, что сохранить, удалить или переформулировать. Читатель остаётся фиксированным, иначе изменение ответа нельзя было бы связать именно с памятью. В основном режиме писателем служил Qwen3-8B, а читателем — Qwen3-14B; документы делили на фрагменты по 1 024 токена, память ограничивали 256 токенами.

Математически MGPO сохраняет ту же ожидаемую цель обучения, что и награда за фактические ответы. Меняется распределение награды между шагами: из неё вычитают пользу, которую уже обеспечивала старая память. Это даёт более точный обучающий сигнал без отдельной модели-оценщика.

Короткая память обошла прямое чтение и другие системы

Основной эксперимент построили на SciREX: система группировала упоминания одной сущности в научных статьях и извлекала связи между сущностями. MGPO сравнили с прямым чтением документа, внешней памятью LightRAG и Mem0, а также обучаемыми политиками MemAgent и HiMPO.

После обучения средняя память занимала 43 токена против 202 у исходного писателя MGPO-base — почти в пять раз меньше. При этом F1 для группировки сущностей вырос с 39,2 у прямого чтения до 51,3. F1 здесь объединяет точность — долю правильных результатов среди найденных — и полноту, то есть долю найденного среди требуемого.

Писатель также показал лучший результат среди сопоставленных методов при извлечении связей. Сокращение памяти не свелось к агрессивному удалению текста: модель сохраняла меньше записей, но чаще оставляла те, которые помогали соединять сведения из удалённых частей документа.

Границы проверки задают область, на которую пока распространяется вывод. Писателя обучали на SciREX, затем без дополнительного обучения переносили на AIPAN-10K с политиками конфиденциальности и подключали к читателям из разных семейств моделей. Перенос сработал и в выбранных задачах BABILong, но основная доказательная база работы всё же относится к извлечению структурированных данных из длинных документов.

Когда MGPO меняет план разработки памяти

Работа предлагает полезную архитектурную границу: память стоит писать отдельной моделью, а её качество измерять через фиксированного потребителя. Такой подход подходит системам, где результат можно автоматически проверить: извлечению реквизитов и связей, обработке досье, последовательному разбору отчётов или накоплению фактов по длинному процессу.

Для обучения потребуется хранить соседние состояния памяти и многократно запускать читателя на будущих целях. Число таких проверок растёт быстрее длины последовательности, поскольку раннее переписывание оценивают на большем числе последующих фрагментов. Это дополнительная цена обучения, которой нет при обычной награде только за итоговый ответ.

Во время работы продукта контрфактические проверки не нужны. Система идёт по обычной последовательности: получает новый фрагмент, переписывает память и передаёт её читателю. Поэтому метод добавляет вычисления главным образом на этапе подготовки писателя, а не в каждом пользовательском запросе.

Менять текущую реализацию целиком из-за одной работы рано. Практический следующий шаг — взять журнал реальных последовательностей, определить проверяемую полезность ответа и сравнить старую и новую память на одинаковых будущих задачах. Если разница даёт устойчивый сигнал, MGPO предлагает способ превратить его в обучение; если полезность нельзя измерить автоматически, главный механизм работы применить будет сложнее.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу