Журнал · Rit.work

CAPTURE отделяет смену предпочтений от отравления памяти LLM-агента

Авторы CAPTURE предлагают проверять подлинность изменений в памяти LLM-агента, но преимущество сокращается при адаптивной атаке.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Авторы предложили CAPTURE — архитектуру памяти LLM-агента, которая различает смену предпочтений пользователя, временный контекст и внедрённые извне указания; работа опубликована как препринт и не проходила рецензирования. По их замерам, доля побед над неперсонализированной базовой моделью составила 71,5% против 69,3% у модели с теми же обучающими данными. Результат важен командам, которые проектируют долговременную память для ассистентов, работающих с документами, инструментами и историей пользователя.

Что сделали

CAPTURE хранит не готовый профиль пользователя, а состояние уверенности в его предпочтениях. Между событиями оно обновляется нейронным дифференциальным уравнением: так система учитывает реальное время между взаимодействиями, а не только порядок сообщений.

Новые предположения распределяются по стабильному, контекстному и временному слоям памяти. Противоречие может изменить существующее предпочтение, сузить его до отдельного проекта, попасть в карантин или вызвать уточняющий вопрос. Ограничения безопасности вынесены за пределы персонализации, поэтому записи в памяти не могут снизить заданный порог безопасности.

Для проверки объяснений система удаляет каждую процитированную запись и повторно формирует ответ. Если удаление ничего не меняет, ссылка на такую запись исключается, а её вес при дальнейшем поиске снижается. При заранее заданной политике атак доля успешного отравления памяти составила 11,5%.

Что это значит

Работа показывает практический вариант архитектуры, в которой обновление профиля становится отдельным решением, а не автоматической записью последнего утверждения. Это полезно для агентов, где одинаковый канал может переносить как настоящее изменение предпочтений, так и текст из заражённого документа. Однако преимущество над моделью с тем же обучением невелико, поэтому основную пользу авторы связывают не только с архитектурой, но и с размеченным обучением на изменениях предпочтений и атаках.

Ограничения. Основной тест проведён на 480 отложенных эпизодах D-PrefGuard, созданного самими авторами преимущественно с помощью генеративных моделей; внешний HorizonBench также содержит смоделированные траектории. Работа не показывает устойчивость в длительной промышленной эксплуатации. При атакующем, который знает устройство и веса защиты, успешность отравления выросла до 24,7%, а преимущество перед фильтром по происхождению данных авторы не смогли надёжно отделить от погрешности. Поэтому CAPTURE пока не обосновывает замену такого фильтра в сценариях с адаптивным противником.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу