Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Авторы предложили CAPTURE — архитектуру памяти LLM-агента, которая различает смену предпочтений пользователя, временный контекст и внедрённые извне указания; работа опубликована как препринт и не проходила рецензирования. По их замерам, доля побед над неперсонализированной базовой моделью составила 71,5% против 69,3% у модели с теми же обучающими данными. Результат важен командам, которые проектируют долговременную память для ассистентов, работающих с документами, инструментами и историей пользователя.
Что сделали
CAPTURE хранит не готовый профиль пользователя, а состояние уверенности в его предпочтениях. Между событиями оно обновляется нейронным дифференциальным уравнением: так система учитывает реальное время между взаимодействиями, а не только порядок сообщений.
Новые предположения распределяются по стабильному, контекстному и временному слоям памяти. Противоречие может изменить существующее предпочтение, сузить его до отдельного проекта, попасть в карантин или вызвать уточняющий вопрос. Ограничения безопасности вынесены за пределы персонализации, поэтому записи в памяти не могут снизить заданный порог безопасности.
Для проверки объяснений система удаляет каждую процитированную запись и повторно формирует ответ. Если удаление ничего не меняет, ссылка на такую запись исключается, а её вес при дальнейшем поиске снижается. При заранее заданной политике атак доля успешного отравления памяти составила 11,5%.
Что это значит
Работа показывает практический вариант архитектуры, в которой обновление профиля становится отдельным решением, а не автоматической записью последнего утверждения. Это полезно для агентов, где одинаковый канал может переносить как настоящее изменение предпочтений, так и текст из заражённого документа. Однако преимущество над моделью с тем же обучением невелико, поэтому основную пользу авторы связывают не только с архитектурой, но и с размеченным обучением на изменениях предпочтений и атаках.
Ограничения. Основной тест проведён на 480 отложенных эпизодах D-PrefGuard, созданного самими авторами преимущественно с помощью генеративных моделей; внешний HorizonBench также содержит смоделированные траектории. Работа не показывает устойчивость в длительной промышленной эксплуатации. При атакующем, который знает устройство и веса защиты, успешность отравления выросла до 24,7%, а преимущество перед фильтром по происхождению данных авторы не смогли надёжно отделить от погрешности. Поэтому CAPTURE пока не обосновывает замену такого фильтра в сценариях с адаптивным противником.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



