Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Jundong Hu и Shekar Ramachandran из PayPal AI изучили, как модели разного масштаба используют постоянную память агента — сохранённые между сессиями факты; их работа представляет собой препринт, не проходивший рецензирования. По замерам авторов, модели выбирали устаревшее значение в 92–100% случаев, когда без памяти задача не решалась. Результат важен командам, которые проектируют персонализированных агентов и рассчитывают снизить риск простой заменой модели.
Что сделали
Авторы собрали закрытый набор из 300 сценариев, где ответ выбирается из заданных действий и проверяется без модели-оценщика. В первой части сохранённый факт необходим для выполнения запроса. Во второй правильное текущее значение всегда возвращает авторитетный инструмент, поэтому можно измерить вред от памяти относительно варианта без неё.
Эксперименты провели на серии Qwen3 от 0,6 до 8 млрд параметров. Авторы независимо меняли признаки заметки: наличие метки, дату, заявленный источник и положение в контексте. Удаление метки усиливало доверие к устаревшей записи при любом масштабе. Более новая дата сильнее вводила в заблуждение крупные модели, тогда как заявленная авторитетность источника влияла слабо.
Способ исправления тоже зависел от возможностей модели. Показ метаданных помогал более крупным вариантам, но младшим было недостаточно увидеть конфликт: правильное значение требовалось определить заранее и передать уже без противоречия.
Что это значит
Обновление модели не заменяет управление состоянием памяти. Перед формированием контекста системе стоит сопоставлять даты и источники, удалять утратившие силу записи и разрешать конфликты программно. Метки памяти полезно сохранять, но полагаться только на них или на инструкцию выбрать авторитетный источник по результатам этой работы нельзя.
Ограничения. Основные замеры выполнены на синтетических сценариях с ограниченным набором действий и одной серией Qwen3; проверка на Llama-Instruct охватывает только модели, вышедшие выше минимального уровня возможностей. RGB и MisBench расширяют проверку, но работа не содержит широкой матрицы семейств и масштабов. Авторы исследовали чтение уже подготовленной памяти, а не полный цикл записи, обновления, поиска и применения в работающем агенте.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



