Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Долговременную память LLM-агента научили перестраиваться после обращений, чтобы следующие поиски учитывали прежний опыт. REALM от команды Shanghai Jiao Tong University, National University of Singapore и OPPO опередила лучший результат на LoCoMo на 7,17 процентного пункта, хотя работа не рецензирована и числа в ней получили сами авторы. В схеме агента появляется отдельный этап: после ответа система обновляет не только содержимое памяти, но и связи внутри неё.
REALM хранит сведения как граф с узлами для фактов, событий, сущностей и эпизодов. При поиске агент сам выбирает начальные узлы, расширяет область просмотра по связям и отбирает подходящие сведения. После выполнения задачи он меняет только активированную часть графа: добавляет связи между совместно использованными узлами, усиливает полезные пути и ослабляет те, что приводили к лишним сведениям.
На LongMemEval REALM обошла лучший из сравниваемых подходов на 1,31 процентного пункта. Перемешивание порядка вопросов не устранило выигрыш. После перестройки графа доля запросов, для которых поиск находил подтверждающие сведения, выросла на 3,70%, а доля правильных ответов при уже найденных сведениях — на 20,83%. Значит, система выигрывала прежде всего за счёт более подходящего набора фактов, а не за счёт расширения поиска.
Проверка охватывала LoCoMo и LongMemEval — наборы вопросов по длинным историям диалогов, включая вопросы о времени, предпочтениях и событиях из нескольких сеансов. В обоих случаях GPT-4o-mini служила базовой моделью агента и моделью-оценщиком, которая определяла долю правильных ответов. REALM сравнивали с плоскими, временными и графовыми системами памяти, поэтому результат показывает преимущество архитектуры в этих условиях, но не сравнивает разные базовые модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



