Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Контекст, который запомнил один ИИ-агент, можно передавать другим через общий системный слой, не заставляя каждого агента самостоятельно искать и фильтровать память. В работе Ryan Lum и Yongfeng Zhang из Rutgers University такая схема сократила задержку ответа на 15–61% по сравнению с передачей полного контекста, хотя препринт не проходил рецензирование, а все числа получили сами авторы. Для многoагентных продуктов это довод в пользу отдельного слоя памяти вместо повторения одной логики в каждом агенте.
Памятью управляет среда, а не отдельный агент
В прототипе на AIOS два специализированных агента извлекают стабильные сведения о пользователе и контекст текущей задачи. Третий агент отвечает пользователю, но сам ничего не ищет в памяти: готовый блок контекста добавляет ядро агентной системы.
Каждая запись хранит идентификатор пользователя, владельца, тип и правило доступа. Запись видит её владелец или другой агент, если она отмечена как общая. Отсутствующее или некорректное правило система трактует как запрет на общий доступ, поэтому безопасность не зависит от того, вспомнил ли разработчик добавить фильтр в очередной агент.
Ядро сначала определяет пользователя, затем ждёт записи незавершённых изменений, извлекает подходящие воспоминания и проверяет права. После этого оно убирает дубликаты, ранжирует записи по смысловой близости, сокращает их до заданного бюджета и добавляет к запросу в виде обычного текста.
Отдельная деталь решает типичную гонку между агентами. Если один агент сохраняет сведения одновременно с запросом другого, чтение ждёт подтверждения всех более ранних записей этого пользователя. После тайм-аута в 5000 мс система продолжает работу без строгой гарантии согласованности, чтобы один сбой хранилища не остановил ответы.
Структурированная запись при этом не означает, что модель увидит JSON. Ядро превращает профиль и задачу в естественные фразы: небольшие локальные модели использовали такой контекст надёжнее, чем исходные структуры. Переобучать модели для этого не требуется.
Обычный поиск терял профиль пользователя
Систему сравнили с Mem0 без управления со стороны ядра, обычным поиском с дополнением контекста (RAG) и прямой передачей всех сведений. Испытания включали 1800 синтетических диалогов с GPT-4o, Llama-3.1:8B и Qwen-2.5:7B. Модель-оценщик GPT-5.4 выставляла баллы за использование профиля, задачи и их связное объединение.
На GPT-4o оценка использования профиля выросла с 1,05 у Mem0 до 4,69 у системной памяти по пятибалльной шкале. В обоих вариантах использовался один базовый поставщик памяти, поэтому разрыв связан не с самим хранилищем, а с порядком записи, разрешением идентификаторов и передачей общей памяти между агентами.
Обычный RAG стабильно находил сведения о задаче, но терял профиль. Причина следует из устройства испытания: расплывчатый вопрос вроде «На чём мне сосредоточиться дальше?» по смыслу ближе к текущей задаче, поэтому профильные фрагменты не попадали в верхние результаты поиска. Более сильная модель не исправляла отсутствие нужного контекста.
Полная передача всех записей дала ориентир по максимально доступному контексту, но не гарантировала лучший ответ. Системная память сравнялась с ней на двух моделях из трёх; у Llama-3.1:8B результаты по задаче и объединению контекста оказались немного ниже. Значит, сокращение промпта не бесплатно для каждой модели, даже если общий результат близок.
Проверка охватывает трёх агентов, синтетические профили и задачи, а также намеренно неопределённые запросы. Основные оценки выставляла одна внешняя модель, а небольшая слепая проверка людьми подтвердила центральное сравнение для GPT-4o, но показала, что автоматический оценщик занижал качество RAG.
Когда стоит менять архитектуру продукта
Работа меняет планы команд, у которых несколько агентов обслуживают одного пользователя и должны совместно учитывать его предпочтения или текущую работу. В такой системе память лучше проектировать как службу среды исполнения: агенты записывают типизированные факты, а единый слой решает, кто и в каком виде их получит.
Практический выигрыш состоит не только в более коротком промпте. Централизация убирает из агентов повторяющийся код поиска, проверки доступа, форматирования и ожидания записи. Новому агенту не нужно заново реализовывать эти правила, чтобы пользоваться уже накопленным контекстом.
Гарантия приватности здесь узкая: ядро блокирует чужие закрытые записи по метаданным. Она не защищает от неверного идентификатора пользователя и не проверяет, правдивы ли сами воспоминания. Разрешение личности и контроль качества записей остаются отдельными частями архитектуры.
Для одного агента с короткой историей такой системный слой может не дать заметного преимущества перед прямой передачей контекста. Но при нескольких источниках памяти исследование показывает конкретную границу: само хранилище не обеспечивает персонализацию, если среда не контролирует порядок записи, видимость и сборку промпта.
Источники
Иллюстрация: рисунок из статьи «Kernel-Managed Shared Memory for System-Wide Personalization», Ryan Lum, Yongfeng Zhang, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



