Журнал · Rit.work

KVCMAS ускоряет общий контекст в многоагентных системах

KVCMAS переносит KV-кэш между агентами, исправляет его по ходу работы и сокращает задержку на длинных общих историях без отдельного опорного просчёта.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Общий контекст между ИИ-агентами научились переиспользовать без повторного полного просчёта для каждого агента, даже когда история меняется по ходу работы. В препринте Seoul National University, который не прошёл рецензирование и приводит замеры самих авторов, KVCMAS вдвое сократил время до первого токена против инференса без общего кэша. Метод может снизить требования к вычислениям и памяти у систем, где несколько ролей работают на одной модели.

Разные инструкции делают общий контекст разным

KV-кэш хранит рассчитанные ключи и значения механизма внимания, чтобы модель не обрабатывала прежние токены заново при каждом продолжении. В многоагентной системе один и тот же запрос, результат инструмента или ответ предыдущего агента входит в контекст нескольких ролей.

Однако роли получают разные системные инструкции и связующие подсказки. Из-за этих префиксов модель создаёт разные внутренние представления даже для совпадающего фрагмента истории. Прямое копирование кэша экономит вычисления, но снижает точность ответа.

Один класс методов решает проблему выборочным пересчётом: модель заново обрабатывает часть слоёв или токенов. Чем больше кэша она восстанавливает, тем меньше экономия. Другой класс оценивает разницу между кэшами и прибавляет поправку без запуска модели для каждого исправляемого элемента.

Такие поправки сложно применять к новым запросам и результатам инструментов, которые заранее не повторяются. KVComm поддерживает меняющийся контекст через пул опорных примеров, но хранит базовые кэши и поправки в полном размере. Кроме того, прежним методам нужен отдельный кэш без ролевого префикса: его приходится рассчитывать вне основного маршрута агентов.

Поправка следует за маршрутом агентов

KVCMAS полностью обрабатывает контекст для первого агента и получает точный кэш. Для следующего агента система берёт уже рассчитанный кэш предыдущего, оценивает вызванное новой ролью отклонение и применяет поправку. Исправленный результат становится опорой для следующего перехода.

Так система не строит отдельный кэш без ролевого контекста. Точный результат первого агента также снижает риск того, что ранняя ошибка изменит его ответ, попадёт в общую историю и затем распространится по всей цепочке.

Поправки и представления опорных примеров хранятся в низкоранговом виде: вместо полной матрицы KVCMAS сохраняет компактные множители, описывающие её основные направления. В экспериментах эффективный ранг поправок оставался ниже 32. При этом рабочий KV-кэш для механизма внимания не сжимается — компактное представление используют только для поиска похожей опоры и расчёта поправки.

Для нового фрагмента KVCMAS сравнивает исходный кэш с пулом опорных примеров и смешивает их поправки с весами по степени сходства. Если оценки сходства не выделяют надёжную опору, система отказывается от повторного использования и выполняет полный предварительный проход. Поэтому долю экономии можно менять порогом надёжности, не заставляя систему исправлять каждый кэш приблизительно.

Выигрыш появляется на длинном контексте и под нагрузкой

В контролируемом тесте с 32 тысячами общих токенов и восемью запросами в секунду KVCMAS показал двукратное ускорение медианного времени до первого токена относительно инференса без общего кэша. Цепочная поправка сократила эту задержку на 34% против варианта с отдельным опорным просчётом. Пиковое потребление памяти оказалось до 3,7 раза ниже, чем у KVComm.

Метод проверяли на текстовых и визуально-языковых задачах, а также на контролируемых трассах обслуживания с разной длиной общей истории и частотой запросов. Его сравнивали с отсутствием общего кэша, выборочным пересчётом и прежними методами поправки. По качеству ответов KVCMAS соответствовал этим методам или превосходил их, но на коротком контексте и при небольшой нагрузке разница в задержке уменьшалась.

Работа относится к архитектуре, где агенты используют одни веса модели и различаются подсказками. Для систем с отдельными моделями или адаптерами на каждую роль эти замеры не отвечают на вопрос о выгоде. Метод также требует доступа к KV-кэшу и контуру инференса, поэтому его нельзя реализовать на стороне приложения поверх закрытого API.

Для собственной инфраструктуры вывод практический: длинную общую историю больше не обязательно закладывать в бюджет как полный повторный просчёт на каждом шаге. Если агенты часто передают друг другу запросы, наблюдения инструментов и ответы, KVCMAS стоит оценивать вместе с маршрутизацией и пакетной обработкой. Команде придётся поддержать пул опорных примеров, расчёт компактных поправок и возврат к полному проходу при ненадёжном совпадении.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу