Журнал · Rit.work

KITE оставляет мультиагентным LLM один канал связи

Метод калибрует полезность KV-кэша по поведению принимающего агента, сокращая обмен данными и вычисления без дополнительного обучения.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Мультиагентную систему на базе LLM научили передавать между агентами только полезную часть внутреннего состояния вместо копирования данных всех слоёв. В препринте Dongsen Zhang и коллег, который не проходил рецензирование и приводит замеры самих авторов, KITE повысил точность до 23,3 процентного пункта относительно полного обмена. Для команд это превращает межагентный трафик из постоянной издержки архитектуры в параметр, который можно сократить калибровкой.

Как находят слой, полезный получателю

В системах со скрытым обменом агенты передают не текст, а кэш ключей и значений (KV-кэш) — сохранённые внутренние представления уже обработанного контекста. Получателю не приходится заново разбирать сообщение на естественном языке, но полный кэш растёт вместе с числом слоёв модели и длиной рассуждения.

Предыдущий подход LatentMAS передаёт кэш всех слоёв, чтобы как можно точнее сохранить состояние отправителя. KITE меняет критерий: важно не воспроизвести отправителя, а сохранить поведение агента, который продолжит решать задачу.

Для калибровки систему сначала запускают с полным KV-кэшем и записывают последовательность скрытых состояний решателя. Затем прогон повторяют отдельно для каждого слоя. Решателю подают те же токены, что и в эталонном запуске, поэтому траектории можно сопоставить шаг за шагом.

Полезность слоя измеряют среднеквадратичным отклонением его траектории от эталонной. Чем меньше отклонение, тем лучше один слой сохраняет дальнейшее поведение решателя. Оценку усредняют по примерам из разных предметных областей, после чего выбирают один ключевой слой для конкретной модели и используют его во всех следующих задачах.

Во время работы каждый агент передаёт только KV-кэш этого слоя. Тот же слой становится точкой входа для скрытого авторегрессионного рассуждения: модель пропускает предшествующие слои на промежуточных шагах, но выполняет обычную начальную обработку запроса через всю сеть. Дополнительное обучение или изменение весов не требуется.

Один слой сократил трафик и повысил точность

KITE проверяли на семи наборах задач по научным вопросам, здравому смыслу, математике и генерации кода. В эксперименты вошли Llama-3.2-3B-Instruct, Qwen3-4B и Qwen3-8B. Систему сравнивали с текстовым взаимодействием агентов, полным обменом KV-кэшем в LMAS и выбором слоёв по вниманию в KVC.

Относительно LMAS объём передаваемых данных сократился в 28–36 раз в зависимости от глубины модели. Сквозное время вывода уменьшилось максимум втрое. На задачах с длинным рассуждением ускорение проявлялось не всегда: KITE мог генерировать более длинный ответ и тратить выигрыш на дополнительные шаги решения.

Самая заметная деталь эксперимента — добавление новых слоёв обычно ухудшало точность. Лучший общий результат дал не расширенный набор, а единственный слой с минимальным искажением траектории. Значит, полный кэш переносит не только полезный контекст, но и внутренние сигналы, которые могут мешать следующему агенту.

Это согласуется с анализом уверенности решателя: при передаче ключевого слоя распределение следующего токена оставалось более сосредоточенным, чем при полном обмене. KITE в таком случае работает не просто как сжатие, а как фильтр, который оставляет сведения, влияющие на задачу получателя.

Когда KITE меняет архитектурный план

Подход применим, если команда запускает модель в собственной среде, имеет доступ к KV-кэшу и может менять путь выполнения слоёв. При работе только через закрытый текстовый API реализовать такую передачу нельзя: внутренние состояния и точка входа в модель недоступны.

Работа рассматривает последовательную цепочку из планировщика, критика, редактора и решателя. Все роли построены на одной LLM, а промежуточные агенты рассуждают во внутренних представлениях; естественный язык декодирует только решатель. Поэтому результаты напрямую относятся к однородным последовательным системам, а не к произвольной сети агентов из разных моделей.

Ключевой слой зависит от модели, но не выбирается заново для каждой задачи. Это делает калибровку разумным этапом подготовки развёртывания: команда один раз сравнивает траектории на примерах из нескольких областей, фиксирует слой и затем использует его как интерфейс связи. При смене базовой модели калибровку придётся повторить.

KITE меняет планы команд, у которых межагентный KV-кэш уже стал ограничением по памяти, пропускной способности или времени ответа. Вместо сжатия полного состояния можно сначала проверить, нужен ли получателю весь этот объём. Для систем с текстовым обменом работа скорее задаёт направление следующего прототипа, чем предлагает готовую замену: потребуется перенести взаимодействие внутрь модели и сохранить доступ к её выполнению на уровне слоёв.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу