Журнал · Rit.work

Codebook Agent заменяет поиск топологии LLM-агентов выбором из каталога

Авторы Codebook Agent предлагают выбирать граф взаимодействия LLM-агентов из заранее обученного каталога, а оценивать стоимость по фактическому расходу токенов.

Rit.work
Студия разработки
3 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Jinxi Yu и соавторы представили Codebook Agent — способ подбирать топологию взаимодействия LLM-агентов для каждого запроса; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, метод оказался точнее рассмотренных генераторов топологий и сократил расход токенов. Результат важен командам, которые строят системы из нескольких агентов и сейчас перебирают или генерируют схемы их коммуникации во время выполнения запроса.

Что сделали

В многоагентной системе топология определяет, какие агенты получают ответы друг друга и кто передаёт результат итоговому узлу. От неё зависят качество решения, число обращений к моделям и длина контекста. Распространённый подход — сгенерировать для запроса несколько графов, оценить их графовой нейросетью и выбрать лучший. Такой поиск добавляет отдельный вычислительный цикл перед фактической работой агентов.

Codebook Agent переносит основную часть этого выбора на этап предварительного обучения. Авторы сначала выполняют несколько фиксированных топологий на обучающих заданиях и записывают для каждой пары «запрос — граф» правильность ответа и фактический расход токенов. На каждом бенчмарке журнал содержит 300 таких выполнений.

Успешные графы сжимаются в кодбук — каталог из 16 представлений топологий. Для нового запроса многослойный перцептрон (MLP) определяет наиболее подходящие элементы каталога. Система декодирует до пяти кандидатов, удаляет дубликаты и одним пакетным вызовом другой MLP оценивает ожидаемую полезность и нормализованный расход токенов.

Оценщик получает саму матрицу связей в развёрнутом виде. Это принципиальное отличие от графовой сети, которая обменивается сообщениями между узлами: если все агенты имеют одинаковый профиль, их признаки совпадают, поэтому использованный авторами графовый оценщик не различает варианты топологии. Стоимость также обучается на измеренных токенах, а не на числе рёбер. В собранных запусках разреженные графы нередко приводили к более длинным ответам, поэтому меньшее число связей не служило надёжным приближением стоимости.

Что показали

На задачах рассуждения и генерации кода средняя точность Codebook Agent составила 84,6% против 83,0% у сильнейшего из сравниваемых генераторов топологий. По утверждению авторов, их вариант занял первое место на каждом из рассмотренных бенчмарков, а преимущество сохранилось при переносе с gpt-4o-mini на Qwen-3-8B.

Медианное время построения топологии составило 2,4 мс, тогда как нижняя граница для итеративных генераторов в замерах работы была 301 мс. Разница объясняется устройством метода: вместо последовательной генерации и оценки графов выполняется несколько обычных матричных операций.

Максимальное сокращение расхода токенов относительно полного конкурирующего конвейера достигло 33,2%. Абляционные эксперименты авторов связывают экономию прежде всего с оценщиком, обученным на фактических токенах: случайный выбор и графовая сеть тратили больше при близкой точности. Увеличение ёмкости кодбука почти не расширяло набор используемых графов, что поддерживает исходную гипотезу работы: полезных топологий в этих условиях немного.

Ограничения

Метод проверяли на шести бенчмарках рассуждения и программирования — GSM8K, MATH, MultiArith, SVAMP, MBPP и HumanEval, а перенос между моделями дополнительно оценивали на MMLU. Обучающие журналы собирали на небольшом числе заранее заданных графов; большинство экспериментов использовало компактные команды агентов с одинаковыми профилями. Гетерогенная команда отдельно рассматривалась только для HumanEval, поэтому работа не показывает, сохраняется ли преимущество в крупных системах со специализированными ролями, инструментами и длительным состоянием процесса.

Каждую конфигурацию авторы запускали для оценки один раз, поэтому устойчивость небольших различий точности не установлена. В сравнении также не сведены в единую стоимость предварительные LLM-выполнения, необходимые для сбора журнала, обучение компонентов и последующая эксплуатация. Проверка ограничена учебными наборами: производственные процессы с меняющимися запросами, моделями и правилами маршрутизации в работе не исследовались.

Что это значит

Для уже работающей системы с итеративным генератором топологий результат даёт основание проверить более простой заменитель: небольшой каталог графов, быстрый предиктор и оценщик по реальному расходу токенов. Такой компонент можно поставить за существующим интерфейсом выбора топологии, не меняя промпты и исполнение агентов. Критерием пилота должны быть итоговая точность, токены и полное время ответа на собственном потоке запросов.

Работа не означает, что каждому многоагентному продукту нужен обучаемый кодбук. Авторы сами показывают, что сильная фиксированная топология часто близка к сгенерированной. Для новой системы разумная последовательность остаётся прежней: сначала измерить несколько простых схем, затем добавлять выбор для каждого запроса только там, где он окупает сбор обучающих выполнений.

Планы стоит пересматривать прежде всего командам, у которых подбор графа уже стал отдельным дорогим этапом или стоимость оценивается числом связей. Для них основная инженерная идея работы практичнее конкретной архитектуры: оптимизировать измеренный расход LLM, а пространство проверенных решений сокращать заранее, а не исследовать заново при каждом запросе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу