Журнал · Rit.work

Gavel выбирает навыки агента без их текста в контексте

Gavel извлекает сигнал для выбора навыка из скрытых состояний замороженной LLM и обходит маршрутизаторы с отдельными моделями на письменных задачах и траекториях агента.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Замороженную LLM научились выбирать подходящий навык из библиотеки, не загружая описания всех навыков в её контекст. На траекториях агента Gavel опередил другие маршрутизаторы на величину до 21,9 процентного пункта, хотя работа не прошла рецензирование и все числа получили сами авторы. Такой подход позволяет расширять библиотеку отдельно от контекстного окна, но требует доступа к внутренним состояниям модели.

Как маршрутизатор читает выбор из скрытых состояний

Навык здесь — документ с инструкциями, скриптами и справочными файлами, который агент подключает для конкретной задачи. Claude Code и Codex используют последовательное раскрытие: заранее кладут в системный запрос названия и краткие описания установленных навыков, а полный текст загружают после выбора.

Такой способ сохраняет решение за самой LLM, но расходует контекст пропорционально размеру библиотеки. Альтернатива — отдельный поиск по векторам и модель повторного ранжирования — не занимает контекст, зато выбирает навык вне агента и хуже учитывает ход выполнения задачи.

Gavel оставляет базовую модель замороженной и обучает только два линейных преобразования общим объёмом 7,9 млн параметров. Первое извлекает запрос из скрытых состояний токенов задачи, второе превращает состояния токенов навыка в ключи, с которыми этот запрос можно сравнить.

При установке нового навыка система один раз пропускает его текст через LLM и сохраняет набор ключей. Близкие ключи заменяются представителями кластеров: это сокращает хранилище примерно в 8,5 раза, а математическая граница гарантирует, что оценка совпадения изменится не больше заданного порога. Повторно обучать маршрутизатор для нового документа не нужно.

Во время работы каждый токен задачи голосует только за навыки с самым сильным совпадением. Это не даёт длинному контексту размыть несколько слов, которые действительно указывают на нужную возможность.

После быстрого просмотра всей библиотеки Gavel подробно проверяет короткий список. Модель читает задачу с каждым кандидатом, оценивает, насколько навык помогает предсказать её текст, и отвечает самой себе, подходит ли он. Итоговая оценка перемножает эти сигналы, поэтому слабый результат одной проверки может исключить кандидата, который прошёл остальные.

Где Gavel обошёл отдельные модели поиска

На SRA-Bench Gavel превысил результат сильнейшего конвейера поиска и повторного ранжирования на 13,4 процентного пункта. Соперники добавляли к агенту внешние модели размером до 16 млрд параметров, тогда как Gavel использовал скрытые состояния самой базовой LLM.

Работу проверяли на нескольких публичных наборах письменных задач и на SkillTraj — наборе из 372 смоделированных траекторий. В SkillTraj потребность в навыке могла появиться после ответа инструмента, в плане агента или после неудачного выбора. Это сложнее одиночного запроса: отдельному поисковику приходится либо сворачивать всю историю в один вектор, либо оставлять только последнее сообщение и терять ранние свидетельства.

Авторы также встроили маршрутизатор в минимального агента с доступом к командной строке. На Skill-Use связка Qwen3-32B и Gavel загрузила правильный навык в 90,9% задач и обошла перечисленные в работе модели, запущенные через Codex, а также отдельные конвейеры поиска.

Основные опыты построены вокруг Qwen3-32B, а часть сравнений повторена с Gemma-4-31B. Проверка в ходе выполнения охватывает смоделированные диалоги и отдельный набор исполняемых задач, а не производственные журналы агентов с произвольными библиотеками.

Когда результат меняет архитектуру агента

Для команды с растущей библиотекой навыков работа предлагает альтернативу двум привычным решениям: не держать все описания в системном запросе и не добавлять отдельную крупную модель поиска. Индекс навыка строится при установке, а выбор использует способность основной LLM понимать текущую задачу.

Это не готовая замена маршрутизатора поверх любого API. Gavel должен читать состояния промежуточного слоя, продолжать ранее начатый прямой проход и получать вероятности отдельных токенов. Обычного интерфейса генерации текста для такой схемы недостаточно, поэтому она подходит прежде всего командам, которые управляют запуском модели и могут менять её вычислительный контур.

В рабочем агенте нужен ещё один компонент: отдельный затвор решает, когда вообще запускать выбор навыка. В эксперименте его обучали на положительных и отрицательных траекториях. Значит, Gavel упрощает выбор из библиотеки, но не устраняет задачу определения момента вызова.

Практический следующий шаг — прототип на собственной модели и реальной библиотеке, где можно отдельно проверить точность, задержку и расход памяти. Работа показывает, что сигнал маршрутизации уже присутствует внутри LLM; она не доказывает, что извлекать его выгоднее внешнего поиска при любой инфраструктуре и нагрузке.

Источники

Иллюстрация: рисунок из статьи «The Router Within: Eliciting Native Skill Routing from a Frozen LLM», Ruishuo Chen, Xun Wang, Yu Chen и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу