Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Замороженную LLM научились выбирать подходящий навык из библиотеки, не загружая описания всех навыков в её контекст. На траекториях агента Gavel опередил другие маршрутизаторы на величину до 21,9 процентного пункта, хотя работа не прошла рецензирование и все числа получили сами авторы. Такой подход позволяет расширять библиотеку отдельно от контекстного окна, но требует доступа к внутренним состояниям модели.
Как маршрутизатор читает выбор из скрытых состояний
Навык здесь — документ с инструкциями, скриптами и справочными файлами, который агент подключает для конкретной задачи. Claude Code и Codex используют последовательное раскрытие: заранее кладут в системный запрос названия и краткие описания установленных навыков, а полный текст загружают после выбора.
Такой способ сохраняет решение за самой LLM, но расходует контекст пропорционально размеру библиотеки. Альтернатива — отдельный поиск по векторам и модель повторного ранжирования — не занимает контекст, зато выбирает навык вне агента и хуже учитывает ход выполнения задачи.
Gavel оставляет базовую модель замороженной и обучает только два линейных преобразования общим объёмом 7,9 млн параметров. Первое извлекает запрос из скрытых состояний токенов задачи, второе превращает состояния токенов навыка в ключи, с которыми этот запрос можно сравнить.
При установке нового навыка система один раз пропускает его текст через LLM и сохраняет набор ключей. Близкие ключи заменяются представителями кластеров: это сокращает хранилище примерно в 8,5 раза, а математическая граница гарантирует, что оценка совпадения изменится не больше заданного порога. Повторно обучать маршрутизатор для нового документа не нужно.
Во время работы каждый токен задачи голосует только за навыки с самым сильным совпадением. Это не даёт длинному контексту размыть несколько слов, которые действительно указывают на нужную возможность.
После быстрого просмотра всей библиотеки Gavel подробно проверяет короткий список. Модель читает задачу с каждым кандидатом, оценивает, насколько навык помогает предсказать её текст, и отвечает самой себе, подходит ли он. Итоговая оценка перемножает эти сигналы, поэтому слабый результат одной проверки может исключить кандидата, который прошёл остальные.
Где Gavel обошёл отдельные модели поиска
На SRA-Bench Gavel превысил результат сильнейшего конвейера поиска и повторного ранжирования на 13,4 процентного пункта. Соперники добавляли к агенту внешние модели размером до 16 млрд параметров, тогда как Gavel использовал скрытые состояния самой базовой LLM.
Работу проверяли на нескольких публичных наборах письменных задач и на SkillTraj — наборе из 372 смоделированных траекторий. В SkillTraj потребность в навыке могла появиться после ответа инструмента, в плане агента или после неудачного выбора. Это сложнее одиночного запроса: отдельному поисковику приходится либо сворачивать всю историю в один вектор, либо оставлять только последнее сообщение и терять ранние свидетельства.
Авторы также встроили маршрутизатор в минимального агента с доступом к командной строке. На Skill-Use связка Qwen3-32B и Gavel загрузила правильный навык в 90,9% задач и обошла перечисленные в работе модели, запущенные через Codex, а также отдельные конвейеры поиска.
Основные опыты построены вокруг Qwen3-32B, а часть сравнений повторена с Gemma-4-31B. Проверка в ходе выполнения охватывает смоделированные диалоги и отдельный набор исполняемых задач, а не производственные журналы агентов с произвольными библиотеками.
Когда результат меняет архитектуру агента
Для команды с растущей библиотекой навыков работа предлагает альтернативу двум привычным решениям: не держать все описания в системном запросе и не добавлять отдельную крупную модель поиска. Индекс навыка строится при установке, а выбор использует способность основной LLM понимать текущую задачу.
Это не готовая замена маршрутизатора поверх любого API. Gavel должен читать состояния промежуточного слоя, продолжать ранее начатый прямой проход и получать вероятности отдельных токенов. Обычного интерфейса генерации текста для такой схемы недостаточно, поэтому она подходит прежде всего командам, которые управляют запуском модели и могут менять её вычислительный контур.
В рабочем агенте нужен ещё один компонент: отдельный затвор решает, когда вообще запускать выбор навыка. В эксперименте его обучали на положительных и отрицательных траекториях. Значит, Gavel упрощает выбор из библиотеки, но не устраняет задачу определения момента вызова.
Практический следующий шаг — прототип на собственной модели и реальной библиотеке, где можно отдельно проверить точность, задержку и расход памяти. Работа показывает, что сигнал маршрутизации уже присутствует внутри LLM; она не доказывает, что извлекать его выгоднее внешнего поиска при любой инфраструктуре и нагрузке.
Источники
Иллюстрация: рисунок из статьи «The Router Within: Eliciting Native Skill Routing from a Frozen LLM», Ruishuo Chen, Xun Wang, Yu Chen и др., CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



