Журнал · Rit.work

Операции агента стали сигналом для выбора экспертов в MoE

Управление выбором экспертов по структуре агентской траектории повысило долю выполненных задач более чем на 10 процентных пунктов.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Долгие LLM-агенты научили выбирать внутренние блоки модели с учётом того, какую операцию они выполняют на каждом шаге. На всех проверенных наборах задач доля успешных выполнений выросла более чем на 10 процентных пунктов, но препринт не рецензирован, а числа получили сами авторы. Метод позволяет дообучать существующие модели без изменения их архитектуры.

В моделях со смесью экспертов (MoE) каждый токен обрабатывает только часть специализированных блоков. До обучения модель уже чаще выбирает похожие блоки для семантически близких действий — например, чтения и обновления данных. Обычное обучение с подкреплением не поддерживает эту структуру: выбор экспертов становится менее последовательным, и агент хуже использует доступную ёмкость модели.

Предложенный механизм управляет маршрутизацией на двух уровнях. Для каждого хода он сближает наборы экспертов у одинаковых операций и разделяет их у разных; внутри рассуждения или вызова инструмента сохраняет выбор между соседними токенами, но только когда маршруты уже похожи. Если энтропия политики — показатель неопределённости модели — резко меняется, дополнительное управление временно отключается: без такого предохранителя обучение в одном из опытов обрушилось примерно на сотом шаге, а с ним оставалось стабильным все 200 шагов.

Метод проверяли на Qwen3-30B-A3B и Qwen3.5-35B-A3B, на средах AppWorld и AutomationBench с многошаговыми вызовами инструментов. Для обучения использовали 90 задач AppWorld и 480 задач AutomationBench, а управление маршрутизацией сочетали с несколькими алгоритмами обучения с подкреплением. Эти границы важны для продуктового решения: результат относится к крупным разреженным моделям и агентам, которые долго взаимодействуют со средой, а не к любому приложению с одиночным запросом к LLM.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу