Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Долгие LLM-агенты научили выбирать внутренние блоки модели с учётом того, какую операцию они выполняют на каждом шаге. На всех проверенных наборах задач доля успешных выполнений выросла более чем на 10 процентных пунктов, но препринт не рецензирован, а числа получили сами авторы. Метод позволяет дообучать существующие модели без изменения их архитектуры.
В моделях со смесью экспертов (MoE) каждый токен обрабатывает только часть специализированных блоков. До обучения модель уже чаще выбирает похожие блоки для семантически близких действий — например, чтения и обновления данных. Обычное обучение с подкреплением не поддерживает эту структуру: выбор экспертов становится менее последовательным, и агент хуже использует доступную ёмкость модели.
Предложенный механизм управляет маршрутизацией на двух уровнях. Для каждого хода он сближает наборы экспертов у одинаковых операций и разделяет их у разных; внутри рассуждения или вызова инструмента сохраняет выбор между соседними токенами, но только когда маршруты уже похожи. Если энтропия политики — показатель неопределённости модели — резко меняется, дополнительное управление временно отключается: без такого предохранителя обучение в одном из опытов обрушилось примерно на сотом шаге, а с ним оставалось стабильным все 200 шагов.
Метод проверяли на Qwen3-30B-A3B и Qwen3.5-35B-A3B, на средах AppWorld и AutomationBench с многошаговыми вызовами инструментов. Для обучения использовали 90 задач AppWorld и 480 задач AutomationBench, а управление маршрутизацией сочетали с несколькими алгоритмами обучения с подкреплением. Эти границы важны для продуктового решения: результат относится к крупным разреженным моделям и агентам, которые долго взаимодействуют со средой, а не к любому приложению с одиночным запросом к LLM.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



