Журнал · Rit.work

CounterRoute отделяет выбор режима от качества ответа

CounterRoute обучает один чекпойнт Qwen3 выбирать между рассуждением и прямым ответом, сокращая число выходных токенов без потери средней точности.

Rit.work
Студия разработки
25 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Двухрежимную языковую модель научили самой решать, когда строить цепочку рассуждений, а когда отвечать сразу. Хотя препринт команды Amazon не рецензирован, а все числа получили сами авторы, CounterRoute сократил среднее число выходных токенов относительно режима постоянного рассуждения на 51% для Qwen3-8B и на 41% для Qwen3-14B, одновременно повысив среднюю точность. Для продукта это вариант заменить внешний маршрутизатор одним чекпойнтом, который выбирает режим отдельно для каждого запроса.

Как разделили выбор режима и обучение ответа

Обычное обучение с подкреплением оценивает весь ответ целиком. Если модель выбрала рассуждение и ошиблась, такой сигнал не показывает, что именно было неверно: сам маршрут или текст, который модель сгенерировала после выбора.

CounterRoute разделяет эти решения по токенам. Для одного запроса модель принудительно запускают в обоих режимах: с рассуждением и без него. Ответы генерирует текущая версия модели, поэтому сравнение меняется вместе с её способностями, а не опирается на заранее размеченный набор маршрутов или замороженную эталонную модель.

Среднюю награду двух групп сравнивают с поправкой в пользу прямого ответа. Если режимы дают близкое качество, модель должна выбрать более короткий. Эта поправка выражена в единицах награды и не измеряет реальную цену токенов или задержку.

Результат сравнения влияет только на первый токен, который выбирает режим. Остальные токены обучают внутри выбранного режима через GRPO — групповое относительное обучение с подкреплением, где несколько ответов на один запрос сравнивают между собой. Поэтому неудачный прямой ответ ухудшает генерацию прямых ответов, но сам по себе не доказывает, что модель всегда должна рассуждать.

Отдельная голова классификатора не нужна: оба режима, их ответы и выбор между ними остаются в одном чекпойнте. CounterRoute также начинает с исходной двухрежимной Qwen3 без дополнительного этапа обучения на готовых примерах.

Почему модель сначала заставляют пробовать оба пути

Свободный выбор режима с первого шага создаёт замкнутый круг. Если исходный чекпойнт предпочитает рассуждать, он реже пробует прямые ответы, получает о них меньше обратной связи и ещё сильнее закрепляет начальное предпочтение.

Поэтому обучение начинается с парных запусков: каждый запрос проходит через оба режима. Затем доля запросов со свободным выбором постепенно растёт, но часть принудительных сравнений сохраняется. Так модель учится работать под собственным распределением маршрутов и одновременно продолжает проверять альтернативный путь.

Проверяли два размера Qwen3. Для обучения использовали только математику и синтетические инструкции с автоматически проверяемыми условиями. Затем тот же чекпойнт оценивали на задачах по программированию, естественным наукам, знаниям, здравому смыслу и следованию инструкциям, которых не было в обучающей смеси.

Для Qwen3-8B средняя точность CounterRoute составила 79,1% против 78,3% у GRPO, которое всегда включает рассуждение. Средняя длина ответа при этом снизилась с 1571 до 1347 токенов. В анализе отдельных запросов выбранный режим не уступал принудительной альтернативе в 95% случаев, однако эта метрика считает совпадением и ситуацию, когда оба режима ошиблись.

Граница результатов узкая: работа рассматривает только выбор между двумя режимами и только диалог из одного хода. Она не проверяет распределение нескольких вычислительных бюджетов и не показывает, как назначать режимы отдельным сообщениям в длинном диалоге.

Меняет ли CounterRoute планы продуктовых команд

Работа меняет архитектурный выбор для команд, которые уже планируют использовать двухрежимную модель. Вместо двух обслуживаемых моделей или отдельного маршрутизатора можно обучать один чекпойнт, где решение о режиме меняется вместе с качеством ответов.

Экономия на инференсе требует более дорогого обучения. В начале число групп генераций достигает удвоенного уровня относительно обычного GRPO, а после перехода к преимущественно свободному выбору множитель снижается примерно до 1,3. Это разовый расход при обучении, но он потребует дополнительной мощности для генерации парных ответов.

Снижение числа выходных токенов нельзя напрямую переносить в бюджет или задержку сервиса. На них влияют пакетная обработка, длина входа, оборудование и то, сколько токенов рассуждения система фактически возвращает или скрывает. CounterRoute даёт способ изменить распределение вычислений, а экономический эффект придётся измерять на рабочей инфраструктуре.

Для нового продукта результат пока скорее поддерживает прототип, чем немедленную смену стека: метод проверен на двух родственных чекпойнтах и бинарном маршруте. Для команды с Qwen3 и заметной долей простых запросов эксперимент уже можно поставить рядом с постоянным режимом рассуждения и существующим маршрутизатором, сравнив качество, токены и задержку на собственном трафике.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу