Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Рассуждающую модель научились вовремя сокращать или завершать решение, не задавая ей лимит токенов заранее. В препринте Zhibin Wen и соавторов, который не прошёл рецензирование и содержит замеры самих авторов, MetaCtrl повысил среднюю точность DeepSeek-R1-Distill-Qwen-7B на 4,7 процентного пункта и сократил генерацию на 53,3%. Для собственной инфраструктуры вывода это возможная альтернатива фиксированным лимитам и переобучению основной модели.
Контроллер следит за ходом решения, а не только за вопросом
Фиксированный лимит плохо учитывает сложность конкретного решения. Простая задача может вызвать длинную повторную проверку, а трудная — оборваться до того, как модель найдёт ответ. Оценка вопроса перед запуском тоже не видит, зашла ли модель в тупик или уже получила достаточный результат.
MetaCtrl отделяет решение задачи от управления вычислениями. Основная модель остаётся замороженной, а внешний контроллер читает вопрос, уже созданный фрагмент рассуждения и предыдущие управляющие команды. После каждого фрагмента он выбирает одно из четырёх действий: продолжить без изменений, перейти к более краткому рассуждению, пропустить избыточные шаги или сформулировать итоговый ответ.
Вмешательства происходят на границах абзацев, которые заканчиваются точкой или вопросительным знаком. Контроллер не обрывает генерацию посреди токена: система приостанавливает основную модель между законченными фрагментами и при необходимости добавляет в контекст короткую текстовую инструкцию.
Такое устройство позволяет менять решение по ходу работы. Один и тот же вопрос может потребовать продолжения в начале, ускорения после найденной идеи и остановки после проверки результата. Контроллер не сообщает содержание решения и не исправляет фактические ошибки напрямую — он регулирует объём и направление дальнейшего рассуждения.
Короткие решения поощряют только после правильного ответа
MetaCtrl обучали методом групповой относительной оптимизации политики GRPO. Для одной задачи система создаёт несколько траекторий с разными последовательностями управляющих действий, а затем сравнивает конечные ответы и число токенов, созданных основной моделью.
Награда ставит правильность выше краткости. Все ошибочные ответы получают одинаковый штраф независимо от длины, поэтому ранняя остановка сама по себе не помогает. Бонус за экономию токенов получают только правильные решения, причём более короткая траектория выигрывает у других правильных траекторий той же задачи.
Обновляются только параметры контроллера. Основная модель не участвует в обучении, а размечать момент для каждой остановки вручную не требуется: полезность всей последовательности действий определяет конечный результат.
Метод проверили на семи наборах задач по математике, естественным наукам и программированию. На знакомой при обучении DeepSeek-R1-Distill-Qwen-7B средняя точность выросла на 4,7 процентного пункта, а длина генерации — число токенов в рассуждении и ответе — снизилась на 53,3%. При переносе того же контроллера на не использованную в обучении Qwen3-14B точность выросла на 2,9 пункта, а генерация сократилась на 50,3%.
Сравнение охватывало обычный запуск без управления, сокращающие подсказки, пропуск токенов и другие способы регулировать рассуждение. Границы результата заданы самими испытаниями: это задачи с проверяемыми ответами и модели, которые показывают текстовую цепочку рассуждения, а не произвольные диалоги или бизнес-процессы.
Архитектурные планы меняются только при собственном контуре вывода
MetaCtrl не требует заново обучать крупную основную модель. Это снижает цену эксперимента для команды, которая самостоятельно запускает модели и может приостанавливать генерацию, читать промежуточный текст и добавлять команды в контекст. Один контроллер также перенесли между несколькими моделями без дополнительного обучения, поэтому его можно рассматривать как отдельный слой инфраструктуры.
Для закрытого API с единственным запросом и готовым ответом метод не подключается напрямую. Сервис должен отдавать промежуточные фрагменты и позволять продолжать генерацию с дополненным контекстом. Потребуются диспетчеризация двух моделей, хранение состояния рассуждения и обработка случаев, когда основная модель не создаёт ожидаемую границу абзаца.
«Лёгкий» здесь означает меньший контроллер рядом с основной моделью, а не бесплатное правило остановки: в основных экспериментах использовали контроллер на 4 млрд параметров. Сокращение токенов основной модели поэтому нельзя автоматически считать таким же сокращением задержки или расходов — в общий бюджет входят вычисления контроллера, обмен контекстом и память GPU.
Работа меняет план прежде всего там, где длинные рассуждения уже стали заметной статьёй затрат. Вместо выбора одного лимита для всех запросов можно испытать отдельный управляющий слой и измерять три величины вместе: точность, полную задержку и суммарные вычисления обеих моделей. Переобучение основной модели при таком прототипе не требуется, но контур вывода придётся изменить.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



