Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Черновую головку (draft head) научили обучаться прямо во время RL-донастройки модели, без отдельного прогрева. На Qwen3-4B полный шаг обучения ускорился в 1,60 раза с учётом затрат на головку, хотя препринт не прошёл рецензирование и числа получили сами авторы. Модель без готовой головки сможет начать ускорять генерацию в том же запуске, ради которого это ускорение понадобилось.
RL-цикл сам создаёт данные для черновика
При обучении с подкреплением модель сначала генерирует ответы, получает за них награду, а затем обновляет параметры. Больше всего времени занимает генерация: модель выдаёт токены последовательно и для каждого снова запускает вычисления.
Спекулятивное декодирование сокращает эту работу. Небольшая вспомогательная головка предлагает сразу несколько следующих токенов, а основная модель проверяет их за один проход. Подход не меняет распределение ответов: при отклонении чернового токена алгоритм выбирает замену из скорректированного распределения основной модели.
Обычно такую головку готовят заранее — вместе с основной моделью или на отдельном наборе данных. Это создаёт дополнительный этап до RL-донастройки и оставляет модели без головки без доступа к ускорению.
GrowMTP использует данные, которые уже возникают при проверке черновика. Основная модель для каждого предложенного токена вычисляет распределение вероятностей и решает, принять его или отклонить. Эти сигналы точно соответствуют текущей задаче и текущим ответам, поэтому головке не требуется учиться на широком наборе текстов.
Как головка учится на принятых цепочках
Во время генерации GrowMTP сохраняет состояние основной модели в начале цикла, предложенные токены, распределения при проверке и решения о принятии. Дополнительный проход основной модели для сбора обучающих данных не нужен.
Затем метод восстанавливает путь, по которому головка строила черновик. Это отличается от обычного обучения на итоговом ответе. После первого отклонения итоговая последовательность содержит замену, а следующие черновые токены были предложены на основе уже отброшенного варианта. Если обучать головку только на готовом ответе, её состояние перестанет совпадать с состоянием во время генерации.
Целевая функция учитывает зависимость между позициями. Поздний токен ускоряет генерацию лишь тогда, когда основная модель приняла все предыдущие предложения. GrowMTP поэтому оптимизирует всю цепочку принятых токенов, а не каждую позицию независимо. Логарифмическое преобразование сильнее выделяет циклы, где головка пока предлагает неудачные цепочки.
После первого отклонения метод прекращает обучение на оставшейся части черновика. Эти токены опираются на последовательность, которая не попала в ответ, и полное обучение на них ухудшало итоговую скорость в сравнительных опытах.
Градиенты от головки не проходят в основную модель. Её исходная цель обучения с подкреплением сохраняется, а вспомогательный модуль обновляется отдельно. Первая позиция черновика всегда даёт пригодный сигнал, поэтому головку можно инициализировать случайно и не вводить расписание постепенного увеличения глубины.
Когда GrowMTP меняет план обучения
Метод проверили на Qwen3-4B без готовой головки, MiMo-7B-SFT со слабой головкой и Qwen3.5-4B-Base с более развитой встроенной головкой. Обучение проходило на математических задачах DAPO-Math-17K и задачах по программированию TACO-Verified; итоговое качество сверяли на отдельных математических и кодовых наборах.
На Qwen3-4B за 500 шагов генерация ответов ускорилась в 2,13 раза. На MiMo-7B-SFT полный шаг стал быстрее в 1,41 раза, когда GrowMTP расширил короткий черновик до последовательности из нескольких токенов. На Qwen3.5-4B-Base выигрыш сохранился, но оказался меньше — 1,20 раза относительно замороженной головки. В приведённых опытах качество основной модели на контрольных задачах осталось сопоставимым с базовыми вариантами.
Для команды, которая планирует RL-донастройку модели без встроенного многотокенного предсказания, отдельное предварительное обучение головки перестаёт быть обязательным этапом. Его можно заменить модулем внутри основного запуска и начать окупать затраты уже по ходу генерации ответов.
Интеграция потребует доступа к внутренностям контура генерации. Система должна сохранять состояния модели, распределения при проверке, границы циклов и первое отклонение, а затем отдельно обновлять головку. Если движок возвращает только готовые ответы, GrowMTP нельзя подключить как внешний обработчик без изменения слоя генерации.
Эксперименты охватывают компактные модели, сотни шагов и две области — математику и код. Поэтому работа даёт основание проверить подход на пилотном запуске, но не позволяет заранее перенести коэффициенты ускорения на более крупную модель или другой профиль ответов. Наибольший смысл такой пилот имеет там, где именно последовательная генерация занимает основную часть RL-цикла.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



