Журнал · Rit.work

MTP-блоки ускорили замороженную Qwen3-8B после основного обучения

Microsoft дообучила блоки многотокенного предсказания для замороженной Qwen3-8B и проверила ослабленную верификацию и адаптивный выбор их числа.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Уже обученную языковую модель удалось ускорить без повторного обучения её основной части. Работа команды Microsoft на Qwen3-8B показала результат на уровне совместно обученной MiMo-7B при использовании в 1000–10 000 раз меньшего числа обучающих токенов, но препринт не прошёл рецензирование, а все числа получили сами авторы. Это позволяет добавлять ускорение после выбора базовой модели, а не закладывать его в полный цикл предварительного обучения.

Как блоки предсказывают несколько токенов за один шаг

Обычная авторегрессионная модель генерирует по одному токену за проход. Многотокенное предсказание (MTP) добавляет небольшие обучаемые блоки, которые предлагают сразу несколько следующих токенов, после чего основная модель проверяет их за один проход.

Если проверка принимает несколько предложенных токенов подряд, система реже запускает основную модель. Работу такого механизма измеряют средней принятой длиной: сколько токенов система в среднем подтверждает за один шаг проверки. Это оценка потенциального ускорения, а не непосредственная скорость выдачи текста на GPU.

Основную Qwen3-8B заморозили и добавили три последовательных MTP-блока. Каждый следующий блок учитывал токен, предложенный предыдущим, поэтому учился продолжать реальную цепочку кандидатов, а не независимо угадывать позицию в будущем.

Для обучения использовали около 2,5 млрд токенов рассуждений, которые сама Qwen3-8B сгенерировала по запросам из AM-Thinking. Блоки обучали обычной перекрёстной энтропией, не меняя параметры базовой модели. Продолжение обучения самой основы и замена функции потерь на расхождение с распределением основной модели результата не улучшили.

Проверка охватила задачи по математике, программированию, знаниям, следованию инструкциям и открытому диалогу. Основные опыты запускали с малым пакетом запросов на одном A100 и сравнивали с MiMo-7B-RL, где MTP-блоки обучались вместе с моделью. Это разные базовые модели, поэтому сравнение показывает конкурентоспособность дообучения, но не изолирует влияние способа обучения в полностью одинаковых условиях.

Почему точную проверку можно ослабить

Стандартная спекулятивная генерация принимает кандидатов так, чтобы итоговое распределение токенов точно совпадало с распределением основной модели. Это сохраняет её поведение, но отклоняет цепочку даже тогда, когда один менее вероятный токен окружён уверенными предсказаниями.

Предложенное правило оценивает цепочку целиком. Оно считает среднюю вероятность уже предложенной последовательности и принимает самый длинный префикс, который остаётся выше заданного порога. Так единичный слабый токен не обязательно обрывает уверенное продолжение, но несколько сомнительных токенов подряд снижают общую оценку.

Порог подбирали отдельно для каждого математического теста, удерживая точность в коридоре ±3 процентных пункта от строгой проверки. Средняя принятая длина выросла на 14%. Это компромисс: итоговая точность задач сохранилась в заданном коридоре, но точное распределение исходной модели правило уже не гарантирует.

Глубина предсказания тоже оказалась переменной. При небольшом пакете запросов дополнительные блоки окупают свою работу, а при высокой загрузке сами становятся узким местом. Фиксированная максимальная глубина теряла 11–14% пропускной способности на крупных пакетах по сравнению с тремя блоками.

Адаптивный контроллер наблюдал фактическую скорость и выбирал, сколько блоков запускать. Он перебирал варианты, затем оставлял лучший для текущей нагрузки и периодически проверял решение заново. Такой подход вернул большую часть потери на крупных пакетах, хотя на малых часть выигрыша съедали измерения и переключения.

Что меняется в плане разработки и развёртывания

Команде, которая контролирует веса модели и сервер генерации, больше не обязательно выбирать MTP-архитектуру до предварительного обучения. Можно зафиксировать подходящую базовую модель, собрать её собственные ответы на целевых запросах и отдельно обучить блоки для ускорения. Это также позволяет обновлять их после смены данных или режима рассуждений, не затрагивая основу.

Для продукта с жёсткими требованиями к воспроизводимости безопасной исходной точкой остаётся точная проверка. Ослабленное правило имеет смысл только после калибровки на своей метрике качества: сохранение правильных ответов на математических тестах не доказывает, что тот же порог сохранит стиль, фактическую точность или ограничения в другом сценарии.

Адаптивная глубина нужна прежде всего сервисам с меняющимся размером пакета и неодинаково предсказуемыми запросами. Если нагрузка стабильна, проще заранее измерить несколько фиксированных вариантов. При переменной нагрузке контроллер снимает необходимость выбирать один режим между задержкой одиночного запроса и общей пропускной способностью.

Работа не обосновывает перенос результата на закрытые API, где нельзя получить скрытые состояния модели, добавить собственные блоки и изменить проверку токенов. Для самостоятельного размещения она предлагает практичный порядок: сначала дообучить MTP на ответах выбранной модели, затем измерить реальную скорость, после этого отдельно решать, допустимо ли ослаблять проверку.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу