Журнал · Rit.work

Как вернуть длинные рассуждения модели после квантизации ниже трёх бит

Обучение на собственных траекториях квантованной модели восстанавливает математику и генерацию кода там, где обычной дистилляции уже недостаточно.

Rit.work
Студия разработки
23 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Квантованную модель научили снова доводить длинные рассуждения до ответа, а не зацикливаться по пути. В работе Yuanteng Chen и коллег, которая не прошла рецензирование и приводит замеры самих авторов, результат на HumanEval восстановился до 91% уровня исходной BF16-модели. Для развёртывания моделей ниже трёх бит одной дистилляции по готовым ответам может быть недостаточно: после неё нужен отдельный этап обучения на поведении самой квантованной модели.

Почему готовые ответы не учат выходить из собственных ошибок

QAD, то есть дистилляция с учётом квантизации, обучает модель на правильных префиксах из подготовленного корпуса. Полноточная модель задаёт распределение следующего токена, а квантованная модель учится его повторять.

При работе условия меняются. Модель продолжает уже собственный текст, а квантизация слегка сдвигает вероятности токенов на каждом шаге. Если модель выбирает другое продолжение, следующий токен строится уже по префиксу, которого не было в обучающем корпусе. На длинной цепочке такие отклонения накапливаются.

Проблема проявляется не только в неверном ответе. Квантованная Qwen3-0.6B после QAD исчерпывала весь лимит генерации на 95% задач MATH-500, тогда как BF16-модель — на 27%. Повторяющимися фрагментами заканчивались 70% ответов против 12% у полноточной версии. Модель часто сохраняла локально правдоподобный ход решения, но переставала управлять всей траекторией и не доходила до результата.

Короткие задания страдали меньше, потому что у отклонений было меньше времени накопиться. Это объясняет, почему QAD восстанавливает ответы с выбором варианта заметно лучше, чем математику и код с длинной авторегрессионной генерацией.

Как учитель попадает на траекторию квантованной модели

Предложенный процесс состоит из двух стадий. Сначала QAD возвращает базовые знания и способность выдавать осмысленные продолжения. Начинать сразу с генерации самой модели нельзя: после обычного округления низкобитные версии в экспериментах не решали генеративные задачи и не давали полезных траекторий для обучения.

Затем запускается дистилляция на собственных траекториях (on-policy distillation, OPD). Она устроена так:

  1. Квантованная модель получает учебную задачу и сама генерирует несколько решений через тот же низкобитный вычислительный путь, который будет использоваться после развёртывания.
  2. Замороженная BF16-модель оценивает каждый следующий токен на префиксах, созданных учеником. Учитель не возвращает модель на заранее подготовленный ответ, а подсказывает, как продолжать из состояния, куда она уже попала.
  3. Автоматическая проверка отдельно оценивает итог: сравнивает математический ответ с эталоном или запускает тесты для сгенерированного кода.
  4. Модель обновляют одновременно по двум сигналам. Токенные оценки учителя дают подсказку на протяжении решения, а проверка результата поощряет завершённые и работающие ответы.

Во время обучения обновляются основные веса в BF16, но все учебные генерации проходят через квантованный путь. Поэтому модель видит именно те искажения, которые возникнут при эксплуатации, а не их приближение на полноточных вычислениях.

OPD не заменяет первую стадию. QAD создаёт пригодную начальную модель, а OPD учит её справляться с отклонениями, которые появляются после собственных предсказаний. Продолжение обычной QAD на тех же корпусах и при сопоставимом бюджете уступило такой смене режима во всех контрольных сравнениях.

Когда эту схему стоит закладывать в план

Метод проверяли на трёх размерах Qwen3 и Falcon3-1B при эффективной точности 2,79 и 1,88 бита на вес. В оценку вошли математические задачи GSM8K, MATH-500 и AMC23, генерация кода HumanEval и MBPP, а также набор коротких вопросов QA9. Значит, вывод относится к агрессивной квантизации моделей, которые должны генерировать длинные проверяемые решения.

На MATH-500 QAD в среднем сохраняла 35% качества BF16-модели, а после OPD — 70%. Короткие ответы при этом не ухудшились. Эффект оказался сильнее при меньшей точности, где ошибки квантизации быстрее уводят генерацию от траекторий из учебного корпуса.

Для команды практический вывод состоит не в выборе OPD вместо QAD, а в разделении восстановления на две стадии. Если продукт использует модель ниже трёх бит для математики, программирования или другого процесса с длинным проверяемым результатом, в план обучения стоит добавить генерации через финальный квантованный путь, полноточного учителя и автоматическую проверку ответа.

Это усложняет учебный контур: нужно выполнять несколько генераций, прогонять их через учителя и поддерживать проверяющий модуль. Для открытых диалогов и задач без формального критерия результата перенос метода в работе не проверяли. Если продукт ограничен короткими ответами, исходная QAD уже сохраняла основную часть качества, поэтому дополнительная стадия может не оправдать эту сложность.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу