Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Квантованную модель научили снова доводить длинные рассуждения до ответа, а не зацикливаться по пути. В работе Yuanteng Chen и коллег, которая не прошла рецензирование и приводит замеры самих авторов, результат на HumanEval восстановился до 91% уровня исходной BF16-модели. Для развёртывания моделей ниже трёх бит одной дистилляции по готовым ответам может быть недостаточно: после неё нужен отдельный этап обучения на поведении самой квантованной модели.
Почему готовые ответы не учат выходить из собственных ошибок
QAD, то есть дистилляция с учётом квантизации, обучает модель на правильных префиксах из подготовленного корпуса. Полноточная модель задаёт распределение следующего токена, а квантованная модель учится его повторять.
При работе условия меняются. Модель продолжает уже собственный текст, а квантизация слегка сдвигает вероятности токенов на каждом шаге. Если модель выбирает другое продолжение, следующий токен строится уже по префиксу, которого не было в обучающем корпусе. На длинной цепочке такие отклонения накапливаются.
Проблема проявляется не только в неверном ответе. Квантованная Qwen3-0.6B после QAD исчерпывала весь лимит генерации на 95% задач MATH-500, тогда как BF16-модель — на 27%. Повторяющимися фрагментами заканчивались 70% ответов против 12% у полноточной версии. Модель часто сохраняла локально правдоподобный ход решения, но переставала управлять всей траекторией и не доходила до результата.
Короткие задания страдали меньше, потому что у отклонений было меньше времени накопиться. Это объясняет, почему QAD восстанавливает ответы с выбором варианта заметно лучше, чем математику и код с длинной авторегрессионной генерацией.
Как учитель попадает на траекторию квантованной модели
Предложенный процесс состоит из двух стадий. Сначала QAD возвращает базовые знания и способность выдавать осмысленные продолжения. Начинать сразу с генерации самой модели нельзя: после обычного округления низкобитные версии в экспериментах не решали генеративные задачи и не давали полезных траекторий для обучения.
Затем запускается дистилляция на собственных траекториях (on-policy distillation, OPD). Она устроена так:
- Квантованная модель получает учебную задачу и сама генерирует несколько решений через тот же низкобитный вычислительный путь, который будет использоваться после развёртывания.
- Замороженная BF16-модель оценивает каждый следующий токен на префиксах, созданных учеником. Учитель не возвращает модель на заранее подготовленный ответ, а подсказывает, как продолжать из состояния, куда она уже попала.
- Автоматическая проверка отдельно оценивает итог: сравнивает математический ответ с эталоном или запускает тесты для сгенерированного кода.
- Модель обновляют одновременно по двум сигналам. Токенные оценки учителя дают подсказку на протяжении решения, а проверка результата поощряет завершённые и работающие ответы.
Во время обучения обновляются основные веса в BF16, но все учебные генерации проходят через квантованный путь. Поэтому модель видит именно те искажения, которые возникнут при эксплуатации, а не их приближение на полноточных вычислениях.
OPD не заменяет первую стадию. QAD создаёт пригодную начальную модель, а OPD учит её справляться с отклонениями, которые появляются после собственных предсказаний. Продолжение обычной QAD на тех же корпусах и при сопоставимом бюджете уступило такой смене режима во всех контрольных сравнениях.
Когда эту схему стоит закладывать в план
Метод проверяли на трёх размерах Qwen3 и Falcon3-1B при эффективной точности 2,79 и 1,88 бита на вес. В оценку вошли математические задачи GSM8K, MATH-500 и AMC23, генерация кода HumanEval и MBPP, а также набор коротких вопросов QA9. Значит, вывод относится к агрессивной квантизации моделей, которые должны генерировать длинные проверяемые решения.
На MATH-500 QAD в среднем сохраняла 35% качества BF16-модели, а после OPD — 70%. Короткие ответы при этом не ухудшились. Эффект оказался сильнее при меньшей точности, где ошибки квантизации быстрее уводят генерацию от траекторий из учебного корпуса.
Для команды практический вывод состоит не в выборе OPD вместо QAD, а в разделении восстановления на две стадии. Если продукт использует модель ниже трёх бит для математики, программирования или другого процесса с длинным проверяемым результатом, в план обучения стоит добавить генерации через финальный квантованный путь, полноточного учителя и автоматическую проверку ответа.
Это усложняет учебный контур: нужно выполнять несколько генераций, прогонять их через учителя и поддерживать проверяющий модуль. Для открытых диалогов и задач без формального критерия результата перенос метода в работе не проверяли. Если продукт ограничен короткими ответами, исходная QAD уже сохраняла основную часть качества, поэтому дополнительная стадия может не оправдать эту сложность.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



