Журнал · Rit.work

bf16-экспорт может отменить дообучение троичных LLM

Округление при подготовке троичных моделей к развёртыванию вернуло изменённые веса в исходное состояние и почти обнулило точность на GSM8K.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Дообученная троичная языковая модель может потерять почти весь результат после экспорта. Работа Avichal Sahai, Nishant Raj и Animesh Srivastava пока не рецензирована, поэтому приведённые числа остаются замерами самих авторов: у Falcon-E-1B-Base строгая точность снизилась с 58,79% до 0,78%. Для пайплайна это означает, что модель до сохранения и развёрнутый файл нужно считать двумя версиями и сравнивать напрямую.

Троичные модели хранят каждый вес как отрицательный, нулевой или положительный код, но при дообучении обновляют более точное скрытое значение. В изученных экспортёрах это значение сначала переводят в bf16 — числовой формат с сокращённой точностью. Если обновлённый вес лишь немного пересёк порог между кодами, округление может вернуть его назад и тем самым отменить изменение.

На Falcon-E-1B-Base округление вернуло 96,3% добавленных при дообучении кодов. У BitCPM-CANN-0.5B строгая точность, то есть доля ответов в требуемом формате с правильным числом, упала с 36,13% до 0,39%. При более высокой скорости обучения эффект сокращался или оставался в пределах погрешности: веса дальше уходили от порога и реже округлялись обратно.

Проверка охватила Falcon-E-1B-Base, BitNet b1.58 2B-4T и BitCPM-CANN-0.5B. Модели дообучали на GSM8K и сравнивали результат во время обучения с той же контрольной точкой после штатного экспорта. Итоги основаны на 512 заданиях из обучающей части GSM8K, жадной генерации и одной или двух траекториях для каждого режима, поэтому они описывают конкретные модели и пайплайны, а не любой экспорт в bf16.

Оба испытанных исправления сохранили качество в пределах четырёх процентных пунктов от оценки до экспорта. В первом случае в развёрнутую модель записывали коды, которые использовал обучающий квантователь; во втором подбирали входные значения так, чтобы штатный экспортёр выдал те же коды. Практическая проверка здесь проста: перед выпуском нужно сопоставить коды модели во время дообучения и после экспорта, а не ограничиваться значением функции потерь до сохранения.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу