Журнал · Rit.work

Scale-QLoRA сохраняет 4-битные коды при слиянии LoRA

Scale-QLoRA встраивает адаптер в нативный 4-битный чекпойнт, меняя только масштабы блоков и не запуская повторное квантование весовых кодов.

Rit.work
Студия разработки
7 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LoRA-адаптер теперь можно встроить в нативную 4-битную модель так, чтобы слияние не меняло её дискретные весовые коды. Наивный способ отнимал до 39 процентных пунктов точности, тогда как Scale-QLoRA не терял её; эти числа получили Tung-Ling Li и соавторы в работе, которая пока не рецензирована. Результат позволяет выпускать самостоятельный чекпойнт без зависимости от конкретной реализации повторного квантования.

В форматах NVFP4 и MXFP4 каждый вес состоит из кода E2M1 и общего масштаба блока. Коды занимают около 90% файла. Обычный LoRA меняет сами веса, поэтому при слиянии система вычисляет коды и масштабы заново: подходящая реализация квантования должна точно совпасть с той, на которой обучали адаптер.

Scale-QLoRA замораживает коды и обучает только поправки к масштабам блоков. При каждом расчёте модели масштабы заранее округляются до сетки целевого формата. Во время слияния остаётся записать уже обученные байты масштабов и дословно скопировать коды, поэтому итоговые веса побитово совпадают с теми, которые модель видела при обучении.

Scale-QLoRA проверили на четырёх моделях и четырёх задачах. После слияния его точность не отличалась от точности до слияния в пределах погрешности. QAT-LoRA дал такой же результат, но заново вычислял кодовую плоскость через квантователь; Scale-QLoRA сохранил её без изменений и в измеренном сценарии переключал задачу примерно в 125 раз быстрее, чем способ с повторным квантованием всего чекпойнта.

Гарантия действует, пока не меняются нативный формат, сетка масштабов, разбиение на блоки и исходные коды. Переход между форматами снова требует квантования и выходит за её пределы. Работа относится именно к самостоятельным слитым чекпойнтам: если система держит базовую модель и LoRA отдельно во время вывода, проблема перезаписи кодов при слиянии не возникает.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу