Журнал · Rit.work

Q-PACE перераспределяет разрядность слоёв во время обучения LLM

Q-PACE оценивает чувствительность слоёв LLM и периодически меняет их разрядность, чтобы сократить память при обучении с учётом квантования.

Rit.work
Студия разработки
8 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Разрядность слоёв LLM научились перераспределять по ходу обучения, сохраняя более точные вычисления там, где квантование сильнее портит результат. Работа ISTA и EPFL, которая пока не прошла рецензирование и приводит замеры самих авторов, в лучшем опыте вернула 81% разрыва по функции потерь между NVFP4 и MXFP8. Для команд, которые уже используют обучение с учётом квантования, Q-PACE предлагает заменить постоянный набор точных слоёв периодической калибровкой.

Как Q-PACE измеряет важность слоя

При обучении с учётом квантования, далее QAT, модель сразу считает часть операций в форматах с низкой разрядностью. Это уменьшает будущий размер весов и позволяет использовать более дешёвые матричные умножения, но одинаковая разрядность подходит не всем слоям: ошибка в одном почти не влияет на функцию потерь, а в другом заметно ухудшает её.

Обычная смешанная точность решает проблему статически. Например, последние блоки оставляют в BF16, а остальные переводят в NVFP4. Другой вариант — ранжировать слои по градиентам. Оба подхода предполагают, что заранее выбранный признак достаточно точно показывает, где модели нужна высокая точность.

Q-PACE измеряет это напрямую через возмущения весов. Метод по очереди добавляет к каждому линейному слою гауссов шум нескольких уровней и прогоняет калибровочные данные только вперёд. Чем сильнее растёт функция потерь при одинаковой средней квадратичной ошибке весов, тем выше чувствительность слоя.

Эта оценка приближает кривизну функции потерь: она показывает, насколько резко меняется качество рядом с текущими весами. Q-PACE умножает чувствительность каждого слоя на ожидаемую ошибку выбранного числового формата, а затем складывает результаты. Так метод заранее оценивает ущерб от конкретного распределения разрядности.

После калибровки остаётся дискретная задача: выбрать формат для каждого слоя и уложиться в общий объём памяти. Авторы сводят её к задаче о рюкзаке, где более точный формат расходует бюджет, но уменьшает ожидаемую потерю качества. Полученное распределение действует несколько этапов обучения, после чего чувствительность измеряют заново.

Чувствительность меняется медленнее весов

Q-PACE проверили при предварительном обучении моделей от 350M до 4B параметров на ClimbMix и при обучении по размеченным примерам моделей Qwen3. Средний бюджет составлял от 5,0 до 6,5 бита на квантованный параметр. Сравнивали с равномерными NVFP4 и MXFP8, сохранением последних слоёв в высокой точности и методом SNIP, который использует градиенты.

Во всех проверенных конфигурациях предварительного обучения Q-PACE получил наименьшую итоговую функцию потерь среди вариантов со смешанной точностью. Тот же порядок результатов сохранился при обучении Qwen3. Связь между рассчитанной ошибкой прямого прохода и итоговой функцией потерь достигла корреляции 0,98, даже когда обратный проход оставался целиком в FP4.

Распределение точности оказалось связано и с глубиной, и с типом слоя. Q-PACE чаще считал чувствительными проекции многослойного перцептрона, тогда как SNIP отдавал больший приоритет проекциям ключей в механизме внимания. Поэтому правило «оставить последние блоки точными» теряет часть доступного бюджета: важные слои встречаются не только в конце модели.

Проверка охватывала линейные слои внимания и многослойного перцептрона. Таблицы эмбеддингов и выходной слой оставались в высокой точности, а основная копия весов и состояние оптимизатора хранились в FP32. В большинстве опытов один формат назначали слою сразу для прямого и обратного проходов, поэтому результаты не описывают независимую настройку этих двух вычислений.

Менять архитектуру не нужно, план экспериментов — стоит

Q-PACE не требует менять устройство Transformer или функцию обучения. Его можно добавить поверх существующего контура QAT как периодический этап: собрать небольшую калибровочную выборку, измерить чувствительность, решить задачу распределения форматов и продолжить обучение.

Калибровка требует только прямых проходов. Дополнительная память нужна для одного шумового тензора размером с крупнейший слой, поэтому метод не хранит активации и градиенты специально для оценки чувствительности. В опыте с крупнейшей моделью измеренный рост времени составил 5%.

Пересчитывать оценки после каждого шага не требуется. Профиль чувствительности менялся заметно медленнее самих весов, и за полный запуск хватало порядка десяти перераспределений. Это делает Q-PACE практичным кандидатом для сравнительного запуска, а не отдельным исследовательским контуром с постоянной диагностикой.

Работа меняет планы прежде всего у команд, которые уже выбрали QAT и смешанные форматы, но пока распределяют точность вручную. Для них разумный следующий опыт — сравнить Q-PACE с текущим правилом при одинаковом среднем числе битов и оценить итоговую функцию потерь вместе с реальным временем обучения. Если инфраструктура использует одну разрядность для всех слоёв, сначала придётся обеспечить выполнение матричных умножений в разных форматах: без этого динамическое распределение применить негде.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу