Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Разрядность слоёв LLM научились перераспределять по ходу обучения, сохраняя более точные вычисления там, где квантование сильнее портит результат. Работа ISTA и EPFL, которая пока не прошла рецензирование и приводит замеры самих авторов, в лучшем опыте вернула 81% разрыва по функции потерь между NVFP4 и MXFP8. Для команд, которые уже используют обучение с учётом квантования, Q-PACE предлагает заменить постоянный набор точных слоёв периодической калибровкой.
Как Q-PACE измеряет важность слоя
При обучении с учётом квантования, далее QAT, модель сразу считает часть операций в форматах с низкой разрядностью. Это уменьшает будущий размер весов и позволяет использовать более дешёвые матричные умножения, но одинаковая разрядность подходит не всем слоям: ошибка в одном почти не влияет на функцию потерь, а в другом заметно ухудшает её.
Обычная смешанная точность решает проблему статически. Например, последние блоки оставляют в BF16, а остальные переводят в NVFP4. Другой вариант — ранжировать слои по градиентам. Оба подхода предполагают, что заранее выбранный признак достаточно точно показывает, где модели нужна высокая точность.
Q-PACE измеряет это напрямую через возмущения весов. Метод по очереди добавляет к каждому линейному слою гауссов шум нескольких уровней и прогоняет калибровочные данные только вперёд. Чем сильнее растёт функция потерь при одинаковой средней квадратичной ошибке весов, тем выше чувствительность слоя.
Эта оценка приближает кривизну функции потерь: она показывает, насколько резко меняется качество рядом с текущими весами. Q-PACE умножает чувствительность каждого слоя на ожидаемую ошибку выбранного числового формата, а затем складывает результаты. Так метод заранее оценивает ущерб от конкретного распределения разрядности.
После калибровки остаётся дискретная задача: выбрать формат для каждого слоя и уложиться в общий объём памяти. Авторы сводят её к задаче о рюкзаке, где более точный формат расходует бюджет, но уменьшает ожидаемую потерю качества. Полученное распределение действует несколько этапов обучения, после чего чувствительность измеряют заново.
Чувствительность меняется медленнее весов
Q-PACE проверили при предварительном обучении моделей от 350M до 4B параметров на ClimbMix и при обучении по размеченным примерам моделей Qwen3. Средний бюджет составлял от 5,0 до 6,5 бита на квантованный параметр. Сравнивали с равномерными NVFP4 и MXFP8, сохранением последних слоёв в высокой точности и методом SNIP, который использует градиенты.
Во всех проверенных конфигурациях предварительного обучения Q-PACE получил наименьшую итоговую функцию потерь среди вариантов со смешанной точностью. Тот же порядок результатов сохранился при обучении Qwen3. Связь между рассчитанной ошибкой прямого прохода и итоговой функцией потерь достигла корреляции 0,98, даже когда обратный проход оставался целиком в FP4.
Распределение точности оказалось связано и с глубиной, и с типом слоя. Q-PACE чаще считал чувствительными проекции многослойного перцептрона, тогда как SNIP отдавал больший приоритет проекциям ключей в механизме внимания. Поэтому правило «оставить последние блоки точными» теряет часть доступного бюджета: важные слои встречаются не только в конце модели.
Проверка охватывала линейные слои внимания и многослойного перцептрона. Таблицы эмбеддингов и выходной слой оставались в высокой точности, а основная копия весов и состояние оптимизатора хранились в FP32. В большинстве опытов один формат назначали слою сразу для прямого и обратного проходов, поэтому результаты не описывают независимую настройку этих двух вычислений.
Менять архитектуру не нужно, план экспериментов — стоит
Q-PACE не требует менять устройство Transformer или функцию обучения. Его можно добавить поверх существующего контура QAT как периодический этап: собрать небольшую калибровочную выборку, измерить чувствительность, решить задачу распределения форматов и продолжить обучение.
Калибровка требует только прямых проходов. Дополнительная память нужна для одного шумового тензора размером с крупнейший слой, поэтому метод не хранит активации и градиенты специально для оценки чувствительности. В опыте с крупнейшей моделью измеренный рост времени составил 5%.
Пересчитывать оценки после каждого шага не требуется. Профиль чувствительности менялся заметно медленнее самих весов, и за полный запуск хватало порядка десяти перераспределений. Это делает Q-PACE практичным кандидатом для сравнительного запуска, а не отдельным исследовательским контуром с постоянной диагностикой.
Работа меняет планы прежде всего у команд, которые уже выбрали QAT и смешанные форматы, но пока распределяют точность вручную. Для них разумный следующий опыт — сравнить Q-PACE с текущим правилом при одинаковом среднем числе битов и оценить итоговую функцию потерь вместе с реальным временем обучения. Если инфраструктура использует одну разрядность для всех слоёв, сначала придётся обеспечить выполнение матричных умножений в разных форматах: без этого динамическое распределение применить негде.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



