Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Qian Zhang и соавторы представили REAL-Q — метод послетренировочной квантизации LLM — в препринте, не прошедшем рецензирование. По замерам авторов, метод снижает расхождение между выходами исходной и квантизованной моделей до 49% относительно сравниваемых подходов. Работа важна командам, которые уменьшают требования модели к памяти без повторного обучения и выбирают между скоростью подготовки и качеством результата.
Что сделали
Послетренировочная квантизация переводит уже обученные веса модели в представление с меньшей разрядностью. Базовые методы семейства GPTQ проходят по матрице весов столбец за столбцом: округляют очередную часть весов, оценивают ошибку и аналитически корректируют ещё не обработанные столбцы.
Для такой коррекции используется гессиан — матрица, описывающая кривизну функции ошибки. Чтобы получить решение в замкнутой форме, GPTQ минимизирует локальную ошибку восстановления одного слоя и предполагает, что его входы не искажены квантизацией предыдущих слоёв. GuidedQuant добавляет информацию о чувствительности конечного выхода модели, но группирует выходные каналы и сохраняет приближённый гессиан неизменным на протяжении всего слоя.
Авторы REAL-Q считают это источником рассогласования: после округления очередных весов состояние модели меняется, а статическая матрица продолжает описывать прежнюю поверхность ошибки. Компенсации, подходившие в начале слоя, могут хуже соответствовать частично квантизованной модели ближе к его концу.
REAL-Q сохраняет аналитическую коррекцию как предварительный шаг, но после каждого блока из 128 столбцов пересчитывает градиент для текущего состояния весов. Затем метод делает шаг Adam только по ещё не квантизованной части матрицы. Уже округлённые веса остаются зафиксированными.
Целью служит агрегированная ошибка, взвешенная матрицей Фишера. Она приближает влияние изменений на распределение конечных ответов и сохраняет связи между выходными каналами, которые теряются при их группировке. Чтобы цель не менялась скачком на границе трансформерных блоков, REAL-Q постепенно переносит вес функции ошибки с текущего блока на соседний. Обратное распространение при этом остаётся локальным и не проходит каждый раз через всю модель.
Что показали
Основная метрика работы — дивергенция Кульбака — Лейблера, то есть различие между распределениями токенов исходной и квантизованной моделей. Чем она ниже, тем ближе поведение сжатой модели к исходному. Авторы измеряли её на WikiText-2 и сравнивали REAL-Q с RTN, GPTQ, GPTAQ и GuidedQuant при одинаковом предварительном вращении весов QuaRot.
По их результатам, REAL-Q получил наименьшую дивергенцию на всех проверенных моделях семейств LLaMA и Qwen. Проверка отдельных компонентов поддерживает объяснение авторов: когда интервал между градиентными коррекциями увеличили с 128 до 512 столбцов, значение метрики выросло с 5,44 до 6,57, то есть примерно на пятую часть. Это указывает, что результат связан не только с выбранной функцией ошибки, но и с частотой её обновления.
Авторы также приводят перплексию и среднюю точность на задачах без дополнительных примеров. Эти показатели в целом поддерживают основной результат, но отдельные изменения компонентов не улучшают все метрики одновременно. Поэтому работу стоит читать прежде всего как свидетельство более точного сохранения распределения выходов, а не как гарантию одинакового выигрыша на любой прикладной задаче.
Ограничения
Метод проверяли на семи моделях только двух семейств, с размером от 0,6 до 70 млрд параметров. Основное измерение проводилось на WikiText-2, а прикладная проверка ограничена десятью задачами без дополнительных примеров. В работе нет оценки диалоговых сценариев, генерации длинных текстов или качества на данных конкретного продукта.
Сравнение охватывает последовательные методы послетренировочной квантизации, использующие общий этап QuaRot. Оно не показывает, как REAL-Q соотносится с повторным обучением под квантизацию или другими конвейерами компрессии при одинаковом бюджете подготовки.
Авторы признают дополнительные затраты памяти и вычислений во время калибровки: REAL-Q выполняет прямой и обратный проход после каждого блока столбцов. При этом заявленное улучшение качества не сопровождается сравнением задержки инференса готовых моделей. Теоретическое условие уменьшения глобальной ошибки выведено для обычного градиентного спуска и, как прямо отмечено в работе, не переносится автоматически на фактически используемый Adam.
Что это значит
Работа не требует менять архитектуру продукта или выбирать другую базовую модель. Она меняет один этап конвейера развёртывания: вместо однократной статической оценки ошибки на слой предлагается корректировать оставшиеся веса по текущему состоянию частично квантизованной модели.
Для команды, которая уже использует GPTQ-подобную квантизацию и теряет качество на низкой разрядности, REAL-Q — основание добавить ещё один вариант в собственное сравнение. Проверять следует не только близость распределений, но и качество на продуктовых запросах, время калибровки, потребление GPU-памяти и совместимость полученного формата с используемым движком инференса.
Переносить основной конвейер на REAL-Q только по этой работе рано. Результаты показывают возможный выигрыш в качестве сжатия, но не устанавливают, окупает ли он более дорогую подготовку модели в конкретной инфраструктуре. Практический план меняется локально: метод стоит прототипировать там, где статическая квантизация уже стала измеримым ограничением качества.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



