Журнал · Rit.work

Квантизация LLM: дополнительную точность лучше распределять по всей модели

PayPal AI сравнила глобальное повышение точности квантизации с защитой отдельных слоёв: первый подход лучше использовал одинаковый битовый бюджет.

Rit.work
Студия разработки
4 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Исследователи PayPal AI изучили, куда направлять дополнительную точность при квантизации LLM, в препринте, который не проходил рецензирование. По их замерам, глобальное повышение точности дало на 21–52 процентных пункта больше восстановления качества, чем защита отдельных слоёв при одинаковом битовом бюджете. Работа важна командам, которые выбирают процедуру посттренировочной квантизации для запуска открытых моделей на собственной инфраструктуре.

Что сделали

Посттренировочная квантизация (PTQ) уменьшает точность представления уже обученных весов, чтобы сократить объём модели и требования к вычислениям при выдаче ответов. Снижение разрядности может ухудшить качество, причём разные слои и задачи реагируют на него неодинаково.

Авторы проверили распространённую инженерную идею: найти наиболее чувствительные части модели и оставить повышенную точность только там. В качестве возможных признаков чувствительности они взяли изменение цепочек вычислений для отдельных задач, причинную важность активаций и статистики весов — их разброс и ошибку восстановления после квантизации.

Затем каждый такой признак проверили прямым вмешательством. Авторы переводили один слой из четырёхбитного представления в восьмибитное, оставляя остальные слои без изменений, и измеряли, какую долю потерянного качества это возвращает. Такой перебор показывает фактическую полезность дополнительной точности в конкретном месте, а не только корреляцию с ошибкой.

Для распределения общего бюджета сравнили два варианта. Локальный вариант повышал разрядность наиболее полезных слоёв. Глобальный применял более мелкие группы квантования ко всей модели: отдельный масштаб вычислялся для каждой группы из 128 весов, поэтому приближение точнее подстраивалось к их диапазону. Авторы выровняли варианты по эффективному числу битов на один вес, чтобы преимущество нельзя было объяснить большим объёмом представления.

Что показали

Ни изменение цепочек вычислений, ни причинная важность активаций, ни исследованные статистики весов не позволили надёжно определить слои, где восстановление точности даст наибольшую прибавку. Полезный для интерпретации сигнал, таким образом, не обязательно подходит для распределения битового бюджета.

Для 8 из 9 моделей ущерб оказался распределён по сети: чтобы вернуть 75% разницы между низкой и высокой разрядностью, требовалось повысить точность примерно у половины слоёв. Исключением стала Qwen3-8B, где восстановление было сосредоточено в небольшой части сети, но даже для неё локальная стратегия не выиграла при ограниченном бюджете.

При добавке в 0,146 эффективного бита на вес глобальная гранулярность превзошла локальный ремонт во всех совместимых моделях. Это строгое сравнение для локальной стратегии: слои выбирались по результатам того же измерения, на котором оценивались, то есть авторы использовали недоступный в обычном внедрении идеальный выбор. Практический алгоритм поиска слоёв мог бы показать результат хуже.

Авторы также разделили эффект гранулярности и алгоритма квантизации. В исследованном режиме основное восстановление качества давал переход к более мелким группам по всей модели, а различия между RTN, GPTQ и AWQ при одинаковой гранулярности были меньше.

Ограничения

Работу проверяли на 9 открытых моделях размером не более 8B параметров. Оценка охватывала 22 задачи, но для каждой использовалось по 200 примеров. Поэтому результаты не показывают, сохранится ли структура повреждений у более крупных моделей, на длинных контекстах и в прикладных сценариях, отличающихся от набора авторов.

Вывод об отсутствии точечного исправления относится к целым слоям, выбранным жадно по отдельной полезности. Авторы не проверяли совместно оптимизированные наборы слоёв, защиту отдельных весов и чувствительность на основе матрицы вторых производных. Не проверено и то, сохраняется ли распределение повреждений после более качественной исходной квантизации, поскольку поиск чувствительных слоёв проводился в режиме с намеренно заметной ошибкой.

Сравнение бюджетов учитывает веса и использует приближённый расчёт битов, а не фактический размер файлов и служебных данных конкретной реализации. Выбор локальных слоёв настроен и оценён на одном наборе, поэтому это верхняя граница, а не готовая процедура. Работа также не измеряет задержку выдачи, пропускную способность и денежную стоимость развёртывания.

Что это значит

Для команд, которые собирались создавать собственный механизм смешанной точности и защищать несколько «критических» слоёв, работа меняет порядок экспериментов. Первым кандидатом должна стать глобальная квантизация с более мелкими группами, доступная в выбранном фреймворке. По замерам авторов, она лучше использовала тот же объём представления даже тогда, когда чувствительные слои были заранее известны.

Это не основание отказаться от GPTQ, AWQ или смешанной точности как класса. Исследование не предлагает новый алгоритм и не сравнивает производительность реализаций. Оно разделяет два решения: где распределять дополнительную точность и каким методом вычислять квантованные веса. Для первого решения работа поддерживает глобальный вариант как исходную настройку; второе всё ещё требует замеров на целевом оборудовании и задачах продукта.

Практический план — сначала построить базовую линию с глобальной мелкогрупповой квантизацией, проверить качество и параметры выдачи, а затем оценивать более сложное распределение точности. Разработка отдельного селектора слоёв оправдана только после того, как он на независимом наборе обойдёт этот базовый вариант с учётом фактического размера модели и скорости работы.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу