Журнал · Rit.work

AlignQuant состыковал смешанную точность LLM с устройством GPU

AlignQuant назначает разную разрядность прямоугольным блокам весов и исполняет их на GPU без разрыва между схемой квантизации, хранением и вычислениями.

Rit.work
Студия разработки
7 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

LLM научились хранить компактнее и быстрее запускать на GPU без отказа от локального выбора точности. AlignQuant, работа University of North Texas и Saint Louis University, ускорил генерацию до 2,5 раза относительно BF16, хотя препринт не рецензирован и числа получили сами авторы. Подход позволяет проектировать квантизацию сразу под реальные единицы хранения и вычислений, а не адаптировать её к железу после обучения.

Мелкая квантизация не гарантирует быстрый запуск

Квантизация снижает разрядность весов модели, чтобы сократить объём памяти и трафик между памятью и вычислительными блоками. При смешанной точности чувствительные веса сохраняют подробнее, а остальные занимают меньше места. Так модель можно сжать аккуратнее, чем при одинаковой разрядности всех весов.

Проблема возникает, когда границы таких областей не совпадают с прямоугольными блоками, которые GPU загружает и обрабатывает как единое целое. Тонкая настройка точности тогда создаёт нерегулярную раскладку: ядру приходится искать фрагменты, распаковывать разные форматы или переставлять данные. Выигрыш от меньшего объёма весов частично уходит на обслуживание этой структуры.

Более крупное деление упрощает исполнение, но связывает веса с разной чувствительностью одним решением. Например, целый выходной канал приходится хранить с высокой точностью, даже если она нужна только небольшой части его весов.

AlignQuant выбирает общей единицей прямоугольный тайл — блок весовой матрицы, совместимый с раскладкой GPU. Один и тот же тайл участвует в оценке чувствительности, получает разрядность, сохраняется в упакованном виде и поступает в вычислительное ядро. Поэтому границы точности не меняются по пути от калибровки до исполнения.

Как тайл получает разрядность

Для каждого тайла AlignQuant готовит два варианта весов: 4-битный и 8-битный. Перед этим ортогональные преобразования перераспределяют выбросы в значениях, чтобы отдельные крупные веса меньше портили квантизацию. Активации во время калибровки и исполнения остаются 8-битными.

Метод временно заменяет подробный вариант тайла компактным и измеряет, как меняется выход соответствующей линейной проекции. Одной величины ошибки недостаточно: изменение умножают на градиенты функции потерь всей модели. Тайлы, чьи ошибки сильнее влияют на итоговый ответ, получают более высокий приоритет для сохранения подробного представления.

Калибровка отдельно учитывает обработку входного запроса (prefill) и последовательную генерацию следующих токенов. Результаты нормализуют для каждой фазы, после чего для тайла берут более высокий относительный показатель. Если участок важен хотя бы в одной фазе, у него больше шансов остаться высокоточным.

Затем тайлы ранжируют по всей модели, а не внутри отдельного слоя. Под заданный бюджет самые чувствительные сохраняют подробный формат, остальные переходят в компактный. Это позволяет тратить доступную память там, где снижение точности сильнее влияет на функцию потерь.

В памяти два типа тайлов лежат в отдельных непрерывных буферах, а короткая метка указывает нужный вариант. Специализированные ядра загружают компактные веса и разворачивают их в INT8 непосредственно на GPU. Для обработки запроса и генерации используются разные расписания вычислений, но оба читают одну упакованную модель.

Когда AlignQuant меняет планы внедрения

Метод проверили на Llama-3.2-3B, Qwen3-4B, Ministral-3-8B и Qwen3-14B. Замеры охватили NVIDIA A100, H100 NVL и RTX 4090, а длина контекста доходила до 64K токенов. Основным ориентиром служила исходная модель в BF16; качество также проверяли на общих задачах, языковом моделировании и длинном контексте.

Смысл результата не сводится к очередной схеме распределения битов. AlignQuant показывает, что единицу точности стоит выбирать одновременно для калибровки, хранения и ядра GPU. Если эти три части проектировать независимо, более точная схема квантизации может не дать пропорционального ускорения.

Для команды с собственным контуром выдачи работа даёт практическое направление: оценивать методы не только по размеру модели и качеству ответов, но и по совпадению границ точности с раскладкой вычислительных ядер. Особенно это касается продуктов, где стоимость определяют длительная генерация, длинные запросы или ограниченная память GPU.

Внедрение потребует офлайн-калибровки, собственной упаковки весов и специализированных ядер для двух фаз вывода. Поэтому AlignQuant нельзя оценивать как замену формата модели одной настройкой. Команде, которая использует внешнее API или стандартный движок без возможности менять ядра, подход пока не меняет архитектурный выбор; разработчикам собственного стека он предлагает связать алгоритм квантизации с целевой GPU до начала оптимизации.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу