Журнал · Rit.work

Цена тернаризации Qwen3-4B: компактнее файл, ниже точность, без ускорения

По замерам авторов, тернаризация Qwen3-4B сократила размер файла более чем вдвое, но снизила точность и не ускорила инференс.

Rit.work
Студия разработки
3 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Anirudh Malik, M Sparsh Mehra и Poojith Devan преобразовали веса Qwen3-4B в тернарное представление после обучения; их работа — препринт, не проходивший рецензирования. Упакованный файл модели уменьшился с 8,29 до 3,96 ГиБ. Результаты важны для команд, которые рассматривают низкобитные модели ради локального запуска, распространения файлов или снижения требований к памяти.

Что сделали

Авторы применили к обученной Qwen3-4B ортогональное вращение KOTMS, тернаризацию E2M-ATQ и компенсацию ошибок в стиле GPTQ. Квантизировались только веса линейных слоёв: активации, механизм внимания и кэш ключей и значений сохранили 16-битную точность.

Название «1,58 бита» описывает информационную ёмкость одного значения из набора {−1, 0, +1}, но не весь формат хранения. Часть весов получила дополнительную тернарную плоскость, поэтому фактический бюджет квантизированных весов составил 1,641 бита на вес; служебные масштабы и неквантизированные тензоры учитываются отдельно.

Средняя точность по десяти сравнениям снизилась с 64,5% у исходной модели до 54,7% после преобразования. Потери различались по задачам: контекстные проверки пострадали меньше, чем задания на знания. Уменьшение файла также не дало автоматического ускорения: экспериментальное ядро Triton оказалось в 4,6 раза медленнее FP16 cuBLAS для одной проверенной размерности операции.

Что это значит

Работа разделяет три эффекта, которые часто смешивают: плотность представления, размер файла и скорость исполнения. Авторы показали преимущество для хранения, но не для текущего инференса. Такой формат может упростить передачу и размещение модели, однако для экономии времени и вычислительных ресурсов потребуется ядро, которое работает непосредственно с упакованными тернарными весами без дорогого восстановления.

Ограничения. Авторы проверили один запуск одной модели, откалиброванной на 64 фрагментах WikiText-2, и использовали ограниченный набор задач. Для упакованного файла не измерены полная точность по задачам и сквозная скорость генерации. Измерение скорости относится к прототипу на одной GPU и одной размерности операции. Кроме того, работа не содержит прямого сравнения с альтернативными способами послетренировочного квантования при одинаковых модели, данных и среде исполнения.

Источники

Иллюстрация: рисунок из статьи «Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment», Anirudh Malik, M Sparsh Mehra, Poojith Devan, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу