Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Anirudh Malik, M Sparsh Mehra и Poojith Devan преобразовали веса Qwen3-4B в тернарное представление после обучения; их работа — препринт, не проходивший рецензирования. Упакованный файл модели уменьшился с 8,29 до 3,96 ГиБ. Результаты важны для команд, которые рассматривают низкобитные модели ради локального запуска, распространения файлов или снижения требований к памяти.
Что сделали
Авторы применили к обученной Qwen3-4B ортогональное вращение KOTMS, тернаризацию E2M-ATQ и компенсацию ошибок в стиле GPTQ. Квантизировались только веса линейных слоёв: активации, механизм внимания и кэш ключей и значений сохранили 16-битную точность.
Название «1,58 бита» описывает информационную ёмкость одного значения из набора {−1, 0, +1}, но не весь формат хранения. Часть весов получила дополнительную тернарную плоскость, поэтому фактический бюджет квантизированных весов составил 1,641 бита на вес; служебные масштабы и неквантизированные тензоры учитываются отдельно.
Средняя точность по десяти сравнениям снизилась с 64,5% у исходной модели до 54,7% после преобразования. Потери различались по задачам: контекстные проверки пострадали меньше, чем задания на знания. Уменьшение файла также не дало автоматического ускорения: экспериментальное ядро Triton оказалось в 4,6 раза медленнее FP16 cuBLAS для одной проверенной размерности операции.
Что это значит
Работа разделяет три эффекта, которые часто смешивают: плотность представления, размер файла и скорость исполнения. Авторы показали преимущество для хранения, но не для текущего инференса. Такой формат может упростить передачу и размещение модели, однако для экономии времени и вычислительных ресурсов потребуется ядро, которое работает непосредственно с упакованными тернарными весами без дорогого восстановления.
Ограничения. Авторы проверили один запуск одной модели, откалиброванной на 64 фрагментах WikiText-2, и использовали ограниченный набор задач. Для упакованного файла не измерены полная точность по задачам и сквозная скорость генерации. Измерение скорости относится к прототипу на одной GPU и одной размерности операции. Кроме того, работа не содержит прямого сравнения с альтернативными способами послетренировочного квантования при одинаковых модели, данных и среде исполнения.
Источники
Иллюстрация: рисунок из статьи «Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment», Anirudh Malik, M Sparsh Mehra, Poojith Devan, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



