Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Распределять разную разрядность между слоями LLM можно точнее, если не сводить важность каждой матрицы к одному коэффициенту. Хотя препринт не рецензировался и все числа получили сами авторы, на Qwen3-8B при среднем бюджете в три бита на вес точность выросла с 41,7% у Q-Palette до 61,5% у CASA. Для команд, которые сжимают модели ниже трёх бит на вес, выбор разрядности по слоям становится отдельной точкой оптимизации, а не настройкой поверх готового квантователя.
Один коэффициент теряет направление ошибки
При смешанной точности каждый модуль получает свою разрядность: важным матрицам оставляют больше битов, менее важным — меньше. Распределитель должен уложиться в общий объём весов и сохранить качество модели.
Q-Palette и похожие методы оценивают чувствительность модуля одним числом. Оно умножается на величину ошибки квантования и позволяет свести распределение битов к задаче о рюкзаке: для каждой матрицы нужно выбрать один вариант, не превысив общий бюджет.
Проблема в том, что одинаковая по величине ошибка влияет на модель по-разному. Некоторые входные каналы получают крупные активации, а отдельные выходные каналы сильнее меняют последующие вычисления. Один коэффициент считает все направления внутри матрицы равноценными и может отдать больше битов не тому модулю.
Akihiro Yoshida и Yuma Ichikawa описывают эту потерю через гессиан — матрицу вторых производных функции потерь. Одна её часть отражает распределение входных активаций, другая — чувствительность выходов. Худшая ошибка скалярной оценки зависит от того, насколько неравномерны обе части; теоретическая граница для типичных модулей LLM различается от 10 до 1013 раз. Поэтому единая шкала чувствительности может хорошо ранжировать одни слои и полностью переставить местами другие.
Как CASA выбирает разрядность в два прохода
На первом проходе CASA оценивает каждую пару «модуль — разрядность» с учётом входных активаций и чувствительности выходных каналов. Для вычислений метод использует диагональное приближение двух частей гессиана: оно не хранит все связи между каналами, но сохраняет их разные веса. После этого целочисленный решатель выбирает вариант для каждой матрицы в рамках общего бюджета.
Такой расчёт всё ещё рассматривает модули по отдельности. В трансформере ошибка одного слоя проходит по остаточному потоку и взаимодействует с ошибкой следующего, поэтому сумма независимых оценок не полностью описывает итоговую потерю.
Второй проход меняет разрядность парами: одному модулю добавляет бит, у другого забирает, сохраняя бюджет. CASA сначала ранжирует такие обмены по приближённой оценке взаимодействия соседних слоёв, затем заново квантует лучшие варианты и проверяет их по функции потерь на калибровочных данных. Замена принимается, только если полная модель ошибается меньше.
Разделение на два прохода здесь существенно. Попытка сразу добавить межслойные связи в задачу о рюкзаке не улучшила результат: приближение оказалось слишком грубым для совместного выбора. Локальный поиск проверяет взаимодействия уже после того, как первый проход нашёл разумное распределение.
Когда CASA меняет план внедрения
Метод проверили на пяти моделях семейств Llama и Qwen размером от 7 до 14 миллиардов параметров. Веса квантовали через GPTQ на данных C4, качество измеряли по неопределённости следующего токена на WikiText-2 и по средней точности шести задач на рассуждение без примеров. CASA сравнивали с равномерной разрядностью, Q-Palette и вариантом без межслойного поиска.
Основную прибавку даёт уже первый проход: учёт активаций стабильнее скалярной оценки, особенно у моделей с сильно неравномерными каналами. Второй проход чаще помогает при самом жёстком бюджете; при более высокой разрядности разница сокращается, а по отдельным сочетаниям модели и метрики локальный поиск не превосходит первый проход.
Это аргумент пересмотреть распределитель битов, если продукт упирается в объём памяти и качество заметно падает при ультранизкой разрядности. CASA не требует заменить GPTQ: метод выбирает разрядность модулей, а сам квантователь остаётся отдельным компонентом. Однако второй проход повышает стоимость подготовки модели, потому что многократно квантует кандидатов и прогоняет калибровочные данные.
Проверка охватывает качество при фиксированном объёме весов, а не скорость выполнения на целевом оборудовании. Межслойная оценка учитывает только соседние слои и одинаковые типы модулей, поэтому дальние взаимодействия остаются за пределами поиска. Сравнение с Q-Palette также не буквально воспроизводит исходную схему: её квантователи заменили на GPTQ.
Для бюджета около четырёх бит на вес результаты не дают оснований менять уже работающий конвейер только ради CASA. При попытке приблизиться к двум-трём битам тест такого распределителя оправдан: именно там неверный порядок чувствительности модулей сильнее всего влияет на итоговое качество.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



