Журнал · Rit.work

Квантизатор распределил биты по времени жизни ошибки

Метод с учётом затухания каналов сжимает рекуррентное состояние гибридных языковых моделей до четырёх бит точнее семи вариантов сравнения.

Rit.work
Студия разработки
28 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Рекуррентное состояние гибридных языковых моделей удалось сжать точнее, если отдавать больше бит каналам, где ошибка живёт дольше. Хотя препринт Hongren Chen и Jiayang He не рецензирован и числа получили сами авторы, при среднем бюджете четыре бита метод снизил лишнюю ошибку в 3,3–27,9 раза относительно лучшего из семи вариантов сравнения. Это делает низкую разрядность перспективной для сокращения памяти, но пока не доказывает ускорение на GPU.

Гибридные модели хранят историю в матрице фиксированного размера и обновляют её с каждым токеном. Обычный квантизатор учитывает диапазон значений, но не различает каналы: в одних ошибка быстро затухает, в других сохраняется и влияет на последующие ответы.

Новый метод оценивает накопленный эффект ошибки через граммиан наблюдаемости — математическую меру того, насколько состояние влияет на будущие выходы модели. Эту оценку объединяют с диапазонами значений, нормализованными внутри связанных групп, а затем назначают каналам разную разрядность. Для этого не нужны калибровочные данные, дополнительное обучение или поворот матриц.

Качество измеряли через избыточную отрицательную логарифмическую правдоподобность: чем меньше её прирост относительно состояния FP32, тем ближе результат модели к исходному. При шести битах разница не превышала 0,005 нат. Четыре бита здесь означают среднюю полезную нагрузку; шкалы и карты разрядности увеличивают фактический объём хранения.

Основной результат проверяли на Kimi, Qwen3.8 и Qwen3.6 с WikiText, квантуя состояние после каждого токена. При записи состояния каждые 64 токена преимущество ослабло: метод лидировал или делил первое место в 11 из 15 сочетаний модели и бюджета. Квантизаторы имитировали программно, без замеров скорости ядер, поэтому работа пока отвечает на вопрос о качестве сжатия, а не о задержке и пропускной способности.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу