Журнал · Rit.work

Двухэтапная коррекция вернула качество двухбитным LLM без обучения

Новый метод корректирует ошибки агрессивной квантизации закрытыми вычислениями и возвращает до 84% разрыва между двухбитной моделью и FP16.

Rit.work
Студия разработки
7 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

У двухбитных LLM вернули значительную часть качества без повторного обучения. В нерецензированном препринте, где все числа получили сами авторы, Seobin Song, Geonho Lee, Janghwan Lee и Jungwook Choi закрыли на C4 от 51 до 84% разрыва с FP16 против 31–63% у сильнейшего прежнего метода. Это делает агрессивную квантизацию менее рискованной там, где четырёхбитная модель не помещается в доступную память.

Прежние методы сравнивали полноточный и квантованный слои на одинаковых входных данных. Но после квантизации предыдущие слои уже меняют активации, поэтому адаптер ограниченного ранга исправляет не ту ошибку, которая возникает при реальном проходе модели. На первом этапе новый метод сопоставляет фактические выходы двух версий и направляет ёмкость адаптера на изменения, которые сильнее влияют на функцию потерь.

После первой коррекции метод заново измеряет градиенты уже исправленной модели. Второй этап делает ограниченный по рангу шаг естественного градиента и устраняет направление ошибки, которое обычная реконструкция не учитывает. Для каждого линейного слоя адаптер вычисляют через одно усечённое сингулярное разложение: обратные проходы собирают статистику, но итеративного обучения нет.

На Qwen3-4B с QuIP# перплексия WikiText-2 снизилась с 21,11 до 13,22; меньшая перплексия означает, что модель увереннее предсказывает продолжение текста. При этом C4 служил отложенной проверкой, поскольку для калибровки использовали WikiText-2. Улучшение сохранилось в среднем по семи задачам без примеров в запросе.

Основные опыты охватывают Qwen3-4B и Qwen3-8B с QuIP# при разной разрядности, а также LLaMA-3.1-8B с групповым округлением. Всем методам дали адаптеры ранга 64; вычисления запускали на одной NVIDIA A100 с 40 ГБ памяти. Метод по-прежнему оставляет квантованные веса замороженными и исправляет их отдельными адаптерами, поэтому результаты не показывают, что совместная настройка весов и коррекции стала лишней.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу