Журнал · Rit.work

QuantForge превращает контрольные опыты в код для MXFP4-квантования

QuantForge связывает контрольные опыты с обязательными правками кода и находит переносимые алгоритмы посттренировочного квантования для MXFP4.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Поиск программ научили не только сохранять удачные варианты квантования, но и превращать контрольный опыт в обязательную правку следующей версии кода. В работе Peking University QuantForge при одинаковом бюджете достигала целевого качества вдвое чаще ближайших вариантов; препринт не рецензирован, а числа получили сами авторы. Для команд это разделяет две задачи: результат выбирает кандидата, а проверенная причина задаёт следующую правку.

Как контрольный опыт становится правкой кода

Посттренировочное квантование (PTQ) уменьшает разрядность весов и активаций уже обученной модели. В строгом формате MXFP4 несколько значений используют общую степень масштаба, поэтому крупное значение может ухудшить точность кодирования остальных. Преобразование координат исправляет одну ошибку, но одновременно меняет ошибки следующих этапов.

Обычный автоматический поиск видит итоговую оценку и сохраняет лучший код. Этого недостаточно, когда одно улучшение допускает несколько объяснений. Например, сохранение крупнейшего 1% весов в повышенной точности может помочь из-за важности именно этих весов или просто из-за дополнительной ёмкости формата.

QuantForge записывает конкурирующие объяснения до запуска опыта и требует предсказать их поведение при контрольных изменениях. В примере достаточно отдать тот же объём случайным весам: одинаковый эффект поддержит объяснение через ёмкость, разный — через выбор конкретных весов. Система выбирает самый дешёвый набор контролей, который разделяет гипотезы.

Вердикт затем превращается в требование к следующей версии программы. Если опыт опроверг объяснение, новый код не может снова опереться на него без более точной проверки. Отдельная проба подтверждает, что требуемое изменение действительно исполняется, а не осталось в текстовом рассуждении модели.

При этом удачная программа не удаляется только потому, что её первоначальное объяснение оказалось неверным. QuantForge сохраняет её как рабочую основу, меняет направление поиска и заново измеряет ошибки после правки. Так состав алгоритма определяется по ходу поиска, а не задаётся заранее как неизменная цепочка операций.

HiRes исправляет ошибку, оставшуюся после предыдущего этапа

Поиск привёл к фиксированному алгоритму HiRes для строгого MXFP4 W4A4, где веса и активации хранятся в четырёх битах. Его первая стадия меняет координаты без изменения исходного вычисления. Преобразование учитывает ошибки реального кодирования, а затем распределяет риск между весами и активациями.

Вторая стадия выбирает допустимые коды уже в новых координатах. Веса восстанавливаются с учётом корреляций входных данных, а округление активаций зависит от фактически установленных квантованных весов. HiRes может заменить один допустимый код внутри блока, если это уменьшает ошибку выхода.

Третья стадия добавляет маломерные поправки для путей внимания и многослойного перцептрона. Сначала алгоритм исправляет выход внимания, затем повторно измеряет остаточную ошибку и только после этого настраивает поправку для следующего пути. Старые статистики здесь не переиспользуются: предыдущая коррекция уже изменила состояние модели.

HiRes проверяли на семи моделях и семи задачах при едином контракте MXFP4. Алгоритм получил минимальный Robust Fit — 0,093; этот показатель объединяет средний и худший ущерб от квантования, и меньшее значение лучше. На Qwen3-32B он также показал лучший среди квантованных методов сводный результат Fit-7.

Эти замеры показывают численную точность, а не готовность производственного контура. Эксперименты использовали имитацию квантования в PyTorch, а работа на собственных MXFP4-ядрах с реальными показателями задержки, пропускной способности и памяти в проверку не входила.

Что меняется в планах команд

Для команд, которые автоматизируют поиск алгоритмов, работа предлагает более строгий цикл: гипотеза, различающий контроль, вердикт, обязательная правка кода и проверка исполнения. Такой цикл расходует часть бюджета не на новые кандидаты, зато снижает риск, что модель повторит удачный приём по неверной причине.

При бюджете в 240 вызовов оценщика QuantForge достигла целевой перплексии в шести запусках из восьми. Две схемы с памятью о прошлых решениях справились в трёх запусках каждая, а поиск только по итоговой оценке — в одном. Перплексия измеряет, насколько уверенно языковая модель предсказывает текст; меньшее значение означает лучший результат.

Перенос проверяли отдельно: поиск видел Qwen3-4B, а итогового кандидата оценивали на Llama-3.1-8B и WikiText-2. Поэтому практический результат QuantForge относится не только к подгонке под модель, доступную во время поиска.

Для внедрения MXFP4 вывод осторожнее. HiRes можно рассматривать как кандидата для проверки на целевом оборудовании, но менять план закупки GPU или расчёт производственной экономики по этой работе рано. Сначала потребуется реализовать операции на доступных ядрах и измерить конечную скорость, память и качество на собственных моделях.

Более общий результат применим за пределами квантования: если LLM меняет исполняемый код, одной таблицы оценок мало. Контроль должен не только объяснить прошлый успех, но и ограничить следующую реализацию — иначе эксперимент не становится частью системы поиска.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу