Журнал · Rit.work

Квантизация ZK-LLM: меньше битов не значит быстрее доказательство

Исследование девяти LLM показывает, почему точность активаций и отдельных нелинейных операторов важнее равномерного сокращения разрядности при построении ZK-доказательств.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Снижение точности вычислений не всегда ускоряет криптографическую проверку LLM и может первым нарушить работу отдельного оператора. Работа University of Illinois Urbana-Champaign на девяти моделях показала, что активации чувствительнее весов, хотя препринт не рецензирован и все числа получили сами авторы. При проектировании ZK-LLM точность стоит выбирать отдельно для разных операций, а не сокращать одинаково во всей модели.

Почему обычная квантизация не подходит для ZK-LLM

Доказательство с нулевым разглашением позволяет подтвердить, что модель выполнила заданное вычисление, не раскрывая её веса и другие закрытые данные. Такие системы работают не с привычными числами с плавающей точкой, а с арифметикой над конечным полем: сложением и умножением по модулю большого простого числа.

Квантизация переводит веса и промежуточные значения модели в целые числа ограниченной разрядности. Для обычного запуска это прежде всего способ сократить память и ускорить вычисления на поддерживаемом оборудовании. В ZK-системе она также определяет структуру доказательства: сколько потребуется арифметических ограничений, проверок диапазона и обращений к таблицам значений.

Нелинейные функции вроде GeLU, softmax и обратного квадратного корня нельзя напрямую выразить только сложениями и умножениями. Их заменяют фиксированными таблицами: система проверяет, что для заданного входа выбран разрешённый выход. Чем таблица точнее, тем лучше она повторяет исходную функцию, но тем больше места может занять в доказательстве.

Авторы определяют пригодную для ZK квантизацию через три свойства. Она должна сохранять качество модели, сокращать затраты на доказательство и заранее фиксировать все масштабы, правила пересчёта и таблицы. Если параметры зависят от входного запроса, схему нельзя эффективно скомпилировать до запуска.

Проверка охватила разные семейства и масштабы, включая Qwen2.5-14B и Qwen3-30B-A3B с архитектурой смеси экспертов. Качество сравнивали на уровне внутренних значений, распределения следующих токенов и прикладных задач. Полное время построения доказательства измеряли на GPT-2 Small, Medium и Large, поскольку для крупнейших моделей текущая реализация требует слишком много памяти.

Точность активаций и RMSNorm определяет качество

Весовые коэффициенты можно сокращать агрессивнее, чем активации — промежуточные значения, которые модель вычисляет для конкретного запроса. Ошибка в весах остаётся фиксированной, а ошибка в активациях проходит через следующие слои и накапливается. Поэтому конфигурация с компактными весами и более точными активациями часто лучше равномерно низкой разрядности.

Отдельным источником ухудшения стали таблицы нелинейных функций. В нескольких крупных моделях главным узким местом оказался обратный квадратный корень внутри RMSNorm, который нормализует значения между слоями. Повышение точности только этой таблицы возвращало качество близко к исходной модели, тогда как расширять все таблицы не требовалось.

Разрыв в стоимости между плавающей точкой и целыми числами остаётся большим. Для одного блока Qwen2.5-14B вычисления с плавающей точкой заняли бы, по экстраполяции, 33,87 часа, а целочисленные проекции напрямую доказали за 95,46 секунды. Перенос оценки на все 48 блоков даёт около 67 дней только для проекций с плавающей точкой.

Но после перехода на целые числа дальнейшее сокращение разрядности перестаёт давать пропорциональную экономию. Уменьшение таблиц в 256 раз почти не изменило полное время: число обращений к ним осталось тем же, а основную стоимость создавали другие части доказательства. Значит, размер отдельной таблицы или число битов нельзя использовать как прямой показатель скорости всей системы.

Что менять в планах команд

Для прототипа ZK-LLM не стоит начинать с минимальной разрядности во всех слоях. Сначала нужно зафиксировать структуру доказательства и измерить вклад каждой группы операций: матричных умножений, пересчёта масштаба, проверок диапазона и нелинейных таблиц. Сокращать точность имеет смысл там, где это действительно уменьшает число ограничений или обращений.

На небольших моделях веса и активации по 16 бит дали почти ту же стоимость доказательства, что и более низкая точность, но лучше сохраняли качество. Повышать разрядность без проверки тоже нельзя: если произведения перестают помещаться в поле размером 31 бит, каждое значение приходится разбивать на несколько элементов, и стоимость растёт скачком.

Практическая конфигурация получается неоднородной: веса получают одну точность, активации — другую, а чувствительные функции вроде обратного квадратного корня — собственные таблицы. Такой подход сложнее единого режима квантизации, зато связывает каждое изменение с измеримым эффектом на качество и время построения доказательства.

Работа меняет прежде всего порядок разработки. Обычный профиль квантизации нельзя перенести в ZK-контур как готовую оптимизацию: сначала требуется реализация арифметической схемы, затем замеры по операторам и только после этого выбор разрядности. Для крупных моделей результаты пока задают принципы проектирования, а не подтверждают доступность полного доказательства в промышленном масштабе.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу