Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Снижение точности вычислений не всегда ускоряет криптографическую проверку LLM и может первым нарушить работу отдельного оператора. Работа University of Illinois Urbana-Champaign на девяти моделях показала, что активации чувствительнее весов, хотя препринт не рецензирован и все числа получили сами авторы. При проектировании ZK-LLM точность стоит выбирать отдельно для разных операций, а не сокращать одинаково во всей модели.
Почему обычная квантизация не подходит для ZK-LLM
Доказательство с нулевым разглашением позволяет подтвердить, что модель выполнила заданное вычисление, не раскрывая её веса и другие закрытые данные. Такие системы работают не с привычными числами с плавающей точкой, а с арифметикой над конечным полем: сложением и умножением по модулю большого простого числа.
Квантизация переводит веса и промежуточные значения модели в целые числа ограниченной разрядности. Для обычного запуска это прежде всего способ сократить память и ускорить вычисления на поддерживаемом оборудовании. В ZK-системе она также определяет структуру доказательства: сколько потребуется арифметических ограничений, проверок диапазона и обращений к таблицам значений.
Нелинейные функции вроде GeLU, softmax и обратного квадратного корня нельзя напрямую выразить только сложениями и умножениями. Их заменяют фиксированными таблицами: система проверяет, что для заданного входа выбран разрешённый выход. Чем таблица точнее, тем лучше она повторяет исходную функцию, но тем больше места может занять в доказательстве.
Авторы определяют пригодную для ZK квантизацию через три свойства. Она должна сохранять качество модели, сокращать затраты на доказательство и заранее фиксировать все масштабы, правила пересчёта и таблицы. Если параметры зависят от входного запроса, схему нельзя эффективно скомпилировать до запуска.
Проверка охватила разные семейства и масштабы, включая Qwen2.5-14B и Qwen3-30B-A3B с архитектурой смеси экспертов. Качество сравнивали на уровне внутренних значений, распределения следующих токенов и прикладных задач. Полное время построения доказательства измеряли на GPT-2 Small, Medium и Large, поскольку для крупнейших моделей текущая реализация требует слишком много памяти.
Точность активаций и RMSNorm определяет качество
Весовые коэффициенты можно сокращать агрессивнее, чем активации — промежуточные значения, которые модель вычисляет для конкретного запроса. Ошибка в весах остаётся фиксированной, а ошибка в активациях проходит через следующие слои и накапливается. Поэтому конфигурация с компактными весами и более точными активациями часто лучше равномерно низкой разрядности.
Отдельным источником ухудшения стали таблицы нелинейных функций. В нескольких крупных моделях главным узким местом оказался обратный квадратный корень внутри RMSNorm, который нормализует значения между слоями. Повышение точности только этой таблицы возвращало качество близко к исходной модели, тогда как расширять все таблицы не требовалось.
Разрыв в стоимости между плавающей точкой и целыми числами остаётся большим. Для одного блока Qwen2.5-14B вычисления с плавающей точкой заняли бы, по экстраполяции, 33,87 часа, а целочисленные проекции напрямую доказали за 95,46 секунды. Перенос оценки на все 48 блоков даёт около 67 дней только для проекций с плавающей точкой.
Но после перехода на целые числа дальнейшее сокращение разрядности перестаёт давать пропорциональную экономию. Уменьшение таблиц в 256 раз почти не изменило полное время: число обращений к ним осталось тем же, а основную стоимость создавали другие части доказательства. Значит, размер отдельной таблицы или число битов нельзя использовать как прямой показатель скорости всей системы.
Что менять в планах команд
Для прототипа ZK-LLM не стоит начинать с минимальной разрядности во всех слоях. Сначала нужно зафиксировать структуру доказательства и измерить вклад каждой группы операций: матричных умножений, пересчёта масштаба, проверок диапазона и нелинейных таблиц. Сокращать точность имеет смысл там, где это действительно уменьшает число ограничений или обращений.
На небольших моделях веса и активации по 16 бит дали почти ту же стоимость доказательства, что и более низкая точность, но лучше сохраняли качество. Повышать разрядность без проверки тоже нельзя: если произведения перестают помещаться в поле размером 31 бит, каждое значение приходится разбивать на несколько элементов, и стоимость растёт скачком.
Практическая конфигурация получается неоднородной: веса получают одну точность, активации — другую, а чувствительные функции вроде обратного квадратного корня — собственные таблицы. Такой подход сложнее единого режима квантизации, зато связывает каждое изменение с измеримым эффектом на качество и время построения доказательства.
Работа меняет прежде всего порядок разработки. Обычный профиль квантизации нельзя перенести в ZK-контур как готовую оптимизацию: сначала требуется реализация арифметической схемы, затем замеры по операторам и только после этого выбор разрядности. Для крупных моделей результаты пока задают принципы проектирования, а не подтверждают доступность полного доказательства в промышленном масштабе.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



