Журнал · Rit.work

Fiona ускоряет FHE-инференс, подстраивая веса под упаковку

Fiona выборочно переводит группы весов в три значения и ускоряет зашифрованный инференс VGG11, ViT и BERT в 1,68–2,38 раза при потере точности менее 1%.

Rit.work
Студия разработки
30 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Зашифрованный инференс нейросетей удалось ускорить без существенной потери точности. В нерецензированном препринте, где все числа получили сами авторы, Fiona ускорила три модели в 1,68–2,38 раза при потере точности менее 1%. Метод можно применить поверх выбранной схемы упаковки, не проектируя под него отдельный формат вычислений.

Обычная тернаризация не учитывает устройство шифротекста

Полностью гомоморфное шифрование (FHE) позволяет серверу вычислять результат модели прямо над зашифрованными входными данными. Сервер не получает ключ расшифровки, а клиент расшифровывает только готовый ответ. Цена такой защиты — инференс работает на порядки медленнее обычного.

Значительную часть времени занимают умножения открытых весов модели на зашифрованные активации. Тернаризация заменяет каждый вес одним из трёх значений: −1, 0 или +1 с общим коэффициентом масштаба. Тогда умножение можно заменить вычитанием, пропуском или сложением.

Но FHE-системы обычно хранят в одном шифротексте сразу вектор значений и обрабатывают их параллельно. Одно умножение применяет целую группу весов, которую задаёт схема упаковки. Операцию удаётся убрать, только если все веса в группе приняли одно тернарное значение.

Поэтому обычная тернаризация отдельных весов почти не превращается в экономию на исполнении. В опыте с ResNet-8 чистыми оказались лишь 4,06% групп, а точность упала с 87,53% до 82,43%. При этом чистая группа действительно полезна: взвешенная сумма зашифрованных значений через сложения и вычитания выполнялась в 14,8 раза быстрее варианта с умножениями.

Fiona выбирает группы по влиянию на результат

Fiona работает до запуска сервиса. Оптимизатор получает модель, схему упаковки выбранной FHE-системы и полиномиальные замены нелинейных функций. Затем он оценивает, насколько перевод каждой группы весов в три значения увеличит ошибку модели.

Менее чувствительные группы Fiona обучает принимать одно общее тернарное значение. Чувствительные группы сохраняют исходные веса полной точности. Поэтому внутри одного слоя одновременно работают дешёвый путь со сложениями и обычный путь с умножениями.

Одного изменения весов недостаточно: гибридный слой ещё нужно скомпилировать без лишних операций. Fiona один раз применяет коэффициент масштаба к накопленной знаковой сумме, повторно использует одинаковые суммы для нескольких выходов и объединяет результаты двух путей. Вычисления остаются эквивалентны полученной гибридной модели, а сервер затем повторяет готовый план для каждого запроса.

Тернарные группы также сужают диапазоны значений, которые поступают в нелинейные функции. В FHE такие функции, как GELU, Softmax и нормализация, заменяют полиномами из сложений и умножений. На более узком диапазоне Fiona подбирает полином меньшей степени, снижает глубину последовательных умножений и реже обновляет шифротекст через дорогую процедуру бутстрэппинга.

Ускорение зависит от модели, но меняет архитектурный выбор

Fiona проверили на VGG11, ViT и BERT для классификации изображений и текста. Оптимизированные модели сравнивали с полноточными FHE-вариантами при тех же задачах и схемах упаковки. Число умножений открытого веса на шифротекст сократилось на 53,4–79,5%.

Полный инференс VGG11 ускорился в 2,38 раза, ViT — в 1,68 раза, BERT — в 1,84 раза. Потеря точности во всех трёх случаях осталась ниже 1%. Разброс показывает, что удаление одной категории операций не одинаково влияет на модели: итог зависит от доли линейных вычислений, полиномов и обновлений шифротекста.

Для команды, которая уже выбрала FHE и упаковку данных, работа предлагает новый этап подготовки модели: оптимизировать веса под фактические группы исполнения, а не квантизовать каждый вес отдельно. Это особенно уместно для сервиса с повторяющимся инференсом, потому что оптимизация проходит один раз, а удалённые операции экономят время на каждом запросе.

Метод не заменяет выбор FHE-схемы, упаковки или полиномиальной сети. Он принимает их как исходные условия и улучшает готовый план. Проверка охватывает одну свёрточную модель и два трансформера в задачах классификации; модель угроз предполагает сервер, который исполняет протокол правильно, но пытается узнать содержание данных, причём формы входов и маски заполнения остаются открытыми.

Практический вывод ограничен этим сценарием: если продукту уже нужен инференс над зашифрованными данными, структуру весов стоит включить в проектирование вычислительного контура. Если FHE ещё только рассматривают, результаты Fiona снижают ожидаемую задержку, но не устраняют базовый разрыв с обычным инференсом.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу