Журнал · Rit.work

Сертификат защищает LLM от влияния будущих токенов

Сертифицированная реализация Strassen повторяет построчное int8-умножение бит в бит и не позволяет будущим токенам менять уже рассчитанные вероятности.

Rit.work
Студия разработки
1 октября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Быстрое умножение матриц низкой точности научились проверять так, чтобы будущие токены не меняли уже рассчитанные вероятности. В препринте команды китайских исследовательских организаций, который не проходил рецензирование и приводит замеры самих авторов, две реализации FP8 меняли выбранный ответ на 5,83% и 10% заданий, хотя метрика точности не выявляла эту зависимость. Сертификат позволяет сохранить часть вычислительной экономии и гарантировать поведение построчного int8-оператора.

Быстрые алгоритмы складывают блоки матриц, перемножают суммы, а затем сокращают лишние слагаемые. В линейных слоях LLM строки матрицы соответствуют позициям токенов. При округлении промежуточных сумм вклад поздней строки может не сократиться полностью и попасть в ранний результат ещё до механизма внимания. Так нарушается неизменность по префиксу (prefix invariance): вероятность в позиции должна зависеть только от предшествующего текста.

Авторы квантуют каждую строку активаций отдельно в целочисленные коды. Реализация Strassen смешивает эти коды и точно сокращает лишние части до применения масштабов. Сертификат проверяет границы целых значений и порядок вычислений, поэтому результат совпадает бит в бит с классическим построчным int8-умножением при тех же правилах квантования.

Основной тест провели на Qwen2.5-14B-Instruct и первых 240 заданиях OpenBookQA. Текст после разрешённого префикса заменяли продолжением, которое построила bf16-модель, а исходный ответ продолжали оценивать. Реализации с перемешиванием строк меняли результат, тогда как bf16 и применяемое на практике построчное FP8-умножение не меняли ни одного ответа. Дополнительные проверки охватили ARC-Easy, WikiText-2, несколько семейств моделей и совместную обработку независимых запросов.

Сертифицированный двухуровневый Strassen требует примерно на 23% меньше перемножений блоков, чем классический алгоритм. Но вычислительная экономия пока не стала ускорением: двухуровневое ядро на Triton работало в 27,9 раза медленнее классического int8 на NVIDIA H20. Для продуктовой разработки результат отделяет корректность от оптимизации: зависимость от будущего текста можно исключить формально, но производительное ядро ещё предстоит построить.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу