Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Быстрое умножение матриц низкой точности научились проверять так, чтобы будущие токены не меняли уже рассчитанные вероятности. В препринте команды китайских исследовательских организаций, который не проходил рецензирование и приводит замеры самих авторов, две реализации FP8 меняли выбранный ответ на 5,83% и 10% заданий, хотя метрика точности не выявляла эту зависимость. Сертификат позволяет сохранить часть вычислительной экономии и гарантировать поведение построчного int8-оператора.
Быстрые алгоритмы складывают блоки матриц, перемножают суммы, а затем сокращают лишние слагаемые. В линейных слоях LLM строки матрицы соответствуют позициям токенов. При округлении промежуточных сумм вклад поздней строки может не сократиться полностью и попасть в ранний результат ещё до механизма внимания. Так нарушается неизменность по префиксу (prefix invariance): вероятность в позиции должна зависеть только от предшествующего текста.
Авторы квантуют каждую строку активаций отдельно в целочисленные коды. Реализация Strassen смешивает эти коды и точно сокращает лишние части до применения масштабов. Сертификат проверяет границы целых значений и порядок вычислений, поэтому результат совпадает бит в бит с классическим построчным int8-умножением при тех же правилах квантования.
Основной тест провели на Qwen2.5-14B-Instruct и первых 240 заданиях OpenBookQA. Текст после разрешённого префикса заменяли продолжением, которое построила bf16-модель, а исходный ответ продолжали оценивать. Реализации с перемешиванием строк меняли результат, тогда как bf16 и применяемое на практике построчное FP8-умножение не меняли ни одного ответа. Дополнительные проверки охватили ARC-Easy, WikiText-2, несколько семейств моделей и совместную обработку независимых запросов.
Сертифицированный двухуровневый Strassen требует примерно на 23% меньше перемножений блоков, чем классический алгоритм. Но вычислительная экономия пока не стала ускорением: двухуровневое ядро на Triton работало в 27,9 раза медленнее классического int8 на NVIDIA H20. Для продуктовой разработки результат отделяет корректность от оптимизации: зависимость от будущего текста можно исключить формально, но производительное ядро ещё предстоит построить.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



