Журнал · Rit.work

Почему FP4 не ускоряет FlashAttention-4 автоматически

Robert Hu показал, как сократить задержку между матричными операциями внимания на NVIDIA Blackwell и почему для обучения пока приходится сохранять FP8.

Rit.work
Студия разработки
4 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Robert Hu переработал вычисление механизма внимания для 4-битных чисел с плавающей точкой FP4 в препринте, который не проходил рецензирования. По замерам автора, новый путь достигает до 2,13 пропускной способности варианта на BF16 при прямом проходе на NVIDIA GB200. Работа важна разработчикам собственных ядер инференса и обучения для Blackwell: простая замена формата не даёт такого ускорения.

Что сделали

В механизме внимания два матричных умножения разделены нормализацией оценок в вероятности. Тензорные ядра Blackwell быстрее выполняют умножения в FP4, но не ускоряют вычисление экспонент, сокращение строк, упаковку вероятностей и передачу масштабов. После ускорения матричных операций именно этот промежуточный этап оказывается на критическом пути.

Метод Direct-P преобразует оценки сразу в коды MXFP4, которые потребляет второе матричное умножение, не создавая промежуточные вероятности высокой точности. Нормализатор рассчитывается по тем же округлённым значениям. Внешнее расписание FlashAttention-4 сохраняется, а упакованные вероятности занимают освобождённую память оценок.

Для причинного обучения, где позиция видит только предыдущие токены, прямой проход передаёт обратному квантованные запросы и ключи, их масштабы и нормализатор. По замерам автора, полный шаг обновления модели на 8 млрд параметров ускорился до 1,14 раза. При этом в распределённом обучении вероятности и значения пришлось оставить в FP8: все проверенные варианты с MXFP4 для них расходились.

Что это значит

Работа показывает, что производительность низкоточного внимания определяется не только скоростью тензорных ядер. Существенны зависимости между операциями и владение тензорной памятью: пока вероятности занимают прежний участок, следующее умножение не может записать туда оценки. Поэтому перенос Direct-P в другой стек потребует воспроизвести расписание и размещение данных, а не только формат квантования.

Ограничения. Direct-P для непричинного режима проверяли на фиксированных входах, а не в предобучении или дообучении. Сопоставленное распределённое обучение охватывает 100 млрд токенов, но для каждого маршрута выполнена одна траектория, поэтому разброс между запусками не измерен. Аппаратные выводы относятся к GB200, B300 и преимущественно размерности головы 128. Сопоставимого контроля качества с BF16 автор не провёл: использованные рецепты обучения различались.

Источники

Иллюстрация: рисунок из статьи «Hardware-Aware FP4 FlashAttention-4», Robert Hu, CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу