Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Robert Hu, Carlo Luschi и Paul Balanca предложили схему предобучения языковых моделей в FP4 с блочными масштабами UE5M3; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, итоговая валидационная функция потерь оказалась ниже, чем у схемы Transformer Engine NVFP4. Результат важен разработчикам ускорителей и командам, которые планируют сократить вычислительные расходы на обучение LLM в низкой точности.
Что сделали
FP4 хранит число в четырёх битах, поэтому его формат E2M1 охватывает узкий диапазон величин. Чтобы не потерять малые значения и не обрезать крупные, авторы назначают отдельный масштаб каждому блоку из 16 элементов. Формат UE5M3 отдаёт все разряды масштаба под показатель степени и дробную часть, не расходуя бит на знак: масштаб всегда неотрицателен.
В схеме максимум всего тензора обновляется раз в 50 шагов, а между обновлениями используется сохранённое значение. Стохастическое округление применяется выборочно к градиентам обратного прохода. Авторы также исключили рандомизированное преобразование Адамара, которое перераспределяет выбросы перед квантованием, и перевели в FP4 все подходящие внутренние линейные слои вместо сохранения части слоёв в BF16.
Схему проверили на Nemotron-H 8B при обучении почти на 189 млрд токенов. Помимо меньшей валидационной функции потерь, авторы получили более высокие точечные оценки на всех трёх приведённых агрегатах заданий.
Что это значит
UE5M3 может убрать часть операций вокруг матричных умножений FP4 и упростить реализацию обучения. В отдельном испытании на NVIDIA GB200 совместное удаление преобразования Адамара и перевод оставшихся линейных слоёв из BF16 в FP4 повысили пропускную способность тела модели на 21,2%. Это ориентир для будущей аппаратной поддержки, а не измерение скорости самой UE5M3-схемы.
Ограничения. UE5M3 исполнялась через программную эмуляцию, поскольку проверенный авторами путь Transformer Engine поддерживал другой формат блочных масштабов. Обучение проводилось на одной архитектуре модели и по одной траектории для каждой конфигурации. Испытание производительности одновременно меняло два компонента схемы, поэтому не показывает вклад каждого из них и не сравнивает нативные реализации UE5M3 и NVFP4. Оценки на прикладных заданиях приведены как точечные результаты, без подтверждения статистической значимости различий.
Источники
Иллюстрация: рисунок из статьи «UE5M3 FP4 Block Scaling for Stable Language Model Pretraining», Robert Hu, Carlo Luschi, Paul Balanca, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



