Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Полный цикл обучения LLM с подкреплением в FP8 удалось избавить от срывов, при которых в середине обучения растёт энтропия и модель начинает выдавать испорченный текст. В нерецензированном препринте Fanchao Chen и соавторов, где все числа получили сами авторы, Calibrated Clipping вернул моделям от 8 до 32 млрд параметров качество на уровне BF16. Для команд, которые переводят весь цикл в низкую точность, проблема смещается с расхождения между обучением и выводом на сами правила обновления модели.
FP8 искажает оценку обновления, а не только вычисления
FP8 хранит числа с плавающей точкой в восьми битах и за счёт меньшей точности может ускорять обучение. BF16 использует шестнадцать бит и служит более точной базовой линией. Цена перехода на FP8 — шум квантования: округление немного меняет значения на каждом этапе вычислений.
В полном цикле эти отклонения складываются. Прежние подходы, включая TIS, в основном исправляли расхождение между распределением, на котором модель сгенерировала ответ, и распределением, по которому её затем обучают. Такой коррекции оказалось недостаточно, потому что FP8 нарушает ещё один элемент алгоритма — отношение важности.
Отношение важности показывает, насколько вероятность токена при текущей версии модели отличается от вероятности при версии, которая создала обучающий пример. Алгоритм использует это отношение, чтобы определить допустимый размер обновления и не дать модели измениться слишком резко.
Шум FP8 искажает отношение важности несимметрично. Особенно часто за допустимую область выходят токены с отрицательным преимуществом — те, которые получили оценку хуже ожидаемой и должны стать менее вероятными. После выхода за границу их градиенты ошибочно обнуляются.
Из-за этого обучение перестаёт наказывать неудачные фрагменты ответа. Они накапливаются, распределение вероятностей становится менее определённым, энтропия резко растёт, а в ответах появляется бессвязный текст. Сбой проявляется не сразу, поэтому стабильное начало запуска ещё не подтверждает, что весь цикл настроен правильно.
Calibrated Clipping сверяет границы с BF16
Calibrated Clipping динамически меняет границы, за которыми алгоритм ограничивает обновление. Метод берёт распределение значений из более точного обучения в BF16 как ориентир и настраивает нижнюю границу FP8 так, чтобы под неё попадала та же доля значений. Затем он соответственно уравновешивает верхнюю границу.
Это отличается от фиксированного расширения допустимой области. Метод не предполагает, что шум одинаково влияет на положительные и отрицательные обновления, а отдельно восстанавливает поведение нижней границы, где FP8 чаще теряет штрафующие градиенты. Так сохраняется механизм, который уменьшает вероятность плохих токенов.
Подход проверили с алгоритмами GRPO и DAPO, на моделях разного масштаба и при нескольких вариантах детализации масштабирования FP8. Во всех описанных сериях Calibrated Clipping устранил всплески энтропии и восстановил результат, сопоставимый с BF16.
Работа охватывает модели указанного диапазона и два алгоритма обучения с подкреплением. Поскольку этот материал подготовлен по абстракту, точную процедуру экспериментов и численный выигрыш в скорости из него восстановить нельзя; результат подтверждает устойчивость, но пока не даёт основания пересчитывать бюджет обучения.
Командам стоит проверять градиенты до перехода всего цикла на FP8
Работа не меняет общий мотив использовать FP8: меньшая точность по-прежнему рассматривается как способ ускорить обучение. Она меняет критерий готовности. Исправить расхождение между генерацией и обучением недостаточно, если квантование продолжает выталкивать штрафуемые токены за допустимые границы.
При проектировании такого контура полезно отделить две проверки. Первая показывает, совпадают ли вероятности на этапах генерации и обновления. Вторая сравнивает, какая доля отрицательных обновлений обрезается в FP8 и BF16. Именно вторая проверка обнаруживает механизм сбоя, описанный в работе.
Практический контрольный сигнал — динамика энтропии по ходу обучения. Резкий рост в середине запуска вместе с ухудшением связности ответов указывает не просто на общую нестабильность, а на накопление примеров, которые модель должна была штрафовать. Сравнение с коротким запуском в BF16 помогает увидеть, расходятся ли распределения у границ ограничения.
Calibrated Clipping выглядит как локальное изменение алгоритма, но его эффект относится ко всему контуру: FP8 можно сохранять на всех этапах, не возвращая обучение целиком к BF16. Переносить результат в производственный план стоит после воспроизведения на собственных моделях и задачах, поскольку абстракт подтверждает качество и стабильность, но не оценивает экономию времени или вычислений.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



