Журнал · Rit.work

Почему Muon может уступить SGD с импульсом в конце обучения

Ортогонализация Muon рядом с оптимумом добавляет дисперсию, тогда как SGD с импульсом сохраняет ту же среднюю динамику без этого шумового остатка.

Rit.work
Студия разработки
30 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Ортогонализация в Muon возле минимума может добавлять шум, не меняя среднюю скорость движения к оптимуму. В нерецензированном препринте Xiaohui Xie из UC Irvine, где числа получены самим автором, на замороженных градиентах трансформера нелинейная часть обновления добавляла 13–14% накопленной дисперсии при Nesterov с коэффициентом 0,95. Результат поддерживает позднее переключение с Muon на SGD с импульсом, но пока не даёт готового правила для такого переключения.

Muon берёт матрицу накопленного градиента и заменяет её ортогональным полярным множителем: сохраняет направления, а все ненулевые сингулярные значения делает равными единице. Когда полезный градиент мал по сравнению с шумом мини-пакетов, преобразование начинает усиливать не только сигнал, но и случайные колебания.

В гауссовской модели среднее обновление Muon рядом с оптимумом становится обычным шагом по градиенту, только с другим масштабом. Поэтому SGD можно подобрать такой размер шага, чтобы оба метода одинаково реагировали на изменение среднего градиента. После этого у Muon остаётся нелинейная случайная часть: она не коррелирует с входным шумом, но увеличивает дисперсию обновлений.

При нулевом полезном сигнале один шаг Muon добавляет квадратным матрицам 40–57% дисперсии относительно такого согласованного SGD. Экспоненциальное усреднение с коэффициентом 0,95 сокращает накопленный избыток примерно до 8–9%, но не устраняет его. В нелинейных опытах на квадратичной функции стационарная ошибка Muon оставалась на 4–13% выше во всём проверенном диапазоне устойчивых размеров шага.

Расчёты проверяли на изотропном гауссовском шуме, плотных квадратичных функциях и сохранённых градиентах шестислойного символьного трансформера, обученного на Tiny Shakespeare. Отдельно воспроизвели Nesterov и пятишаговое приближение Newton–Schulz из практической реализации Muon. Полные запуски обучения с переключением оптимизатора в работу не входили.

Практический вывод ограничен поздней стадией, когда шум уже преобладает над средним градиентом. Перед переключением потребуется определить этот момент и подобрать размер шага SGD так, чтобы сохранить локальную динамику Muon; сама работа способ такого выбора не проверяет.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу