Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Нейросети научились во время обучения сосредотачивать полезный сигнал в меньшем числе направлений, чтобы затем лучше сжимать веса. На крупнейшей LLaMA при допустимом росте функции потерь на 4% метод дал сжатие в 1,89 раза против 1,14 раза у обычного затухания весов. Препринт Dmitrii Andriianov, Andrey Veprikov и Aleksandr Beznosikov не прошёл рецензирование, а числа получили сами авторы; метод имеет смысл закладывать в предобучение, а не оставлять на короткую доработку готовой модели.
Малые сингулярные значения уменьшаются быстрее
Обычное затухание весов равномерно умножает всю матрицу на коэффициент меньше единицы. Большие и малые сингулярные значения — величины, которые показывают силу независимых направлений в матрице, — сокращаются в одинаковой пропорции. Поэтому регуляризация ограничивает общий размер весов, но напрямую не подталкивает матрицу к низкому рангу.
Спектральное затухание весов (spectral weight decay) действует иначе. После обычного шага оптимизатора оно вычитает одинаковую величину из сингулярных значений. Для слабых направлений такая поправка относительно сильнее, поэтому спектр концентрируется, а часть направлений приближается к нулю.
В основе метода лежит ядерная норма — сумма сингулярных значений матрицы. Её используют как управляемую замену прямому ограничению ранга: заранее выбирать жёсткий ранг не требуется, а коэффициент регуляризации задаёт силу сжатия спектра.
Поправку применяют после шага по функции потерь. Это важно: она использует направления уже обновлённой матрицы, тогда как вариант до шага опирался бы на прежние направления. Возле матриц с почти исчезнувшими направлениями порядок операций влияет на результат сильнее, чем при обычном затухании весов.
Полное сингулярное разложение на каждом шаге сделало бы обучение дорогим. Вместо него поправку приближают итерациями Newton–Schulz, как в оптимизаторе Muon. При этом веса остаются плотными на всём протяжении обучения: метод не экономит память предобучения, а готовит модель к последующему разложению на компактные множители.
Низкий эффективный ранг превращается в сжатие
Для оценки структуры использовали эффективный ранг. Он учитывает не только число ненулевых направлений, но и то, насколько равномерно между ними распределён спектр. Чем сильнее вес сосредоточен в нескольких направлениях, тем ниже эффективный ранг и тем больше частей матрицы можно отбросить при SVD-сжатии.
После обучения каждую матрицу сжимали до её собственного эффективного ранга с помощью SVD-LLM. Встраивания токенов и выходной слой оставляли плотными: их спектр почти не реагировал на новую регуляризацию, а сокращение ранга заметно ухудшало качество.
На сжатой модели ускорение прямого прохода достигло 1,18 раза. Выигрыш оказался меньше сокращения числа параметров, потому что факторизованный слой запускает дополнительные матричные операции и хранит промежуточный результат.
Тот же сдвиг к низкому рангу ограничивал запоминание испорченной разметки. При 60% случайно заменённых меток итоговая точность на чистом тесте выросла относительно сопоставимой регуляризации на 17,8 процентного пункта для MNIST и до 4,6 пункта для задач BERT-base.
Проверка охватила три масштаба LLaMA до 500 млн параметров, обученных на FineWeb-Edu оптимизаторами семейства Adam. Сжатие оценивали по функции потерь на проверочной выборке, а устойчивость к шуму — отдельно на MNIST и текстовых классификаторах BERT-base. Это связывает низкий ранг с двумя практическими эффектами, но не показывает, как метод поведёт себя на более крупных генеративных моделях.
Метод меняет план предобучения, но не заменяет доработку инфраструктуры
Для новой модели спектральную регуляризацию стоит рассматривать до запуска предобучения. Она сохраняет обычное плотное представление весов, не требует заранее назначать ранг слоям и оставляет решение о степени сжатия до этапа подготовки модели к эксплуатации.
Для готового контрольного пункта вывод слабее. Короткая доработка со спектральным затуханием давала большую потерю качества при том же ранге, чем применение метода с начала предобучения. Поэтому заменить стандартное затухание весов перед самым выпуском и получить сопоставимый эффект не получится по показанному рецепту.
Коэффициент придётся настраивать вместе с оптимизатором. Adam и Lion показали приемлемый обмен качества на ранг, а у Muon функция потерь росла быстрее по мере концентрации спектра. Механическая замена обычной регуляризации без нового поиска параметров обучения не следует из результатов.
Ускорение также зависит от режима эксплуатации. Замеры проводили на одном GPU с пакетом 256, а на малых пакетах факторизованные модели не обгоняли плотные. Для интерактивного API с короткими запросами работа пока не даёт основания закладывать заявленный прирост в расчёт задержки; для пакетной обработки она предлагает проверяемый путь от рецепта обучения к меньшей модели.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



