Журнал · Rit.work

Локальные симметрии нейросетей предлагают использовать для сжатия моделей

Авторы связывают локальные симметрии нейросетей со сжатием до 17% исходного размера и восстановлением способности последовательно осваивать задачи.

Rit.work
Студия разработки
3 сентября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Osvaldo M Velarde, Lucas C Parra, Alireza Hashemi и Hernan A Makse предложили описывать обученные нейросети через локальные симметрии графа; работа опубликована как препринт, не проходивший рецензирования. По замерам авторов, такое представление позволило сократить модель до 17% исходного размера без ухудшения качества. Результат важен командам, которые оптимизируют собственные модели для исполнения на ограниченном оборудовании или последовательно обучают их новым задачам.

Что сделали

Авторы рассматривают нейросеть как ориентированный граф: узлы соответствуют нейронам или компонентам архитектуры, а рёбра — связям с весами. Они ищут группы узлов с одинаковым локальным устройством входящих и исходящих связей.

Основное понятие работы — фибрация. Узлы относятся к одной группе, если их деревья входящих связей изоморфны, то есть имеют одинаковую структуру и эквивалентные суммы весов. Такие узлы одинаково реагируют на входные данные. Для исходящих связей вводится обратное понятие — опфибрация: объединённые ею узлы получают одинаковые сигналы ошибки при обратном распространении.

Пересечение этих двух групп авторы называют покрытием. Если узлы имеют эквивалентные входящие и исходящие связи, обновления соответствующих весов синхронизируются. В работе доказывается, что при градиентном спуске уже возникшее покрытие сохраняется: отдельные группы могут объединяться, но объединённые узлы больше не разделяются. Из этого авторы делают вывод, что такие симметрии выступают устойчивыми состояниями стохастического градиентного спуска.

Для поиска приближённых симметрий используется алгоритм сбалансированной раскраски. Он присваивает одинаковый цвет узлам с эквивалентным окружением. Затем узлы одного цвета объединяются, а их веса пересчитываются по предложенному правилу. Для точной фибрации авторы доказывают сохранение прямого вычисления и функции потерь; для приближённой результат зависит от выбранного допуска и данных.

Вторая часть метода предназначена для последовательного обучения задачам. Сеть сначала сжимается до основы, сохраняющей уже освоенное поведение, после чего избыточные веса обнуляются или инициализируются заново. Эти освобождённые степени свободы используются для следующей задачи.

Что показали

По утверждению авторов, локальные симметрии возникают в многослойных перцептронах, свёрточных и рекуррентных сетях, а также в трансформерах. В экспериментах рассмотрены классификация MNIST и ImageNet, обучение LSTM с подкреплением в Atari Beam Rider и задачи последовательного обучения.

Главный прикладной результат — сокращение сети до 17% исходного размера без измеримого ухудшения качества в проведённом авторами эксперименте. Это не обычное удаление отдельных малых весов: метод объединяет структурно эквивалентные узлы и строит меньший граф, который воспроизводит вычисление исходной сети.

Авторы также сообщают, что управляемое разрушение симметрии превзошло рассмотренные методы последовательного обучения. Предлагаемое объяснение состоит в том, что по мере обучения веса синхронизируются, число независимых состояний уменьшается и сеть теряет пластичность — способность осваивать новую задачу. Повторная инициализация избыточной части возвращает свободные параметры, не затрагивая сжатую основу прежней задачи.

Для LSTM в Beam Rider авторы наблюдали важное исключение: приближённые покрытия сначала укрупнялись, а затем разрушались при дальнейшем обучении. В работе это связывается с механизмами исследования среды в обучении с подкреплением. Следовательно, образование симметрий не является одинаково необратимым во всех практических режимах.

Ограничения

Гарантия сохранения вычисления относится к точным фибрациям. В реальных сетях авторы ищут приближённые группы по порогу, поэтому сохранение функции становится приблизительным и зависит не только от структуры модели, но и от данных. Из единственного показателя сжатия нельзя заключить, что та же доля достижима для любой архитектуры, задачи или выбранного допуска.

Эксперименты охватывают разные типы сетей, но работа не показывает применение метода к современной крупной языковой модели в производственном масштабе. Для трансформеров описаны симметрии матриц запросов, ключей и значений, однако в доступном изложении нет замеров задержки, потребления памяти на GPU и стоимости преобразования модели. Поэтому сокращение числа узлов или параметров пока нельзя напрямую приравнять к такому же сокращению стоимости исполнения.

Сравнение с низкоранговым разложением матриц дано преимущественно на уровне совместимости методов и теоретических различий. Авторы отмечают, что разложение можно сочетать с фибрационным сжатием, но эффективность первого при этом может снизиться. Единого сравнительного эксперимента, который позволил бы выбрать между фибрациями, низкоранговым разложением и удалением весов для конкретного производственного ограничения, работа не даёт.

Что это значит

Для команд, уже строящих продукт на готовой модели через API, работа планов не меняет: предложенный подход требует доступа к весам, графу вычислений и процедуре преобразования модели. Он также пока не даёт оснований заранее закладывать конкретное снижение расходов на инфраструктуру.

Для разработчиков собственных моделей результат оправдывает отдельный исследовательский прототип. Метод интересен там, где модель обучается с избыточной шириной, а затем должна исполняться на ограниченном оборудовании. Практическая проверка должна измерять не только число параметров, но и задержку, память, качество после сжатия и стоимость поиска симметрий.

В системах последовательного обучения идея потенциально меняет архитектурный подход: вместо постоянного расширения сети можно сохранять освоенную функцию в сжатой основе и повторно использовать освободившиеся параметры. Но заявленное превосходство пока следует воспринимать как результат авторских экспериментов, а не как готовую замену существующим методам. Разумный план — не менять основной стек, а проверить метод на собственной архитектуре и последовательности задач.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу