Журнал · Rit.work

LOOM увеличивает глубину MoE без копирования экспертов

LOOM стабилизирует циклические MoE и меняет маршрутизацию так, чтобы дополнительные проходы через общие слои приносили пользу при сопоставимом числе операций.

Rit.work
Студия разработки
2 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Число циклов в разреженной MoE-модели удалось поднять выше привычной пары без распада обучения. В препринте, который не прошёл экспертного рецензирования и где все числа получили сами авторы, при сопоставимом числе операций лучший вариант использовал пять циклов вместо одного. Для команд, обучающих собственные MoE, циклическая глубина становится ещё одной осью масштабирования, но не способом получить качество без дополнительных вычислений.

Почему дополнительные циклы переставали работать

Циклическая модель несколько раз пропускает состояние токена через один и тот же набор Transformer-блоков. Её эффективная глубина растёт, хотя параметры внимания и экспертов не копируются. Каждый новый проход при этом требует вычислений, поэтому он полезен лишь тогда, когда уточняет представление токена.

В обычной циклической MoE этому мешают два эффекта. Сначала накапливаются остаточные обновления: каждый блок добавляет свой результат к текущему состоянию, разброс значений растёт, а представление постепенно уходит от исходного входа. Чем дольше повторяется общий блок, тем труднее модели сохранять устойчивый сигнал.

Одновременно маршрутизатор продолжает отправлять токены примерно к тем же экспертам. MoE экономит вычисления за счёт того, что активирует для токена только часть экспертных блоков, но повторный выбор прежней комбинации почти не добавляет вычислительного разнообразия. Модель тратит операции на новый проход, который воспроизводит предыдущий.

Эти проблемы связаны: устойчивое, но одинаковое вычисление быстро упирается в потолок, а разнообразное вычисление бесполезно, если состояние модели расползается. Поэтому отдельное масштабирование остатка или повторная подача входа улучшали обучение, но сами по себе не поддерживали глубокие циклы.

Как LOOM удерживает состояние и меняет экспертов

LOOM уменьшает вклад каждого остаточного обновления обратно пропорционально числу циклов и физической глубине общего блока. При добавлении проходов отдельное обновление становится слабее, поэтому их сумма не разгоняет разброс скрытого состояния. Путь, по которому состояние проходит без изменений, остаётся нетронутым.

В начале каждого следующего цикла модель также подмешивает исходное представление токена. Вес этой добавки постепенно уменьшается: ранние проходы сильнее держатся за вход, а поздние больше используют уже накопленный результат. Так LOOM ограничивает дрейф, не сбрасывая промежуточные вычисления.

Для разнообразия каждый цикл получает собственный маршрутизатор, но использует общие веса экспертов. Последовательные проходы могут выбирать разные комбинации экспертов, хотя основная масса параметров остаётся общей. Число параметров маршрутизаторов при этом растёт вместе с глубиной цикла, поэтому архитектура не остаётся строго неизменной.

Результаты ранних проходов сохраняет циклическая остаточная память. Она ведёт экспоненциальное скользящее среднее для вычислений внутри текущего цикла и для всей последовательности циклов. Поздний проход получает сжатую историю предыдущих состояний, а обучение не требует хранить каждый такой результат отдельно.

Обратное распространение ошибки авторы ограничили сегментами длиной до трёх циклов. Состояние передаётся дальше, но градиент между сегментами отсекается. Это сокращает граф вычислений и позволяет наращивать циклическую глубину без соответствующего роста памяти для всех промежуточных активаций.

Проверки охватили модели от 100 млн до 1,7 млрд параметров, обученные на FineWeb-Edu максимум на 60 млрд токенов. Сравнивали LOOM с нециклической моделью и вариантами, где к обычным циклам добавляли только масштабирование остатка либо только повторную подачу входа. Поэтому работа показывает поведение конкретной архитектуры и схемы обучения, а не всех возможных MoE.

LOOM добавляет ось масштабирования, но не отменяет бюджет вычислений

При близком числе операций лучший вариант использовал 5 циклов. Перплексия — мера того, насколько уверенно модель предсказывает следующий токен, где меньше означает лучше, — снизилась с 18,36 до 16,54 относительно нециклической модели. Средняя точность без примеров в запросе выросла с 38,84% до 39,53%.

Разрыв в точности невелик, тогда как снижение перплексии заметнее. Это не основание заменять обычное увеличение модели циклическими блоками во всех проектах. Результат скорее подтверждает, что общий набор экспертов можно использовать повторно, если архитектура одновременно контролирует состояние и обновляет маршрутизацию.

Работа меняет планы команд, которые обучают собственную MoE и ограничены числом параметров сильнее, чем объёмом вычислений. Для них имеет смысл добавить эксперимент с циклической глубиной: общие эксперты сокращают необходимость копировать крупные блоки, а отдельные маршрутизаторы позволяют каждому проходу делать отличающуюся работу.

Для систем с жёсткими требованиями к задержке вывод осторожнее. Каждый цикл добавляет последовательный этап вычислений, который нельзя считать бесплатным только потому, что веса общие. Практический выбор потребует сравнить циклы с более широкой или глубокой базовой моделью при одинаковом бюджете обучения и выдачи ответа.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу