Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Адаптацию LLM научились вести на распределённых потребительских GPU через обычные интернет-каналы, не заставляя основной поток ждать полного обмена данными. Работа Pluralis Research показала более чем 40-кратный прирост пропускной способности на канале около 200 Мбит/с при качестве обычного обучения без сжатия, однако препринт не рецензирован, а все числа получили сами авторы. Схема делает географически распределённый пул видеокарт практичнее для дообучения, но не доказывает, что так же можно обучить модель с нуля.
Быстрый контур считает, медленный задаёт направление
При распределённом обучении сеть загружают два вида обмена. При параллелизме по данным несколько копий модели синхронизируют градиенты весов. При конвейерном параллелизме модель делят по слоям, а соседние GPU пересылают промежуточные значения слоёв — активации — и их градиенты.
В предложенной системе основную работу выполняет быстрый контур. Он случайно отбрасывает 95% элементов активаций на границах между частями модели, а обмен градиентами между копиями модели сжимает через сочетание PowerSGD и Streaming DiLoCo.
Отправитель и получатель независимо создают одну и ту же маску с помощью общей псевдослучайной функции. Поэтому вместе с сохранёнными значениями не приходится передавать их позиции. Поскольку маску применяют внутри вычислительного графа, прямой и обратный проход используют одинаковый рисунок разреженности.
Случайная маска принципиальна для метода. Она добавляет шум без постоянного смещения в одну сторону, тогда как выбор только крупнейших элементов создаёт систематическую ошибку, которую последующий фильтр не может убрать.
Параллельно работает якорный контур. Он периодически получает снимок весов, выполняет полный прямой и обратный проход без маски и возвращает чистый градиент. Основной контур его не ждёт: в экспериментах такой ориентир отставал примерно на 20–25 шагов.
Использовать запоздавший градиент как готовое обновление нельзя, но он всё ещё показывает устойчивые направления изменения весов. Система усредняет якорные градиенты и раскладывает их на направления по силе сигнала. Затем она ослабляет части текущего зашумлённого градиента, которые якорный контур подтверждает слабо, и смешивает результат с исходным обновлением.
Так полные проходы не попадают в критический путь. Они задают геометрию оптимизации, а скорость шага определяет только сжатый обмен быстрого контура.
Сжатие не разрушило длинную траекторию обучения
Сжатие обмена между участками конвейера само по себе ускорило обучение до 9 раз. Когда к нему добавили сжатие синхронизации между копиями модели, узким местом перестала быть передача как активаций, так и градиентов.
Самая содержательная проверка — не отдельное короткое дообучение, а многоэтапный сценарий для Llama-3.2-1B. Модель прошла обучение рассуждениям и два этапа дообучения на инструкциях, обработав около 60 млрд токенов. Система работала в 43 раза быстрее плотного варианта; итоговый результат отстал от него на 0,05 балла в IFEval и на 0,02 балла в GSM8K.
На медицинских задачах, генерации кода и математике метод также совпал с плотным обучением или обошёл его. Конкурирующие способы агрессивно сжимать активации чаще теряли качество, особенно в генеративных задачах. Отдельные проверки на разных конфигурациях вычислительной сетки показали, что результат не привязан к одной топологии.
Менять планы стоит только при сетевом узком месте
Схема касается команд, у которых модель не помещается на одной видеокарте, а GPU связаны каналами уровня обычного интернета. В такой архитектуре недостаточно сократить число обучаемых параметров: LoRA уменьшает память под веса и состояние оптимизатора, но слои по-прежнему передают полные активации. Якорное сжатие решает другую задачу и может работать вместе с LoRA.
В план вычислительной сетки придётся заложить отдельную реплику для якорного контура, асинхронную доставку снимков весов и дополнительное состояние оптимизатора. Это не транспортный кодек, который можно поставить между существующими узлами без изменений в обучении: маска входит в вычислительный граф, а оптимизатор должен применять спектральную коррекцию.
Эксперименты охватывают модели от 1 до 8 млрд параметров, предметное дообучение, обучение рассуждениям и продолжение предобучения готовой модели. Именно в такой фазе градиенты меняются достаточно медленно, чтобы запоздавший ориентир оставался полезным. Для первоначального предобучения, плотного серверного кластера или более крупных моделей эта работа пока не даёт основания пересматривать архитектуру.
Практический вывод узкий: если бюджет уже упирается в передачу данных между удалёнными GPU, два асинхронных контура стоит проверить вместо попытки ещё сильнее сжать каждый отдельный пакет. Если ограничение связано с памятью, скоростью самих GPU или доступом к данным, метод его не снимает.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



