Журнал · Rit.work

Fed-GRPO распределяет обучение LLM по закрытым наборам данных

Fed-GRPO использует статистику наград, чтобы взвешивать обновления клиентов, направлять локальное обучение и сокращать трафик между участниками.

Rit.work
Студия разработки
9 октября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Fed-GRPO позволяет нескольким организациям совместно дообучать LLM рассуждать, не передавая друг другу исходные данные. На среднем результате по математическим тестам метод обошёл обычный FedAvg на 1,96 процентного пункта; работа пока не рецензирована, и все числа получили сами авторы. Для команд с разнесёнными закрытыми наборами это даёт конкретную схему обучения вместо простого усреднения локальных моделей.

Размер набора данных плохо показывает ценность обновления

Fed-GRPO объединяет федеративное обучение с GRPO — способом дообучать языковую модель через награды за сгенерированные ответы. Каждый участник хранит примеры у себя, локально обновляет модель и отправляет серверу только изменения параметров и сводную статистику.

Обычный FedAvg назначает участнику вес по размеру его набора или усредняет всех поровну. Для GRPO это слабый ориентир: крупный набор может состоять из уже освоенных задач и почти не менять модель, а небольшой набор сложных примеров — давать полезный градиент.

Авторы предлагают смотреть на разброс наград — стандартное отклонение, которое показывает, насколько различаются оценки ответов внутри локального обучения. Если модель выдаёт и удачные, и неудачные решения, сигнал для обучения сильнее. В диагностическом опыте разброс между участниками различался до четырёх раз в пределах одного раунда.

Второй сигнал — средняя награда. Она показывает, насколько хорошо модель справляется с задачами конкретного участника относительно остальных. Локальное GRPO такой общей картины не видит и может продолжать тратить вычисления на уже освоенные типы запросов.

Третий ориентир даёт сама структура обновлений: после локального обучения неизменными оставались более 96,2% параметров. При этом участники с большим разбросом наград меняли больше параметров, поэтому одинаково сжимать все обновления невыгодно.

Одна статистика управляет агрегацией, задачами и трафиком

Fed-GRPO использует разброс наград вместо размера набора при объединении моделей. Чем сильнее различаются локальные награды, тем больший вес получает обновление участника. Дополнительные вычисления для этого не нужны: GRPO уже считает ту же статистику, когда сравнивает ответы внутри группы.

Затем сервер собирает средние награды участников и возвращает им общую оценку. На следующем раунде клиент повышает вес запросов, где его результат отстаёт от общего уровня, и снижает вес запросов, с которыми уже справляется лучше. Вес ограничен сверху и снизу, чтобы отдельная группа задач не перехватила всё обучение.

Для передачи обновлений метод сначала отбрасывает неизменившиеся параметры, а при более жёстком бюджете выбирает модули модели по отношению полезности обновления к объёму данных. Участники с сильным сигналом получают больше пропускной способности, а слабые обновления сжимаются сильнее.

На основной серии математических тестов средний показатель Fed-GRPO достиг 39,06 против 40,21 у централизованного обучения. Передача только изменившихся параметров дала сжатие в 32 раза по их количеству, но реальный объём исходящего трафика уменьшился в 11 раз: вместе со значениями приходится отправлять индексы. Это различие важно для расчёта сети — коэффициент по параметрам сам по себе завышает практическую экономию.

Когда авторы дополнительно отбрасывали часть изменений, метод позволял обменивать качество на трафик постепенно. Такой режим уже нельзя считать сжатием без потерь: он подходит лишь там, где сетевой бюджет важнее максимального результата.

Менять архитектуру стоит только при разделённых закрытых данных

Работа относится к дообучению общей модели на нескольких площадках, а не к распределённому предобучению или запуску модели. Она полезна, если больницы, финансовые организации или команды разработки имеют совместимую задачу и единый способ автоматически оценивать ответы, но не могут собрать примеры в одном хранилище.

В существующем контуре FedAvg можно отдельно проверить три изменения: заменить вес по объёму данных на вес по разбросу наград, вернуть клиентам общую статистику и передавать разреженные обновления. Механизмы дополняют друг друга, но не требуют одновременно менять модель или функцию награды.

Основные замеры провели на Qwen2.5-3B-Instruct с неодинаково распределёнными математическими задачами и проверили на пяти тестах. Дополнительные опыты охватили Qwen3-4B-Instruct и задачи по коду, поэтому результат показывает перенос между двумя близкими моделями и двумя типами рассуждений, а не универсальность для любых LLM.

Схема не пересылает исходные примеры, однако это не равнозначно доказанной конфиденциальности: работа сравнивает качество и сетевой трафик, а не риск восстановить данные из обновлений. Если проекту нужна формальная защита, Fed-GRPO следует рассматривать как способ координации обучения, а не как готовый контур безопасности.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу