Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Региональные версии модели поиска можно персонализировать, не меняя внутреннее устройство трансформера. Хотя работа Walmart Global Tech не прошла рецензирование и все числа получили сами авторы, RegionFed сравнялся по точности с централизованной верхней границей. Для команд это альтернатива методам, которые приходится адаптировать под устройство конкретной модели.
Конфликт градиентов заменяет правку параметров
Обычное федеративное обучение объединяет обновления клиентов в одну глобальную модель. Когда данные различаются по регионам, усреднение стирает локальные значения: один и тот же запрос может обозначать разные товары в Австралии и США.
Персонализированные методы пытаются исправить это через параметры модели. Они добавляют региональные поправки, ведут отдельные наборы параметров или решают двухуровневую задачу оптимизации. На трансформерах такие поправки могут проходить через общие матрицы векторных представлений и слои LayerNorm, усиливать друг друга и нарушать обучение.
RegionFed вместо параметров сравнивает градиент региона с глобальным градиентом. Евклидово расстояние между ними показывает конфликт: чем сильнее региональное обновление расходится с общим направлением, тем больше модели требуется локальная адаптация.
Один сигнал управляет сразу двумя решениями. Он задаёт вес региональной поправки и помогает выбрать способ персонализации. Grad использует разницу градиентов напрямую, Interp смешивает глобальное и региональное решения, а Meta применяет метаобучение, чтобы модель быстрее приспосабливалась к региону.
Режим Dynamic выбирает между ними по силе конфликта, различию распределений запросов и объёму региональных данных. При слабом расхождении он оставляет дешёвый Grad, а при сильном направляет регион в Meta. После развёртывания клиент при необходимости дополнительно дообучает региональную модель на устройстве.
Система сохраняет трёхуровневую схему: глобальный сервер, региональные координаторы и клиенты. Клиенты передают агрегированные градиенты, которые ограничивают по норме и зашумляют. В использованной конфигурации бюджет дифференциальной приватности ε составил около 0,60: этот параметр ограничивает влияние данных отдельного участника на итог обучения.
Единый подход сработал на T5, RoBERTa и CNN
На основном наборе Amazon ESCI вариант RegionFed-Meta набрал 92,27% общей точности. Централизованная модель с региональными весами, которая служила верхней границей и не сохраняла федеративный режим, получила 92,04%. Разница оказалась в пределах погрешности.
FedAvg на тех же условиях достиг 80,18%. Методы, которые персонализируют параметры, на T5 опустились ниже 10%: проблема сохранялась при разных настройках числа локальных эпох. На CNN такого обрушения не было, что связывает результат именно с устройством трансформеров, а не с федеративным обучением в целом.
Общую точность считали как среднее для классификации намерения запроса, точного исправления опечаток и F1 при распознавании сущностей. Результаты усредняли по пяти запускам.
Границы проверки охватывают Amazon ESCI для товарного поиска, Amazon Reviews для анализа отзывов и LEAF-FEMNIST для распознавания символов. RegionFed запускали на T5-Small, T5-3B, RoBERTa-Base и свёрточной сети. Так авторы проверили перенос между текстом и изображениями, но все регионы были заданы заранее.
Когда RegionFed меняет архитектурный план
Если продукт уже разделяет данные по странам, рынкам или товарным направлениям, RegionFed позволяет сохранить одну глобальную модель и добавлять региональные адаптации без отдельной реализации для каждой архитектуры. Это особенно заметно при переходе между семействами моделей: логика персонализации работает с градиентами и рассматривает модель как дифференцируемый чёрный ящик.
Для первого внедрения практичнее выглядит Grad. В экспериментах он добавлял около 2% времени к раунду FedAvg и уступал Meta по итоговой точности лишь в пределах одного процентного пункта. Meta увеличивал время раунда примерно на 15%, поэтому его имеет смысл оставлять регионам, где дополнительная точность окупает вычисления.
Dynamic пока не стоит принимать за автономный планировщик вычислений: в одном из регионов он выбрал неудачную стратегию, и авторам потребовался откат по проверочной выборке. В производственной системе такому маршрутизатору нужны наблюдение за качеством и безопасный запасной режим.
Главное условие внедрения — осмысленная региональная структура. При случайных ошибках в назначении регионов качество RegionFed-Meta снижалось на 4,2 процентного пункта, поэтому географию нельзя считать нейтральной технической настройкой. Её придётся согласовать с семантикой запросов, ассортиментом и правилами размещения данных.
Работа не требует пересматривать планы команд, которым достаточно одной глобальной модели на однородных данных. Но если FedAvg уже усредняет заметно разные локальные задачи, RegionFed предлагает сначала измерить расхождение градиентов, а затем платить за персонализацию только там, где конфликт действительно возник.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



