Журнал · Rit.work

Fed-ReMasker восстанавливает целые признаки без обмена таблицами

Fed-ReMasker заполняет столбцы, которые целиком отсутствуют в данных одного центра, используя знания из других центров без централизации исходных таблиц.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Систему заполнения пропусков научили восстанавливать целые столбцы, которых нет в данных отдельного медицинского центра. В препринте University of Bern, который не прошёл рецензирование и где все числа получили сами авторы, Fed-ReMasker показал наименьшую ошибку в 96,7% однородных сценариев с такими пропусками. Подход позволяет объединить несовместимые таблицы центров, не собирая исходные записи в одном месте.

За основу взяли ReMasker: модель закрывает часть известных ячеек и учится восстанавливать их по остальным столбцам. Каждый центр обучает локальную копию на доступных данных, после чего сервер усредняет параметры моделей с учётом числа записей. Если признак целиком отсутствует в одном центре, его структуру изучают центры, где этот столбец заполнен, а общая модель переносит знания обратно.

При неоднородном распределении данных Fed-ReMasker обошёл все сравниваемые методы во всех сценариях с отдельными пропущенными значениями. Для целиком отсутствующих признаков он превосходил каждый метод как минимум в 35 из 36 сценариев. Средняя ошибка оказалась не более чем на 3% выше, чем у модели, которая обучалась на объединённых данных.

Метод проверяли на синтетических таблицах с линейными и нелинейными зависимостями, а также на Codon, клиническом PhysioNet и медицинском опросе NHANES. В испытаниях меняли число центров, долю пропусков, размеры локальных выборок и распределение признаков между участниками. Архитектура предполагает общую схему столбцов и требует, чтобы каждый признак наблюдал хотя бы один центр.

Между центрами передают параметры модели, а не строки таблиц. При этом испытания не использовали защищённое агрегирование или дифференциальную приватность, поэтому результат показывает качество децентрализованного восстановления данных, но не даёт формальных гарантий конфиденциальности.

Источники

Иллюстрация: рисунок из статьи «Fed-ReMasker: Federated Tabular Imputation under Feature-Level Missingness», Ioannis Papathanail, Rooholla Poursoleymani, Lubnaa Abdur Rahman и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу