Журнал · Rit.work

Impute-EM заполняет пропуски без перевода категорий в числа

Impute-EM объединяет числовую и категориальную диффузию, чтобы восстанавливать смешанные таблицы без двоичных заменителей и точнее сохранять распределение данных.

Rit.work
Студия разработки
15 сентября 2026 г.3 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Диффузионную модель научили заполнять пропуски в таблицах, не превращая категории в искусственные числовые признаки. Impute-EM снизил среднюю ошибку распределения до 0,071 против 0,108 у ближайшего из соперников; работа Applied AI Institute, Moscow State University и Yandex Research не рецензирована, а числа получили сами авторы. Метод подходит для систем, где заполненную таблицу затем используют для обучения моделей или анализа зависимостей.

Категории остаются категориями на всём пути

Таблицы часто объединяют непрерывные величины, категории и двоичные признаки. Большинство диффузионных методов работает с непрерывным пространством, поэтому категорию приходится заменять двоичным вектором с одной единицей: например, один столбец города превращается в отдельные столбцы для каждого значения.

Такая замена увеличивает размерность и меняет устройство пространства, в котором работает модель. Промежуточное состояние диффузии уже не обязано соответствовать допустимой категории, поэтому модель сначала предсказывает вещественные значения, а затем их приходится переводить обратно.

Impute-EM разделяет обработку типов. К числовым координатам модель добавляет гауссов шум, а категориальные значения заменяет специальной маской и учится восстанавливать исходную категорию. Обе части поступают в одну нейросеть, а общая функция потерь складывается из числовой и категориальной составляющих.

Метод начинает с диффузионной модели, обученной только по наблюдаемым значениям. Затем он повторяет два шага. Сначала текущая модель условно заполняет пропуски, сохраняя известные поля. После этого модель заново обучается на получившихся полных записях.

Это вариант алгоритма максимизации ожидания: заполненные значения здесь остаются не окончательным ответом, а промежуточной выборкой для следующего обучения. Диффузионная модель может выдавать несколько правдоподобных заполнений, поэтому метод сохраняет неопределённость вместо подстановки одного среднего или наиболее частой категории.

Ошибка распределения снизилась примерно на треть

Основную проверку провели на смешанных таблицах Adult, Shoppers, Default и Beijing. Долю полностью случайных пропусков меняли от 20 до 70%, а Impute-EM сравнивали с DiffPuter, ReMasker, MissDiff и HyperImpute. Модель обучалась и заполняла записи внутри обучающей выборки, то есть опыт не проверяет перенос табличного заполнителя на новые строки.

Главная метрика, Overall Density, измеряет, насколько заполненные данные сохраняют распределения отдельных признаков и зависимости между ними; меньшая ошибка означает более близкое совпадение. Средний результат Impute-EM составил 0,071 против 0,108 у HyperImpute, ближайшего соперника в таблице. Это снижение ошибки примерно на треть.

Авторы также обучали прикладные модели на заполненных таблицах и сравнивали их качество с обучением на исходных полных данных. Impute-EM занял первое место по среднему рангу, хотя на отдельных наборах лидер мог меняться. При пропусках, зависящих от самих скрытых значений, метод также лидировал по распределительной метрике и средней полезности для последующих моделей.

Отдельный опыт на text8 проверял только категориальную часть: символы скрывали, а модель восстанавливала их на новых примерах. Последовательные циклы улучшали перплексию — показатель того, насколько высокую вероятность модель назначает правильным символам. Основной выигрыш давали первые циклы.

Теоретический результат уже практического вывода. При точном условном заполнении и точном переобучении наблюдаемые срезы распределения сходятся к целевым. Полное исходное распределение восстановить в общем случае нельзя: разные распределения могут одинаково выглядеть во всех доступных неполных наблюдениях.

Когда Impute-EM меняет план разработки

Работа даёт основание пересмотреть архитектуру, если заполненные данные идут не только в отчёт, но и в обучение моделей, генерацию выборок или анализ связей. В таких задачах низкая ошибка отдельного восстановленного значения недостаточна: заполнение не должно разрушать частоты категорий и зависимости между столбцами.

Impute-EM можно рассматривать как обвязку вокруг смешанной диффузионной модели, а не как новый формат данных или отдельную модель для каждого типа столбцов. Если в проекте уже есть условный диффузионный заполнитель, потребуются два дополнительных процесса: генерация завершённого набора и повторное обучение на нём.

За улучшение приходится платить вычислениями. Каждый цикл запускает условную диффузию для пропущенных значений, а затем снова обучает модель. Поэтому метод стоит сначала сравнить с однопроходным заполнителем на собственной таблице и измерить не только качество последующей модели, но и время полного цикла обновления данных.

Границы результата не позволяют считать Impute-EM универсальной заменой существующих методов. Табличные опыты охватывают четыре набора, а основная схема использует полностью случайные пропуски; для другого механизма пропусков вычислительные шаги сохраняются, но теоретическая гарантия уже не действует. Практический вывод уже: нативная категориальная диффузия вместе с повторным обучением стала обоснованным кандидатом для проверки там, где важна структура всей заполненной выборки.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу