Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Пропуски в табличных данных удалось заполнять с качеством итеративного MissForest, но без повторных циклов случайного леса. SoftForest работал в 9,52 раза быстрее MissForest, хотя препринт не рецензировался и числа получили сами авторы. Это даёт альтернативу командам, у которых заполнение пропусков приходится многократно запускать для разных выборок или условий эксперимента.
Как низкий ранг заменяет циклы MissForest
MissForest начинает с простого заполнения пропусков, затем по очереди обрабатывает каждый неполный столбец. Для него обучают случайный лес на строках с известными значениями, предсказывают пропуски и повторяют весь цикл до сходимости. Метод учитывает нелинейные зависимости, но многократно обучает модели.
NuclearForest и SoftForest сначала строят более содержательное начальное заполнение. Они исходят из того, что многие признаки в реальной таблице зависят от небольшого числа скрытых факторов: например, несколько биологических процессов одновременно влияют на множество измеряемых молекул. Поэтому всю таблицу можно приблизить матрицей низкого ранга, которая сохраняет основные совместные изменения признаков.
NuclearForest получает такое приближение через пороговую обработку сингулярных значений, или SVT. Пропуски сначала заменяют средними по столбцам, а затем размер шага увеличивают, если ошибка на известных ячейках уменьшается, и сокращают при её росте. SoftForest вместо SVT использует SoftImpute, который также ограничивает ранг матрицы, но решает задачу как восстановление известных значений со штрафом за сложность.
После этого оба метода один раз проходят по неполным столбцам случайным лесом. Низкоранговое заполнение уже описывает общие связи, поэтому лесу остаётся скорректировать нелинейные эффекты и взаимодействия признаков. Известные ячейки при этом не меняются.
Для адаптивного SVT доказаны границы размера шага и сходимость варианта с нулевым начальным заполнением. Эта гарантия не распространяется автоматически на всю гибридную схему с заполнением средними и последующим случайным лесом: её качество проверяли экспериментально.
Где гибрид сохраняет качество, а где уступает
Методы проверяли на двух таблицах: данных метаболомики и данных о жилье. Их сравнили с семью базовыми подходами, включая MissForest, kNN, SoftImpute и простые подстановки. В сумме тесты охватили три механизма пропусков: случайное удаление значений, зависимость пропуска от известных признаков и левое цензурирование, при котором исчезают малые значения ниже порога измерения.
Качество оценивали не только по нормированной среднеквадратичной ошибке восстановленных ячеек. Проверка также учитывала сохранность общей структуры выборки, групповых различий, распределений и точности последующей модели. Это существенно для аналитических конвейеров: небольшая ошибка в отдельных ячейках ещё не гарантирует, что после заполнения сохранятся статистические выводы.
На метаболомных данных со случайными пропусками NuclearForest оставался конкурентоспособным относительно MissForest и лучше проявлял себя при небольшой доле пропусков. При средних и больших долях MissForest чаще давал лучший результат. NuclearForest при этом оказался в 5,81 раза быстрее в показательном эксперименте.
При левом цензурировании преимущество гибрида не сохранилось. Простая подстановка половины минимального значения лучше соответствует механизму, при котором прибор не регистрирует малые концентрации. Это показывает, что структурное начальное заполнение помогает, пока в наблюдаемой части остаётся достаточно информации об общих связях.
На данных о жилье гибриды хорошо сохраняли структуру при небольшой и средней доле пропусков. Когда пропусков становилось больше, результат зависел от метрики: для последующего прогноза предпочтительнее могли оказаться MissForest или SoftImpute, а для структуры данных — другие методы.
Стоит ли менять конвейер заполнения пропусков
Работа меняет планы прежде всего там, где MissForest уже подходит по качеству, но задерживает повторные эксперименты. Вместо настройки числа итераций можно проверить схему из низкорангового заполнения и единственного прохода случайного леса. Сравнивать её следует на той же конечной задаче, ради которой готовят данные: прогнозе, статистическом тесте или анализе групп.
Заменять действующий метод только по показателю восстановления ячеек не стоит. Эксперименты показывают, что ранжирование методов меняется вместе с механизмом и долей пропусков. Для цензурированных измерений полезнее сначала учесть физическую причину пропуска, чем применять универсальный восстановитель.
Заявленное ускорение также нельзя напрямую переносить на большие таблицы. В экспериментах SVT вычислял полное сингулярное разложение, стоимость которого растёт вместе с размером матрицы. Перед переходом нужно отдельно измерить время низкорангового этапа и прохода случайного леса на рабочем объёме данных.
Практический вывод узкий: для средних табличных наборов с коррелирующими признаками гибрид стоит добавить в сравнительный тест рядом с MissForest. Работа не устанавливает новый универсальный метод заполнения, но показывает, как убрать повторные циклы там, где общую структуру таблицы можно восстановить заранее.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



