Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
TabLDM Team представила Xiaomi-TabLDM — базовую модель для классификации и регрессии по таблицам; работа опубликована как препринт, не проходивший рецензирования. На OpenML-CTR23 авторы измерили лучший средний ранг — 3,03. Результат важен командам, которые хотят применять одну предобученную модель к разным таблицам без отдельного обучения под каждый набор данных.
Что сделали
Xiaomi-TabLDM заранее обучили только на синтетических таблицах, сгенерированных структурными причинными моделями. Генератор варьирует связи между признаками, типы переменных, пропуски и форму зависимостей, а задачи без полезного предсказательного сигнала отбрасывает. Обучение разделено на несколько этапов с постепенным увеличением таблиц.
При применении модель получает размеченные строки как контекст и предсказывает значения для новых строк без изменения параметров. Архитектура отдельно кодирует столбцы, собирает представление каждой строки и передаёт его преобразователю с разреженной смесью экспертов: для отдельного элемента активируется только часть специализированных блоков.
Дополнительные вычисления при применении расходуются на несколько вариантов одного набора данных: модель меняет порядок и подмножества признаков, способы нормализации и представления. Затем прогнозы объединяются с неотрицательными весами. По замерам авторов, модель заняла первое место на регрессионном OpenML-CTR23 из 33 наборов данных и второе место по регрессии ещё в трёх наборах тестов.
Что это значит
Работа показывает возможную альтернативу конвейеру, где для каждой таблицы отдельно выбирают алгоритм, настраивают признаки и обучают ансамбль. Здесь основная стоимость переносится в общее предобучение, а адаптация выполняется через контекст и дополнительные варианты вычислений. Для продукта это имеет смысл, если приходится регулярно запускать похожие задачи на новых таблицах и допустимо обменивать задержку применения на качество прогноза.
Ограничения. Авторы проверяли систему на четырёх публичных наборах тестов, причём большинство входящих таблиц содержат менее 10 тысяч обучающих строк. Работа не показывает поведение на конкретных производственных распределениях, при дрейфе данных и жёстких требованиях к задержке. Сравнение по средним местам и Elo также не устанавливает преимущество при едином бюджете памяти, вычислений и настройки: такого общего режима для всех методов в работе не описано.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



