Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Дорогую фундаментальную модель для табличных данных удалось заменить компактным предиктором, которому больше не нужен размеченный контекст при каждом запросе. В работе Nums AI медианное ускорение составило от 3 до 21,6 раза при росте ошибки на 1,72–2,76%, хотя препринт не рецензирован и числа получили сами авторы. Такая замена подходит для продукта, где модель многократно обрабатывает данные из одной предметной области.
Учителю передавали весь размеченный обучающий набор, включая строку, для которой он строил прогноз. Затем TabM или XGBoost обучали только на ответах учителя, без прямого использования правильных меток в функции потерь. Этот вариант оказался лучше схемы, где запрашиваемую строку исключали из контекста и добавляли её метку отдельно.
Обучающие примеры расширили с помощью CutMix: каждый признак синтетической строки брали из одной из двух реальных строк. На одну исходную строку создавали две синтетические и также размечали их ответами учителя. Эти запросы показывают ученику поведение модели между уже наблюдавшимися точками, не требуя новых меток.
Схему проверили с TabICLv2 и TabPFN v3 в роли учителей, а с TabM и XGBoost — в роли учеников. На TabArena компактные модели с настройками по умолчанию обошли настроенные ансамбли тех же архитектур на 57–98 пунктов Elo. Elo здесь служит сравнительным рейтингом: он растёт, когда метод чаще выигрывает у остальных на наборах данных.
Тот же рецепт без повторного подбора проверили на 300 наборах TALENT: в тест вошли бинарная и многоклассовая классификация, а также регрессия. Дистилляция требует один раз получить ответы учителя и обучить отдельную модель для конкретного набора данных. Поэтому она выгоднее при повторных прогнозах и большом контексте, но не заменяет учителя как универсальную модель для новых наборов.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



