Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
metabeta научили строить байесовские оценки для новых иерархических наборов данных и менять априорные распределения без повторного обучения. В препринте Institute for Human-Centered AI и Helmholtz Munich, который не прошёл рецензирование и приводит замеры самих авторов, полный вывод работал в 100–1000 раз быстрее NUTS — эталонного алгоритма Монте-Карло для таких задач. Это сокращает цену повторных расчётов при проверке разных предположений о параметрах.
Модель работает с обобщёнными линейными моделями со смешанными эффектами: они разделяют общие параметры и эффекты отдельных групп, например клиник или пользователей. Обычный алгоритм запускает цепочки заново для каждого набора данных, варианта модели и априорного распределения. metabeta переносит основную работу в предварительное обучение, а при запуске принимает семейство распределения и его гиперпараметры вместе с данными.
Два Set Transformer отдельно сжимают наблюдения внутри групп и сводки по всем группам. Затем условные нормализующие потоки строят распределения общих и локальных параметров. Сырой результат остаётся нейросетевой аппроксимацией, поэтому стандартный режим использует его как предложение для Independence Metropolis–Hastings и проверяет выборки по целевому распределению. Для гауссовских исходов такая проверка точна; для бинарных данных и счётчиков в ней применяется приближение Лапласа. Поток также может задать начальную область для NUTS.
На синтетических задачах с известными параметрами metabeta совпала с NUTS по восстановлению параметров, калибровке интервалов и прогнозам на новых данных. На реальных наборах вне обучающего распределения оценки оставались близкими при ошибочно заданных распределениях, коррелирующих признаках и малом количестве данных.
Проверка охватывала гауссовские, бинарные и счётные исходы, модели максимум с 16 общими и пятью случайными эффектами и наборы до 3000 наблюдений. Замеры скорости проводили на разном оборудовании: metabeta запускали на H100 GPU, остальные методы — на четырёх ядрах CPU. Поэтому заявленный разрыв показывает производительность готовой реализации, но не чистое преимущество алгоритма при равных вычислительных ресурсах.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



