Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Выбор уровня оценки полностью поменял рейтинг методов прогнозирования на одних и тех же данных. Работа сотрудников Field Nation, хотя это нерецензированный препринт и числа получили сами авторы, показывает: производственный метод занял второе место из 19 для рынка в целом, но опустился на 23-е из 25 при оценке отдельных клиентов. Значит, лидер общего рейтинга может не подходить для продукта, который принимает решения по каждому магазину, клиенту или товару.
Авторы зафиксировали данные, период и горизонт прогноза, а затем меняли только схему оценки. Они сравнили 24 метода и учебный ориентир: классические алгоритмы, модели для нерегулярного спроса, машинное обучение и базовые модели временных рядов. Производственный метод брал значение того же месяца прошлого года и корректировал его по недавней динамике.
На суммарном объёме рынка ни один метод не обошёл производственный с различимой статистической разницей. На уровне клиентов его превзошли 19 конкурентов. Проверка на одинаковом наборе методов и временных отсечек сохранила разворот: дело оказалось именно в единице анализа, а не в составе рейтинга или метрике ошибки. При агрегации скачки отдельных клиентов компенсировали друг друга, и прогнозировать оставался более гладкий ряд.
Смена цели оценки дала ещё один разворот. Рейтинг точечных прогнозов, где модель выдаёт одно значение, почти не совпал с рейтингом прогнозных интервалов на нерегулярном спросе: корреляция мест составила 0,02. Хорошая точность среднего значения поэтому ничего не гарантировала системе, которая должна оценивать диапазон возможного спроса.
Основной тест охватил 1 887 клиентов маркетплейса за 67 месяцев. Разворот между общим рядом и отдельными рядами повторился на открытых данных M5, а на более гладких данных австралийского туризма ослаб. Полный рейтинг методов относится к одному бизнесу, а перестановку при оценке интервалов подтвердили только на производственной панели.
Практический вывод касается не выбора одной модели, а устройства проверки. Рейтинг нужно строить на том уровне, где продукт принимает решения, отдельно считать качество интервалов и делить ряды по характеру спроса. Иначе сравнение базовых моделей временных рядов отвечает на другую задачу, чем та, которую решает система.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



