Журнал · Rit.work

Агрегация сделала слабый прогноз почти победителем

Один производственный прогноз занял второе место для рынка в целом и оказался почти последним при оценке по отдельным клиентам.

Rit.work
Студия разработки
24 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Выбор уровня оценки полностью поменял рейтинг методов прогнозирования на одних и тех же данных. Работа сотрудников Field Nation, хотя это нерецензированный препринт и числа получили сами авторы, показывает: производственный метод занял второе место из 19 для рынка в целом, но опустился на 23-е из 25 при оценке отдельных клиентов. Значит, лидер общего рейтинга может не подходить для продукта, который принимает решения по каждому магазину, клиенту или товару.

Авторы зафиксировали данные, период и горизонт прогноза, а затем меняли только схему оценки. Они сравнили 24 метода и учебный ориентир: классические алгоритмы, модели для нерегулярного спроса, машинное обучение и базовые модели временных рядов. Производственный метод брал значение того же месяца прошлого года и корректировал его по недавней динамике.

На суммарном объёме рынка ни один метод не обошёл производственный с различимой статистической разницей. На уровне клиентов его превзошли 19 конкурентов. Проверка на одинаковом наборе методов и временных отсечек сохранила разворот: дело оказалось именно в единице анализа, а не в составе рейтинга или метрике ошибки. При агрегации скачки отдельных клиентов компенсировали друг друга, и прогнозировать оставался более гладкий ряд.

Смена цели оценки дала ещё один разворот. Рейтинг точечных прогнозов, где модель выдаёт одно значение, почти не совпал с рейтингом прогнозных интервалов на нерегулярном спросе: корреляция мест составила 0,02. Хорошая точность среднего значения поэтому ничего не гарантировала системе, которая должна оценивать диапазон возможного спроса.

Основной тест охватил 1 887 клиентов маркетплейса за 67 месяцев. Разворот между общим рядом и отдельными рядами повторился на открытых данных M5, а на более гладких данных австралийского туризма ослаб. Полный рейтинг методов относится к одному бизнесу, а перестановку при оценке интервалов подтвердили только на производственной панели.

Практический вывод касается не выбора одной модели, а устройства проверки. Рейтинг нужно строить на том уровне, где продукт принимает решения, отдельно считать качество интервалов и делить ряды по характеру спроса. Иначе сравнение базовых моделей временных рядов отвечает на другую задачу, чем та, которую решает система.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

Ко всем материалам
Понравилось? Обсудим вашу задачу