Журнал · Rit.work

Валидация временных рядов не может получить всё сразу

Математическая граница показывает, чем приходится жертвовать при проверке моделей временных рядов: размером обучения, охватом теста или причинностью.

Rit.work
Студия разработки
25 сентября 2026 г.2 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

У проверки моделей временных рядов нельзя одновременно сохранить почти всю выборку для обучения, охватить тестами почти все наблюдения и не заглядывать в будущее. В нерецензированном препринте Jiayu Li, где числа получил сам автор, перемешанная 5-блочная проверка показала на чистом шуме ложную корреляцию +0,32 против +0,004 у последовательной. Значит, привычное разбиение из задач с независимыми объектами может убедительно подтвердить несуществующую закономерность.

Автор описывает схему двумя величинами: минимальной долей обучающих данных среди всех разбиений и долей временного ряда, которую покрывают тесты. Если обучение всегда предшествует тесту, сумма этих долей не превышает единицу. Чем больше данных получает самый ранний обучающий блок, тем меньшую часть ряда можно проверить без использования будущего.

Расширяющаяся пошаговая проверка достигает границы этого компромисса: каждый следующий блок тестируют на всех доступных к тому моменту прошлых данных. Обычная k-блочная перекрёстная проверка выходит за границу, поскольку обучается на наблюдениях после тестового блока. Исключение соседних наблюдений и временной зазор уменьшают утечку, но сокращают обучающую выборку.

Вред определяет не столько объём будущих данных, сколько расстояние от тестовой точки до ближайшего обучающего наблюдения из будущего. Если временной ряд быстро теряет память, достаточный зазор ослабляет зависимость. При смене рыночного режима или другой нестационарности такой зазор не превращает будущие данные в прошлые, поэтому для оценки работы после запуска подходит пошаговая проверка.

Комбинаторное доказательство относится к любому конечному упорядоченному ряду, модели и функции ошибки. Оценка статистического вреда дополнительно предполагает, что зависимость между далёкими наблюдениями ослабевает, а ошибка ограничена. Численный пример проверяли на одном синтетическом финансовом ряду из 3000 точек с горизонтом метки 20 периодов и моделью ближайшего соседа, поэтому он иллюстрирует механизм, а не сравнивает производственные модели.

Источники

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу