Журнал · Rit.work

Для выбора действий моделям временных рядов нужен отдельный критерий

Точность прогноза не гарантирует правильную реакцию модели на новый план: архитектура снижает ошибку, а направление эффекта приходится задавать при обучении.

Rit.work
Студия разработки
2 октября 2026 г.4 мин чтения

Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.

Модель временных рядов может точно продолжать наблюдавшуюся динамику и при этом ошибаться, когда ей меняют план управления. В препринте Haochen Zhang и его соавторов, который не проходил рецензирование и где все числа получили сами авторы, самая точная конфигурация оказалась не лучше случайного выбора на большинстве наборов с известными механизмами. Если модель должна сравнивать ещё не выполненные действия, одной ошибки прогноза для выбора архитектуры недостаточно.

Как проверяли реакцию на новый план

Авторы рассматривают модель мира для временных рядов как прогнозную модель с тремя видами входов. Состояние описывает управляемую величину, действие задаёт контроллер, а внешние факторы влияют на систему независимо от него. Например, в теплице состоянием служит температура воздуха, действием — положение вентиля, внешним фактором — погода.

Обычная проверка измеряет среднюю абсолютную ошибку между прогнозом и фактическим состоянием. Она показывает, насколько хорошо модель воспроизводит выполненный план, но не проверяет, что произойдёт при другом действии.

Поэтому в работе добавили согласованность с механизмом. Для каждой заранее заданной связи известно направление эффекта: открытие вентиля снижает температуру в теплице, а увеличение дозы вазопрессора повышает давление. В тесте одно действие сдвигают относительно фактического значения и проверяют, двинулся ли прогноз в ожидаемую сторону.

Такой тест не измеряет величину эффекта и не доказывает причинную связь. Он отвечает на более узкий вопрос: сохраняет ли модель хотя бы известное направление реакции, когда получает новый план.

Проверка охватила восемь публичных наборов из инженерной инфраструктуры и клинической практики. Модели прогнозировали следующие 16 шагов; варианты архитектуры сравнивали на семи прогнозных основах, с пятью случайными инициализациями. Для оценки направления авторы заранее зафиксировали 21 связь между непрерывными действиями и состояниями.

Скрытое пространство снижает ошибку, но не исправляет механизм

Авторы меняли три части модели по отдельности: пространство прогноза, способ добавить план и обработку плана во времени. Остальные части при каждом сравнении оставались одинаковыми.

Прогноз в скрытом пространстве заранее обученного и затем замороженного автоэнкодера снизил среднюю абсолютную ошибку на 9,9% относительно прогноза исходных наблюдений. Такое представление отделяет прогноз динамики от восстановления конкретных каналов и улучшило результат на всех наборах.

Передача плана через Gate на выходе прогнозной основы снизила ошибку на 12,7% относительно простого объединения плана со входом. Основа сначала строит прогноз без плана, после чего отдельный блок меняет его с учётом действий и внешних факторов. Варианты с памятью о предыдущих шагах плана меняли среднюю ошибку не более чем на 2,2%, поэтому усложнение временного кодировщика устойчивого выигрыша не дало.

Однако лучшая по ошибке конфигурация показала результат на уровне случайного выбора или хуже на четырёх из пяти наборов, где проверяли согласованность с механизмом. Ни скрытое пространство, ни способ объединения плана, ни другая прогнозная основа сами по себе проблему не решили.

Причина заложена в наблюдаемых данных. Контроллер меняет действие в ответ на состояние: например, вазопрессор чаще вводят при падающем давлении. Поэтому в записях высокая доза может совпадать с низким давлением, хотя физическое действие препарата направлено в обратную сторону. Архитектура способна выучить эту корреляцию и сохранить низкую ошибку на фактических планах.

Авторы добавили в функцию потерь штраф за ответ неправильного знака. После такого обучения согласованность превысила 0,99 как для инженерных, так и для клинических механизмов, а средняя абсолютная ошибка статистически не изменилась. Сеть при этом не меняли: нужное направление задавала цель обучения.

Что меняется в планах разработки

Если продукт только продолжает ряд при ожидаемых входах, работа даёт практический вариант архитектуры: замороженный автоэнкодер для состояния и отдельное объединение плана на выходе. Усложнять обработку истории действий без проверки на своих данных оснований нет.

Если модель ранжирует режимы управления, расписания, дозировки или другие ещё не выполненные планы, выбирать её только по ошибке на отложенных данных нельзя. В испытания стоит добавить контролируемое изменение одного действия и проверку направления ответа. Список таких проверок должен составлять специалист по предметной области, а не сама модель.

Когда направление известно заранее, его можно включить в функцию потерь. Это не требует отдельной архитектуры, но меняет требования к данным и приёмке: команда должна формально описать связи между действиями и состояниями и проверить их до обучения. Ошибочно заданное направление модель тоже выучит.

Работа проверяет этот подход на непрерывных действиях и на заранее объявленных связях. Событийные действия вроде разового введения препарата в тест направления не вошли. В клинических сценариях высокий балл также не означает, что модель верно оценивает силу эффекта, безопасна или готова выбирать лечение.

Источники

Иллюстрация: рисунок из статьи «On the Divergence of Accuracy and Mechanism Consistency in Time Series World Models», Haochen Zhang, Jiaheng Guo, Zhen Xu и др., CC BY 4.0

Пауза в чтении

Похоже на вашу задачу?

Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.

Rit.work

Студия разработки

Собираем мобильные приложения и помогаем командам получать от AI реальную пользу. Основатель и команда, работаем удалённо — с клиентами в России и за рубежом.

← Ко всем материалам
Понравилось? Обсудим вашу задачу