Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Ошибки даже в малой доле показаний электросчётчиков резко ухудшили прогноз спроса на электроэнергию. Работа Yixuan Liang пока не рецензирована, а все числа получил сам автор: дефекты в 0,10% учебных данных повысили ошибку модели на 86%. Значит, проверка входных данных может влиять на прогноз сильнее, чем выбор алгоритма.
Автор собрал конвейер, который до обучения находит пропуски, застывшие датчики, многочасовые нулевые значения и смену единиц измерения. Повреждённые записи он исправляет только по сведениям из прошлого, поэтому в прогноз не просачиваются будущие данные.
После исправления ошибка вернулась к уровню чистых данных, а для обучения сохранились 93% целевых показаний. При доле дефектов 1,6%, подобранной по опубликованным полевым исследованиям, незащищённая модель ошибалась в 4,4 раза сильнее сезонного базового прогноза; очищенные данные снова вернули исходную точность.
Первая версия конвейера дала обратный результат: она удаляла естественные особенности показаний и ухудшила прогноз на 25%. Причину удалось связать с общей настройкой правил для разных зданий. После отдельной настройки для каждого здания лишняя очистка исчезла; первоначальный отрицательный результат и исправление остались в опубликованных материалах.
Поскольку материал сделан по абстракту, а полный текст работы недоступен, границы проверки можно передать лишь в заявленном виде: почасовые данные двенадцати американских зданий из Building Data Genome 2, прогнозы на срок от одного до 24 часов и три алгоритма — градиентный бустинг, гребневая регрессия и случайный лес. Дефекты вносили контролируемо и фиксировали хешами; воспроизводимость поддержали закреплёнными версиями открытых данных, проверкой SHA-256, автоматическими тестами и непрерывной интеграцией.
Источники
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



