Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Lamine Diop из EPITA Research Laboratory представил WAND — объяснимый детектор аномалий для табличных данных; работа опубликована как препринт, не проходивший рецензирования. По замерам автора, WAND обнаруживает аномалии на уровне группы лучших базовых методов, а встроенные объяснения точнее и дешевле объяснений SHAP. Результат важен командам, которые сейчас дополняют отдельный детектор аномалий внешним слоем интерпретации.
Что сделали
WAND работает с неразмеченной выборкой, в которой нормальные и аномальные наблюдения заранее не разделены. Детектор проецирует данные на разные направления в пространстве признаков и ищет точки, чьи проекции выходят за ожидаемую границу нормальных значений.
Эта граница строится относительно субгауссовой модели хвостов распределения. Упрощённо, такое допущение означает, что вероятность очень далёких от центра нормальных наблюдений быстро уменьшается. Центр и масштаб каждой проекции оцениваются через медиану и медианное абсолютное отклонение — устойчивую к выбросам альтернативу среднему и стандартному отклонению.
Если направление выделяет точку как аномальную, оно становится её «свидетелем». Координаты направления соответствуют исходным признакам и показывают, какие из них внесли вклад в итоговую оценку. Поэтому атрибуция признаков формируется во время расчёта оценки, а не восстанавливается после него через многократные обращения к детектору, как в SHAP или LIME.
WAND сочетает случайные направления с направлениями вдоль отдельных признаков. Первые нужны для аномалий, возникающих из сочетаний признаков, вторые — для выбросов в одной колонке. Дополнительная оценка расстояний между соседними проекциями помогает находить редкие группы, которые обычная нормализация медианой могла бы принять за отдельный нормальный режим.
Вес направлений калибруется на искусственной гауссовой копии выборки с похожей ковариацией. Итоговые оценки усредняются по нескольким запускам, чтобы снизить зависимость от случайного набора направлений. Автор также описывает дифференцируемый вариант: вклад признаков можно получить через градиент и использовать саму оценку аномальности внутри обучаемого конвейера.
Что показали
В сравнении с 16 неконтролируемыми базовыми детекторами WAND получил лучший средний ранг по площади под ROC-кривой — метрике, измеряющей способность ставить аномалии выше нормальных точек. Однако статистический тест поместил несколько методов в одну верхнюю группу. Автор поэтому формулирует результат как сопоставимое качество обнаружения, а не как подтверждённое превосходство.
Основной выигрыш относится к объяснениям. В проверке через удаление и обратное добавление наиболее важных признаков средняя верность встроенного объяснения WAND составила 0,63 против 0,52 у SHAP. Эта метрика показывает, насколько изменение названных объяснением признаков действительно меняет оценку самого детектора.
Встроенная атрибуция повторно использует вычисления, уже сделанные при оценке аномалии, и не требует дополнительных обращений к модели. По измерениям автора, время построения одного объяснения было примерно в 5000 раз меньше, чем у SHAP с использованным в работе бюджетом запросов.
Ограничения
Обнаружение проверяли на 47 табличных наборах ADBench, а верность объяснений на реальных данных — на 33 из них. Корректность атрибуции относительно заранее известных причин аномалии оценивалась на синтетических примерах; на реальных данных тест показывает только согласованность объяснения с собственной оценкой WAND. Он не доказывает, что выделенные признаки являются предметной или причинной основой события.
Теоретическая гарантия ограничивает необходимое количество направлений, но не полное время работы: каждое направление всё равно требует прохода по выборке. В высокой размерности вероятность случайно найти подходящее направление снижается, поэтому доказанная оценка полезнее для малой и средней размерности. Для тяжёлых хвостов автор приводит экспериментальные результаты, но формальная гарантия действует при субгауссовом допущении.
Доказательство устойчивости относится к пути со случайными направлениями, а не ко всей схеме с добавленными осями признаков. Калибровка на гауссовой копии использует неустойчивую к выбросам ковариационную оценку. Кроме того, глубокие детекторы проверены только на поднаборе, а среди сравнений нет некоторых более новых методов на основе деревьев и оптимального транспорта, что сам автор относит к ограничениям охвата.
Что это значит
Работа меняет планы на уровне архитектуры прототипа, если продукту одновременно нужны неконтролируемое обнаружение табличных аномалий и объяснение по признакам. Вместо связки «детектор плюс SHAP» можно проверить единый алгоритм, где оценка и атрибуция основаны на одном вычислении. Это особенно уместно для потоков с большим числом объясняемых событий, где повторные запросы к детектору становятся отдельной статьёй задержки и вычислений.
Оснований заменять работающий детектор только ради качества обнаружения работа не даёт: преимущество WAND над верхней группой базовых методов находится в пределах статистической неопределённости. Решение о внедрении должно опираться на проверку собственных типов аномалий, размерности, тяжести хвостов и того, понятны ли специалистам направления-свидетели.
Для регулируемых или операционно критичных процессов встроенное объяснение также не следует трактовать как причину события. Оно отвечает на более узкий вопрос: какие признаки заставили именно WAND поставить точке высокую оценку. Практический результат работы — возможность убрать отдельный приближённый слой интерпретации, но не этап предметной проверки объяснений.
Источники
Иллюстрация: рисунок из статьи «Witnesses Explain Anomalies», Lamine Diop, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



