Материал подготовлен автоматически по первоисточникам: ссылки на них — в конце статьи.
Для поиска аномалий во временных рядах удалось получить короткие NumPy-детекторы, которым не нужны обучение нейросети и GPU. В препринте David Berghaus из Lamarr Institute и Fraunhofer IAIS, который не прошёл рецензирование и приводит числа самого автора, эти программы заняли больше всего первых мест по всем опубликованным метрикам TSB-AD. LLM здесь нужна только во время разработки: в готовую систему попадает обычный проверяемый код.
LLM редактировала одну программу и проверяла каждую версию
LLM работала не как детектор, а как программист внутри автономного цикла. Она получала текущую версию функции на Python и NumPy, результаты последних испытаний и могла менять только код детектора.
После каждой правки испытательный контур запускал программу на отложенной части обучающего ряда. Неудачные варианты не исчезали: модель видела всю историю попыток, а по завершении цикла система сохраняла версию с лучшим результатом.
Реальные метки аномалий для поиска не использовали. Вместо этого в отложенный фрагмент обучающих данных добавляли синтетические сбои: замерший датчик, цикл с неправильным периодом или фазой, фрагмент не в своём контексте и совместные искажения нескольких каналов. Тестовая часть и её метки в цикл не попадали.
Отдельный поиск проводили для одномерных и многомерных рядов. Лучшие программы появились за часовую сессию примерно из ста правок, когда циклом управляла Opus 4.8. При неизменных данных, начальном коде и целевой функции другие LLM находили менее устойчивые решения, поэтому результат зависит не только от качества испытательного контура.
Спектр окна заменил обучаемые веса
Оба найденных детектора разбивают ряд на короткие окна и описывают ритмы внутри каждого окна. Затем они сравнивают описание с распределением нормальных окон из обучающей части. Чем сильнее окно отклоняется от привычной структуры, тем выше оценка аномальности.
Одномерный вариант учитывает, как энергия сигнала распределена между частотами, где находится её центр, насколько спектр плоский и не замерла ли часть окна. Он повторяет расчёт на нескольких масштабах, поэтому может заметить как короткий сбой, так и более длинное изменение ритма.
Многомерный вариант объединяет частотные признаки всех каналов. Он замечает не только необычное поведение отдельного датчика, но и разрыв привычной связи между каналами, даже если каждый из них по отдельности остаётся в нормальном диапазоне. Отклонение измеряет расстояние Махаланобиса: оно учитывает совместные изменения признаков, а не сравнивает каждый независимо.
На TSB-AD программы сравнили с классическими методами, глубокими моделями и Time-RCD. Они получили больше всего первых мест по всем использованным метрикам. На TAB многомерный детектор также оказался среди лидеров, а одномерный разделил верхние позиции с KMeans: KMeans лучше по метрикам точности, тогда как найденный метод оказался в середине списка по оценке совпадения целых аномальных интервалов.
Разница особенно заметна на многомерных рядах: один вызов детектора занимал 0,054 секунды на одном ядре CPU против 1,9 секунды у Time-RCD на GPU V100, то есть примерно в 35 раз меньше. На одномерных рядах картина обратная: Time-RCD работал быстрее, поэтому преимущество нового метода нельзя переносить на любой тип данных.
Командам стоит переносить LLM из эксплуатации в разработку
Работа предлагает другой способ собрать компонент машинного обучения. Вместо вызова большой модели в рабочей системе команда может использовать LLM один раз, чтобы найти компактный алгоритм, а затем развернуть полученный код как обычную функцию. Это сокращает требования к инфраструктуре и позволяет читать, тестировать и профилировать весь детектор.
Главным инженерным активом при таком подходе становится испытательный контур. Команде нужно точно разделить обучающие и проверочные данные, выбрать целевую метрику и описать синтетические сбои, похожие на реальные отказы системы. Генератор аномалий фактически задаёт представление о том, что должен искать будущий детектор: если важного класса сбоев в нём нет, поиск может предпочесть неподходящую программу.
Менять планы стоит там, где нужны автономная работа без GPU, предсказуемое время ответа и аудит логики. Особенно хорошо схема подходит для систем без размеченных инцидентов: синтетические примеры позволяют оценивать кандидатов, не используя реальные метки.
При этом переносить найденный код напрямую в производство рано. Его проверили на двух наборах тестов с одномерными и многомерными временными рядами, но не в промышленной эксплуатации. Кроме того, для каждого режима провели по одному поиску, а замена управляющей LLM заметно меняла результат. Практический план должен включать несколько запусков, проверку на собственных сбоях и ручной разбор кода перед внедрением.
Источники
Иллюстрация: рисунок из статьи «Have an LLM Write Your Anomaly Detector: Autonomous Discovery of Compact, Interpretable Detectors for Time Series», David Berghaus, CC BY 4.0
Похоже на вашу задачу?
Расскажите, что собираете. За полчаса разложим на этапы и назовём сроки — это бесплатно и ни к чему не обязывает.



