Понимание обнаружения аномалий: методы, метрики и примеры

Обнаружение аномалий является критически важным методом в науке о данных и машинном обучении, который фокусируется на выявлении точек данных, моделей или событий, которые значительно отклоняются от ожидаемого поведения. Аномалия относится к наблюдению, которое значительно отклоняется от ожидаемого поведения в системе, часто появляясь необычным, непоследовательным или неожиданным. Этот мощный подход становится все более важным во многих отраслях и приложениях, от защиты финансовых систем от мошенничества до обеспечения надежности промышленного оборудования и защиты сетевой инфраструктуры от киберугроз.

Обнаружение аномалий имеет решающее значение для различных приложений, включая сетевую безопасность, обнаружение мошенничества, прогнозное обслуживание, диагностику неисправностей и мониторинг промышленных и медицинских учреждений. По мере того, как организации генерируют и собирают все большие объемы данных, способность автоматически идентифицировать необычные шаблоны стала необходимой для поддержания операционной эффективности, безопасности и контроля качества. Понимание различных методов, метрик оценки и практических применений обнаружения аномалий позволяет ученым и инженерам данных выбирать наиболее подходящие подходы для своих конкретных случаев использования.

Что такое обнаружение аномалий и почему это важно?

Обнаружение аномалий, также известное как обнаружение выпадающих, представляет собой процесс идентификации наблюдений или закономерностей в данных, которые не соответствуют ожидаемому поведению. Несмотря на то, что выпадающие данные обычно составляют лишь небольшую часть набора данных, они часто имеют очень важное значение, поскольку несут важную информацию и могут выявить критические идеи во время анализа. Эти аномалии могут указывать на критические события, такие как сбои системы, нарушения безопасности, производственные дефекты или мошеннические действия, которые требуют немедленного внимания.

Важность обнаружения аномалий возросла в геометрической прогрессии с увеличением сложности и объема данных в современных системах. Быстрое расширение данных из различных источников сделало обнаружение аномалий все более важным для выявления неожиданных наблюдений, которые могут сигнализировать о сбоях системы, нарушениях безопасности или мошенничестве. Традиционные подходы ручного мониторинга просто не могут масштабироваться для обработки массивных потоков данных, генерируемых современными приложениями, что делает автоматизированные системы обнаружения аномалий необходимыми для поддержания оперативной осведомленности и быстрого реагирования на потенциальные проблемы.

Виды аномалий

Аномалии можно разделить на несколько различных типов, основываясь на их характеристиках и на том, как они проявляются в данных. Понимание этих различных типов имеет важное значение для выбора соответствующих методов обнаружения:

Характер самих аномалий может варьироваться в зависимости от формата данных. Точечные аномалии, аномалии последовательностей и выбросы могут проявляться по-разному в разных типах и структурах данных. Понимание этих различий имеет важное значение для выбора соответствующих методов обнаружения аномалий.

Общие методы и методы обнаружения аномалий

Обнаружение аномалий охватывает широкий спектр методологий, от традиционных статистических подходов до передовых методов глубокого обучения. Каждый метод имеет свои сильные стороны, ограничения и идеальные варианты использования. Выбор метода зависит от таких факторов, как характеристики данных, вычислительные ресурсы, наличие меченых данных и конкретные требования приложения.

Статистические методы

Статистические методы представляют собой некоторые из самых ранних и наиболее интерпретируемых подходов к обнаружению аномалий.Эти методы предполагают, что нормальные данные следуют за конкретным статистическим распределением, а аномалии — это точки данных, которые имеют низкую вероятность при этом распределении.Традиционные методы обнаружения аномалий, такие как статистические методы, алгоритмы кластеризации и анализ основных компонентов, уже давно зарекомендовали себя как надежные инструменты в широком спектре приложений из-за их простоты, интерпретируемости и низких вычислительных накладных расходов.

Общие статистические методы включают:

Статистические методы хорошо работают, когда распределение данных хорошо понято и относительно стабильно, однако они могут бороться с высокоразмерными данными или когда основное распределение сложно или неизвестно.

Методы, основанные на расстоянии и плотности

Методы, основанные на расстоянии, оценивают отклонение наблюдений от репрезентативных точек данных с помощью метрик расстояния, а методы распределения фокусируются на выявлении аномалий через точки с низкой вероятностью.Эти подходы опираются на интуицию, что аномалии являются изолированными точками, которые находятся далеко от своих соседей в пространстве признаков.

Методы, основанные на плотности, основаны на локальной плотности точек данных. Если точка данных имеет значительно меньшую локальную плотность по сравнению с соседней областью, она может быть помечена как аномалия. Алгоритм локального фактора выброса (LOF) является популярным методом, основанным на плотности, который сравнивает локальную плотность точки с плотностью ее соседей для выявления выпадающих.

Ключевые методы, основанные на расстоянии и плотности, включают:

Однако по мере роста размеров и сложности целевых систем эти методы сталкиваются с проблемами, особенно с их ограничениями в обработке многомерных данных и отсутствием маркированных аномалий. Это ограничение привело к разработке более сложных подходов к машинному обучению.

Подходы машинного обучения

Методы машинного обучения стали все более популярными для обнаружения аномалий из-за их способности изучать сложные шаблоны из данных, не требуя явного программирования правил. Алгоритмы обнаружения аномалий машинного обучения без надзора включают в себя одноклассную машину поддержки, одноклассную SVM со стохастическим градиентным спуском, изоляционный лес, локальный фактор выброса и устойчивую ковариацию. Благодаря систематическому анализу на наборах данных прогнозную производительность этих алгоритмов можно оценить с помощью точности, точности, отзыва и оценки F1 специально для обнаружения выброса.

Изоляционный лес особенно эффективен для обнаружения аномалий. Оценка показывает, что одноклассные SVM, изоляционный лес и устойчивая ковариация более эффективны в выявлении выпадений, при этом изоляционный лес немного превосходит другие алгоритмы с точки зрения балансировки точности и отзыва. Изоляционный лес работает путем случайного выбора функции, а затем случайного выбора значения разделения между максимальным и минимальным значениями этой функции. Аномалии изолированы ближе к корню дерева, требуя меньшего количества расколов.

Одноклассный SVM изучает границу принятия решений вокруг нормальных точек данных в пространстве признаков. Любые точки, выходящие за эту границу, классифицируются как аномалии. Этот метод особенно полезен, когда у вас есть только нормальные данные для обучения и вам нужно обнаружить новые аномалии.

Методы сборки объединяют несколько алгоритмов обнаружения аномалий для повышения общей производительности и надежности.Объединяя решения нескольких детекторов, методы ансамбля могут уменьшить ложные срабатывания и повысить точность обнаружения в различных типах аномалий.

Методы глубокого обучения

По мере того, как наборы данных становятся все более сложными и высокоразмерными, традиционные методы обнаружения изо всех сил пытаются эффективно захватывать сложные шаблоны. Достижения в области глубокого обучения сделали методы обнаружения аномалий более мощными и адаптируемыми, улучшив их способность обрабатывать высокоразмерные и неструктурированные данные. Подходы глубокого обучения произвели революцию в обнаружении аномалий, автоматически изучая иерархические представления данных.

Модели глубокого обучения, такие как трансформаторы, графовые нейронные сети, вариационные автокодеры, генеративные состязательные сети и модели диффузии, искусны в представлении сложных, нелинейных отношений между различными датчиками и эффективно умеют захватывать временные корреляции и зависимости. Эти сложные архитектуры позволяют обнаруживать тонкие аномалии, которые могут быть упущены традиционными методами.

Методы, основанные на автокодере

Автокодеры — это нейронные сети, обученные реконструировать свои входные данные. Ключевое понимание заключается в том, что автокодеры, обученные на нормальных данных, будут иметь высокую ошибку реконструкции для аномальных данных. Методы на основе реконструкции используют нормальный набор данных для обучения модели, которая пытается закодировать данные в скрытое пространство, а затем реконструировать исходные данные из этого представления. Потери реконструкции рассчитываются путем сравнения различий между реконструированными данными и исходными данными.

Варианты автокодеров, используемых для обнаружения аномалий, включают:

Генеративные состязательные сети (GAN)

GAN состоят из двух нейронных сетей — генератора и дискриминатора, которые конкурируют друг с другом. Для обнаружения аномалий GAN могут быть обучены генерировать нормальные шаблоны данных. Затем аномалии идентифицируются как точки данных, которые дискриминатор может легко отличить от генерируемых нормальных данных или которые генератор изо всех сил пытается точно воспроизвести.

Трансформаторные модели

Архитектуры трансформаторов, первоначально разработанные для обработки естественного языка, были адаптированы для обнаружения аномалий во временных рядах и многомерных данных, а их механизмы внимания позволяют им захватывать зависимости на большие расстояния и сложные отношения между переменными, что делает их особенно эффективными для обнаружения тонких аномалий в высокоразмерных данных.

Гибридные и ансамблевые подходы

Модели глубокого обучения для обнаружения аномалий в целом подразделяются на четыре категории: методы, основанные на прогнозировании, реконструкции, представления и гибридные методы. Каждая категория далее подразделяется на подкатегории на основе используемых архитектур глубоких нейронных сетей. Гибридные подходы объединяют несколько методов для использования их взаимодополняющих преимуществ.

Гибридные модели глубокого обучения значительно повышают точность обнаружения и адаптивность в динамических сетевых средах. Например, сочетание статистических методов с машинным обучением может обеспечить как интерпретируемость, так и высокую точность обнаружения. Аналогично, методы ансамбля, которые агрегируют прогнозы из нескольких моделей, могут повысить надежность и уменьшить ложные срабатывания.

Статистические поддетекторы полагаются на такие показатели, как медиана отклонений, среднее значение за один час один день назад, простые и скользящие средние, стандартные отклонения, методы наименьших квадратов, гистограммы и комбинации этих.Объединив эти разнообразные подходы, гибридные системы могут адаптироваться к различным типам аномалий и характеристикам данных.

Парадигмы обучения при обнаружении аномалий

Выбор парадигмы обучения существенно влияет на конструкцию и производительность систем обнаружения аномалий.Различные парадигмы подходят для разных сценариев на основе наличия маркированных данных и характера обнаруживаемых аномалий.

Надзорное обучение

Надзорный метод использует отдельный метод изучения границ между аномальными и нормальными данными, который основан на всех метках в обучающем наборе. Он может определить соответствующее пороговое значение, которое будет использоваться для классификации всех меток времени как аномальных, если оценка аномалии, присвоенная этим меткам времени, превышает порог. Проблема этого метода заключается в том, что он не применим ко многим реальным приложениям, потому что аномалии часто неизвестны или неправильно помечены.

Контролируемые подходы рассматривают обнаружение аномалий как проблему классификации, требующую помеченных примеров как нормальных, так и аномальных данных. Хотя это может достичь высокой точности, когда достаточно помеченных данных доступно, получение помеченных данных об аномалиях часто дорого, отнимает много времени или непрактично. Кроме того, контролируемые модели могут изо всех сил пытаться обнаружить новые типы аномалий, не представленных в данных обучения.

Неконтролируемое обучение

Неконтролируемый подход не использует ярлыки и не делает различий между наборами данных обучения и тестирования. Эти методы являются наиболее гибкими, поскольку они полагаются исключительно на внутренние особенности данных. Неконтролируемые методы являются наиболее распространенным подходом для обнаружения аномалий, поскольку они не требуют меченых данных и могут обнаруживать ранее неизвестные типы аномалий.

Неконтролируемые методы работают, изучая структуру нормальных данных и выявляя точки, которые не соответствуют этой изученной структуре. Это делает их особенно ценными в сценариях, где аномалии редки, разнообразны или развиваются с течением времени. Однако неконтролируемые методы могут давать больше ложных срабатываний, чем контролируемые подходы, и требуют тщательной настройки порогов чувствительности.

Полуконтролируемое обучение

Полуконтролируемое обучение представляет собой промежуточную точку между контролируемым и неконтролируемым подходами. Как правило, эти методы обучаются только на нормальных данных, обучаясь распознавать, как выглядит нормальное поведение. Во время вывода любые данные, которые значительно отклоняются от этого изученного нормального поведения, помечаются как аномальные.

Этот подход особенно практичен, поскольку получение примеров нормального поведения обычно намного проще, чем сбор исчерпывающих примеров всех возможных аномалий.Одноклассные SVM и автокодировщики обычно используются в сценариях обнаружения аномалий с полуконтролируемым управлением.

Самоконтролируемое обучение

Самоконтролируемое обучение создает псевдомаркировки из самих данных, позволяя модели изучать полезные представления без ручной маркировки.Для обнаружения аномалий самоконтролируемые методы могут включать прогнозирование будущих значений во временном ряду, реконструкцию замаскированных частей данных или обучение различать различные преобразования одних и тех же данных.

Эти подходы приобрели популярность, поскольку они могут использовать большие объемы немаркированных данных для изучения надежных представлений, которые полезны для обнаружения аномалий. Самоконтролируемая предварительная подготовка с последующей тонкой настройкой на конкретную задачу обнаружения аномалий показала многообещающие результаты в различных областях.

Метрики оценки для обнаружения аномалий

Оценка систем обнаружения аномалий представляет собой уникальные проблемы по сравнению со стандартными задачами классификации. Оценка производительности моделей обнаружения аномалий не так проста, как другие контролируемые проблемы обучения, где вы можете просто сравнить предсказанные метки с истинными метками. Крайне несбалансированный характер проблем обнаружения аномалий - где аномалии редки по сравнению с нормальными случаями - требует тщательного выбора соответствующих метрик.

Точность, отзыв и F1-Score

Производительность обнаружения аномалий обычно оценивается с использованием таких показателей, как точность, отзыв, оценка F1 и показатели площади под кривой. Точность измеряет долю правильно идентифицированных аномалий из всех обнаруженных случаев, помогая количественно оценить ложные срабатывания. Напомню, вычисляет долю истинных аномалий, успешно обнаруженных, выделяя пропущенные случаи. Оценка F1 уравновешивает эти два, принимая их гармоническое среднее, которое полезно, когда существует дисбаланс классов.

Точность измеряет долю обнаруженных аномалий, которые на самом деле являются истинными аномалиями, в то время как вспоминаемость измеряет долю истинных аномалий, которые обнаруживаются моделью.Высокая точность означает, что модель не генерирует много ложных срабатываний, в то время как высокая вспоминаемость означает, что модель не упускает много истинных аномалий.

Взаимосвязь между точностью и отзывом предполагает важные компромиссы:

  • Высокая точность, низкий отзыв: Система консервативна, помечая только самые очевидные аномалии. Это минимизирует ложные тревоги, но может пропустить тонкие аномалии.
  • Вспомним, Нижняя точность: Система чувствительна, улавливая большинство аномалий, но потенциально генерируя много ложных срабатываний.
  • Сбалансированный F1-Score: Предоставляет единую метрику, которая учитывает как точность, так и отзыв, что полезно для сравнения различных моделей.

Точность и отзыв часто являются компромиссами, а это означает, что улучшение одного может снизить другой. Поэтому вы можете использовать одну метрику, которая объединяет оба, например, показатель F1, который является гармоничным средним значением точности и отзыва.

РПЦ-АУЦ и PR-АУЦ

РПЦ-АУЦ выстраивает подлинную положительную ставку против ложноположительной ставки по всем пороговым значениям классификации, обеспечивая совокупное представление о результатах деятельности. PR-АУЦ фокусируется на точности и компромиссах при отзыве, что делает его более информативным для сильно несбалансированных наборов данных, где аномалии встречаются редко.

Кривая ROC (Receiver Operating Characteristic) отображает подлинную положительную ставку против ложноположительной скорости при различных пороговых настройках. Область под кривой ROC (ROC-AUC) обеспечивает единую оценку, суммирующую производительность по всем пороговым значениям. Однако ROC-AUC может вводить в заблуждение для сильно несбалансированных наборов данных, поскольку придает равное значение ложноположительным и ложноотрицательным значениям.

Кривая прецизионного вызова и соответствующая ей область под кривой (PR-AUC) часто более информативны для обнаружения аномалий. Кривая точного вызова и AP более подходят для проблем обнаружения аномалий с редкими аномалиями или несбалансированными данными, поскольку они больше фокусируются на положительном классе (аномалии), чем на отрицательном классе (нормальные случаи).

Серия-время-специфические метрики

Стандартные метрики, предназначенные для точечной классификации, могут быть недостаточными для обнаружения аномалий временных рядов. Для оценки методов обнаружения аномалий в данных временных рядов подходят временные ряды с точностью и запоминанием. В данных временных рядов аномалия соответствует ряду экземпляров. Обычные метрики, однако, упускают из виду эту характеристику, поэтому страдают от проблемы придания высокой оценки методу, который обнаруживает только длинную аномалию.

Существующие точные и запоминающие метрики, которые были разработаны для оценки алгоритма обнаружения точечных аномалий, плохо оценивают качество результатов для аномалий временных рядов. На самом деле это очень важная проблема в области обнаружения аномалий временных рядов, и она не была рассмотрена в литературе, за исключением очень специфического контекста.

Оценка аномалий с использованием ближайшего времени (PATE) - это новая метрика оценки, которая включает временную связь между интервалами прогнозирования и аномалии. PATE использует основанный на близости вес, учитывая буферные зоны вокруг интервалов аномалии, что позволяет более подробно и обоснованно оценивать обнаружение. Используя эти веса, PATE вычисляет взвешенную версию области под кривой точности и отзыва.

Домен-специфические метрики

Ложная положительная скорость имеет решающее значение в таких приложениях, как медицинская диагностика, где неправильное помечение здоровых пациентов как аномалии тратит ресурсы. Среднее время для обнаружения измеряет, как быстро аномалии идентифицируются в данных временных рядов, таких как мониторинг сервера.

Различные приложения отдают приоритет различным аспектам производительности:

  • Обнаружение мошенничества: Высокий отзыв имеет решающее значение для выявления мошеннических транзакций, даже ценой некоторых ложных срабатываний, которые могут быть рассмотрены вручную.
  • Контроль качества производства: Точность становится критической, когда ложные тревоги могут излишне останавливать производство.
  • Безопасность сети: Баланс между обнаружением угроз (вызов) и предотвращением усталости от ложных срабатываний (точность).
  • Предсказательное обслуживание: Раннее обнаружение (время выполнения) и задержка обнаружения являются важными показателями наряду со стандартными показателями точности.

Парадокс точности

Представьте себе, что вы пытаетесь обнаружить очень редкую опухоль головного мозга у пациентов, которая встречается только у 1 из 100 000. По умолчанию вы можете предсказать «нет опухоли головного мозга» для каждого человека и быть 99,9% точным в то время. Однако ваша модель не будет полезна. Учитывая данные о дисбалансе, оценки производительности на основе только точности недостаточно - это известно как «парадокс точности», и выбор более интеллектуальных показателей для оценки ваших моделей очень важен.

Этот парадокс подчеркивает, почему одна лишь точность недостаточна для оценки систем обнаружения аномалий. Модель, которая просто предсказывает «нормальность» для всех случаев, может достичь очень высокой точности в несбалансированных наборах данных, будучи совершенно бесполезной для обнаружения аномалий. Вот почему метрики, которые специально ориентированы на класс меньшинств (аномалии), необходимы.

Реальные приложения для обнаружения аномалий

Обнаружение аномалий нашло применение практически в каждой отрасли, обеспечивая ценность путем выявления необычных шаблонов, которые указывают на проблемы, возможности или угрозы.Универсальность методов обнаружения аномалий позволяет адаптировать их к различным областям с различными характеристиками данных и требованиями.

Финансовые услуги и обнаружение мошенничества

Финансовый сектор одним из первых начал применять технологию обнаружения аномалий. Системы обнаружения мошенничества с кредитными картами анализируют схемы транзакций для выявления подозрительных действий в режиме реального времени. При обнаружении мошенничества высокий уровень отзыва гарантирует, что большинство мошеннических транзакций пойманы, даже если некоторые законные помечены ошибочно.

Системы обнаружения финансовых аномалий отслеживают различные показатели, в том числе:

  • Необычные суммы транзакций или частоты
  • Сделки из неожиданных географических мест
  • Нетипичные схемы расходов по сравнению с историческим поведением
  • Подозрительные последовательности транзакций, которые могут указывать на поглощение счета
  • Манипуляции на рынке и инсайдерские торговые модели

Современные системы обнаружения мошенничества используют ансамбльные методы, объединяющие несколько алгоритмов для достижения высоких показателей обнаружения при минимизации ложных срабатываний, которые могут причинить неудобства законным клиентам. Модели машинного обучения постоянно адаптируются к развивающейся тактике мошенничества, обучаясь на новых моделях по мере их появления.

Кибербезопасность и обнаружение сетевых вторжений

Методы, основанные на аномалиях, особенно важны для обнаружения скрытых и атак нулевого дня, которые уклоняются от традиционной защиты. Системы обнаружения вторжений в сеть (NIDS) используют обнаружение аномалий для выявления вредоносных действий, попыток несанкционированного доступа и нарушений безопасности в компьютерных сетях.

Продвинутые модели используют возможности глубокого обучения для выявления и изучения тонких шаблонов в данных, что позволяет точно идентифицировать и раннее предупреждение аномального поведения в различных областях, таких как мониторинг финансовых транзакций, обнаружение угроз кибербезопасности, прогнозирование технического обслуживания промышленного оборудования и мониторинг здравоохранения.

Приложения кибербезопасности для обнаружения аномалий включают:

  • Анализ сетевого трафика: Обнаружение необычных закономерностей в сетевом трафике, которые могут указывать на распределенные атаки типа «отказ в обслуживании» (DDoS), эксфильтрацию данных или передачу команд и управления.
  • Пользовательская аналитика поведения: Идентификация скомпрометированных учетных записей путем обнаружения отклонений от нормальных моделей поведения пользователей.
  • Обнаружение вредоносных программ: Распознавание вредоносного программного обеспечения на основе поведенческих моделей, а не известных сигнатур.
  • Обнаружение угроз: Идентификация сотрудников или подрядчиков, занимающихся несанкционированной или подозрительной деятельностью.

Рамки Ensemble интегрируют несколько парадигм обучения (XGBoost, Random Forest, GNN, LSTM и Autoencoder) для повышения производительности обнаружения и обеспечения устойчивости в различных операционных настройках. Этот многоуровневый подход помогает решить проблему обнаружения как известных шаблонов атак, так и новых эксплойтов нулевого дня.

Промышленное производство и контроль качества

Почти 85% опрошенных компаний заявили, что они изучают технологии обнаружения аномалий для своих промышленных аномалий изображения. Производственные среды генерируют огромные объемы данных датчиков из производственного оборудования, что делает их идеальными кандидатами для автоматического обнаружения аномалий.

Точность становится критически важной в таких сценариях, как контроль качества производства, где ложные тревоги могут неоправданно остановить производство.

  • Обнаружение дефектов: Выявление производственных дефектов в продуктах с использованием систем визуального контроля, основанных на компьютерном зрении и глубоком обучении.
  • Предиктивное техническое обслуживание: Обнаружение ранних признаков деградации или отказа оборудования путем мониторинга вибрации, температуры, давления и других показаний датчиков.
  • Мониторинг процессов: Обеспечение того, чтобы производственные процессы оставались в пределах приемлемых параметров и выявление отклонений, которые могут повлиять на качество продукции.
  • Аномалии цепочки поставок: Выявление сбоев, задержек или нарушений в работе цепочки поставок.

Методы обнаружения аномалий промышленного зрения на основе глубокого обучения охватывают пять парадигм обучения: полностью контролируемое, полуконтролируемое, слабо контролируемое, самоконтролируемое и неконтролируемое обучение. Эти системы могут обнаруживать тонкие дефекты, которые могут быть упущены инспекторами-людьми при работе на скоростях производственной линии.

Здравоохранение и медицинская диагностика

Медицинские приложения для выявления аномалий охватывают от мониторинга пациентов до диагностики заболеваний и выявления вспышек. Системы обнаружения медицинской аномалии помогают идентифицировать:

  • Мониторинг пациентов: Обнаружение аномальных жизненно важных признаков или физиологических измерений, которые могут указывать на ухудшение состояния пациентов в отделениях интенсивной терапии.
  • Медицинская визуализация: Выявление аномальных закономерностей в рентгеновских лучах, МРТ, КТ и других медицинских изображениях, которые могут указывать на опухоли, поражения или другие патологии.
  • Обнаружение вспышек болезни: Мониторинг эпидемиологических данных для выявления необычных закономерностей, которые могут указывать на возникающие вспышки заболеваний.
  • Мониторинг клинических испытаний: Обнаружение нежелательных явлений или неожиданных ответов у участников клинических испытаний.
  • Мошенничество в здравоохранении: Выявление мошеннических страховых требований или нарушений выставления счетов.

Высокие ставки в здравоохранении делают как ложные срабатывания, так и ложные срабатывания особенно дорогостоящими. Ложные срабатывания могут привести к ненужным процедурам и беспокойству пациента, в то время как ложные срабатывания могут привести к пропущенным диагнозам с потенциально опасными для жизни последствиями. Это требует тщательной калибровки порогов обнаружения и часто привлекает экспертов-людей в цикл принятия решений.

Операции в области информационных технологий

Телеметрические системы играют важную роль в большинстве отраслей и мировой экономики, поскольку они используются для сбора и анализа данных из производственных и сервисных систем в режиме реального времени для установления и поддержания прибыльной и доступной эксплуатации. Например, телеметрические системы могут применяться для серверных ферм, на которых размещены многие текущие и будущие экземпляры программного обеспечения для информационно-коммуникационных технологий для предоставления услуг клиентам в различных вертикальных промышленных секторах.

Быстрое и точное обнаружение аномалий необходимо для операторов, чтобы принять меры, когда происходят аномалии.

  • Мониторинг серверов и инфраструктуры: Обнаружение ухудшения производительности, истощения ресурсов или сбоев системы в центрах обработки данных и облачной инфраструктуре.
  • Мониторинг производительности приложений: Идентификация аномалий в поведении приложений, времени отклика, частоте ошибок и показателях пользовательского опыта.
  • Анализ логов: Автоматическое обнаружение необычных шаблонов в системных журналах, которые могут указывать на ошибки, проблемы безопасности или операционные проблемы.
  • Планирование потенциала: Выявление необычных моделей роста или потребления ресурсов, которые могут потребовать масштабирования инфраструктуры.

Предлагаемые методы демонстрируют сопоставимую производительность обнаружения с точки зрения точности, напомним, F-оценки и MCC-метрики для самых современных подходов. В то же время предлагаемые алгоритмы имеют наименьшую максимальную задержку обнаружения, что является определенным преимуществом для практических приложений. Низкая задержка обнаружения имеет решающее значение в ИТ-операциях, где быстрое реагирование может предотвратить сбои в обслуживании.

Интернет вещей (IoT) и интеллектуальные системы

Распространение устройств IoT создало новые возможности и проблемы для обнаружения аномалий. Умные города, подключенные транспортные средства, промышленные IoT и потребительские устройства IoT генерируют непрерывные потоки данных датчиков, которые требуют мониторинга аномалий.

Приложения для обнаружения аномалий IoT включают:

  • Умная домашняя безопасность: Обнаружение необычных моделей поведения устройств умного дома, которые могут указывать на нарушения безопасности или сбои.
  • Экологический мониторинг: Выявление аномальных показаний от датчиков окружающей среды, контролирующих качество воздуха, качество воды или погодные условия.
  • Умное управление сетями: Обнаружение аномалий в моделях энергопотребления, стабильности сети или производительности оборудования.
  • Диагностика подключенных транспортных средств: Мониторинг данных датчиков транспортных средств для выявления потенциальных механических проблем или небезопасных условий вождения.

IoT-среды представляют уникальные проблемы, включая ограничения ресурсов на периферийных устройствах, прерывистую связь и необходимость обработки в режиме реального времени. Легкие алгоритмы обнаружения аномалий, оптимизированные для периферийных вычислений, становятся все более важными в этих сценариях.

Энергетика и коммунальные услуги

Применение в энергетическом секторе методов обнаружения аномалий помогает оптимизировать операции, предотвращать сбои и выявлять кражи или мошенничество.

  • Мониторинг электростанций: Обнаружение аномалий в производительности турбины, выходе генератора или системах охлаждения, которые могут указывать на надвигающиеся сбои.
  • Мониторинг трубопроводов: Выявление утечек, аномалий давления или нарушений потока в нефте- и газопроводах.
  • Обнаружение кражи энергии: Обнаружение необычных моделей потребления, которые могут указывать на подделку счетчика или кражу электричества.
  • Прогнозирование возобновляемой энергии: Выявление аномалий в производительности солнечных панелей или ветряных турбин, которые могут указывать на потребности в обслуживании.

Проблемы и соображения при обнаружении аномалий

Хотя обнаружение аномалий оказалось ценным во многих областях, внедрение эффективных систем включает в себя навигацию по нескольким значительным проблемам. Понимание этих проблем имеет важное значение для разработки надежных и практических решений для обнаружения аномалий.

Качество и доступность данных

Эффективность любой системы обнаружения аномалий в значительной степени зависит от качества и количества имеющихся данных. Общие проблемы, связанные с данными, включают:

  • Недостаточные данные обучения: Многие сценарии обнаружения аномалий не имеют достаточных исторических данных, особенно для редких типов аномалий.
  • Ограничение количества маркированных аномалий: Получение маркированных примеров аномалий часто является дорогостоящим или непрактичным, что ограничивает использование контролируемых подходов.
  • Дисбаланс данных: Крайняя редкость аномалий по сравнению с нормальными экземплярами создает серьезный дисбаланс классов, который может привести к смещению моделей.
  • Шумные данные: Ошибки датчиков, шум измерения и проблемы с качеством данных могут затруднить различие истинных аномалий от артефактов данных.
  • Развивающиеся распределения данных: Нормальные модели поведения часто меняются с течением времени, требуя от моделей адаптации к дрейфу концепций.

Высокоразмерные данные

По мере роста размеров и сложности целевых систем методы сталкиваются с проблемами, в частности с их ограничениями в обработке многомерных данных и отсутствием маркированных аномалий.

  • Проклятие размерности делает методы, основанные на расстоянии, менее эффективными по мере увеличения размеров.
  • Вычислительная сложность растет с количеством функций, что затрудняет обнаружение в реальном времени.
  • Визуализация и интерпретация аномалий становятся все более сложными в многомерных пространствах.
  • Риск переобучения увеличивается с увеличением размерности, особенно когда данные обучения ограничены.

Методы уменьшения размеров и методы выбора признаков могут помочь решить эти проблемы, но они должны быть тщательно применены, чтобы избежать потери информации, имеющей отношение к обнаружению аномалий.

Временные зависимости и контекст

Задача обнаружения аномалий многомерных временных рядов заключается в необходимости одновременного рассмотрения как динамических изменений вдоль временного измерения, так и взаимосвязи между наблюдениями. Для данных временных рядов требуются модели, которые могут фиксировать:

  • Временные модели и зависимости в разных временных масштабах
  • Сезонные вариации и периодическое поведение
  • Изменения тренда и долгосрочная эволюция
  • Взаимосвязи между множественными переменными временных рядов
  • Контекстно-зависимые аномалии, которые являются нормальными в некоторых ситуациях, но аномальными в других.

Интерпретируемость и объяснимость

Многие передовые методы обнаружения аномалий, особенно подходы к глубокому обучению, работают как черные ящики, что затрудняет понимание того, почему конкретный случай был помечен как аномальный.

  • Операторы могут не доверять или действовать в соответствии с предупреждениями, которые они не понимают.
  • Отладка и совершенствование системы становится более сложным без понимания процесса принятия решений.
  • Регулятивные требования в некоторых областях требуют объяснимых решений.
  • Анализ причин корня требует понимания того, какие особенности или закономерности вызвали обнаружение аномалии.

Объясняемые методы ИИ, такие как SHAP (SHapley Additive exPlanations) и механизмы внимания, могут помочь дать представление о модельных решениях, но они добавляют сложность и вычислительные накладные расходы.

Требования к обработке в реальном времени

Многие приложения требуют обнаружения аномалий для работы в режиме реального времени или почти в реальном времени, обработки непрерывных потоков данных с минимальной задержкой. Это создает проблемы, в том числе:

  • Ограничения вычислительной эффективности, ограничивающие сложность модели
  • Ограничения памяти для хранения исторических данных и параметров модели
  • Необходимость постепенного обучения для адаптации к новым шаблонам без переподготовки с нуля
  • Балансировка скорости обнаружения с точностью

Ложные позитивные сигналы и тревога

Одна из наиболее значительных практических проблем в обнаружении аномалий - управление ложными срабатываниями. Слишком много ложных срабатываний может привести к усталости от тревоги, когда операторы начинают игнорировать предупреждения, потенциально пропуская подлинные аномалии. Стратегии управления ложными срабатываниями включают:

  • Тщательная настройка порога на основе толерантности конкретного приложения к ложным срабатываниям и ложным отрицательным эффектам
  • Методы сборки, которые требуют согласования нескольких детекторов перед поднятием тревоги
  • Контекстная фильтрация, которая подавляет оповещения во время известных окон технического обслуживания или ожидаемых необычных условий
  • Системы определения приоритетов, которые ранжируют предупреждения по степени тяжести или уверенности
  • Циклы обратной связи, которые позволяют операторам отмечать ложные срабатывания, позволяя системе учиться и совершенствоваться.

Противостоящие атаки

В критически важных для безопасности приложениях противники могут попытаться уклониться от систем обнаружения аномалий, тщательно создав свои атаки, чтобы казаться нормальными. Эта игра в кошки-мышки требует, чтобы системы обнаружения аномалий были надежными против враждебных манипуляций, что является активной областью исследований.

Лучшие практики для внедрения систем обнаружения аномалий

Успешное внедрение методов обнаружения аномалий в производственных условиях требует тщательного внимания как к техническим, так и к оперативным аспектам.

Начните с четких целей

Перед выбором методов или моделей построения четко определите, что представляет собой аномалия в вашем конкретном контексте и какие действия следует предпринять при обнаружении аномалий.

  • Какие аномалии наиболее важны для обнаружения?
  • Каков приемлемый компромисс между ложными положительными и ложными отрицательными?
  • Как быстро должны быть обнаружены аномалии?
  • Какие ресурсы имеются для расследования сообщений?
  • Каковы последствия пропущенных обнаружений по сравнению с ложными сигналами тревоги?

Понимать ваши данные

Тщательное изучение и понимание данных имеет важное значение перед внедрением обнаружения аномалий.

  • Анализ распределения данных и выявление закономерностей в нормальном поведении
  • Понимание временных моделей, сезонности и тенденций
  • Выявление и обработка недостающих данных, выбросов и проблем качества данных
  • Распознавание корреляций и зависимостей между переменными
  • Документирование известных аномалий и их характеристик

Выберите подходящие методы

Необходимо рассмотреть несколько аспектов выбора и реализации подходящей методики обнаружения аномалий, например характеристики потока сенсорных данных, тип аномалии и наличие данных обучения.

  • Характеристики данных (размерность, временная структура, тип данных)
  • Наличие маркированных данных
  • Вычислительные ресурсы и требования к задержкам
  • Требования к интерпретируемости
  • Характер аномалий, которые нужно обнаружить

Часто, начиная с более простых методов и постепенно увеличивая сложность по мере необходимости, более эффективно, чем немедленное развертывание сложных моделей глубокого обучения.

Проведение тщательной оценки

Комплексная оценка имеет решающее значение для понимания эффективности системы и определения областей для улучшения:

  • Используйте несколько дополнительных метрик, а не полагаться на одну меру.
  • Оценка эффективности на реалистичных тестовых данных, которые включают различные типы аномалий
  • Рассмотрим временные ряды метрик при работе с временными данными
  • Проведите перекрестную валидацию, чтобы обеспечить правильное обобщение моделей
  • Постоянно отслеживать производительность в производстве и отслеживать метрические тенденции с течением времени.

Построение в адаптивности

Нормальные модели поведения часто развиваются с течением времени, поэтому системы обнаружения аномалий должны адаптироваться:

  • Механизмы внедрения периодической переподготовки моделей с использованием последних данных
  • Используйте онлайн-подходы к обучению, которые могут постепенно обновлять модели
  • Монитор дрейфа концепции и триггерной переподготовки при обнаружении
  • Поддерживать контроль версий для моделей и отслеживать производительность в разных версиях
  • Проектирование систем для изящного управления сдвигами распределения

Включите обратную связь с человеком

Человеческий опыт остается ценным в системах обнаружения аномалий:

  • Предоставить операторам механизмы для маркировки ложных срабатываний и ложных срабатываний
  • Используйте обратную связь для постоянного улучшения производительности модели
  • Реализуйте активные подходы к обучению, которые запрашивают ярлыки для наиболее информативных примеров.
  • Автоматическое обнаружение с человеческим суждением для принятия критических решений
  • Документировать и делиться знаниями о домене аномалий

Обеспечить оперативную надежность

Системы обнаружения аномалий производства должны быть надежными и обслуживаемыми:

  • Внедрение комплексной системы регистрации и мониторинга самой системы обнаружения
  • Дизайн для отказоустойчивости и грациозной деградации
  • Установить четкие процедуры эскалации для различных типов аномалий.
  • Поведение системы документов, пороговые значения и решения о конфигурации
  • План обновления модели и обслуживания системы с минимальными сбоями

Будущие направления и новые тенденции

Область обнаружения аномалий продолжает быстро развиваться, чему способствуют достижения в области машинного обучения, увеличение объемов данных и новые области применения. Несколько тенденций формируют будущее технологии обнаружения аномалий.

Передовые архитектуры глубокого обучения

В последнее время технологии глубокого обучения расширили область обнаружения аномалий в многомерных наборах данных. Развивающиеся архитектуры, включая трансформаторы, нейронные сети графов и модели диффузии, раздвигают границы того, что возможно в обнаружении аномалий.

Новые гибридные модели, сочетающие GAN с Variational Autoencoders или autoencoders для повышения надежности, представляют собой перспективные направления для будущих исследований. Эти гибридные подходы направлены на объединение сильных сторон различных архитектур при одновременном смягчении их индивидуальных слабых сторон.

Федеративное обучение для обнаружения конфиденциальности

Федеративное обучение обеспечивает совместный способ улучшения обнаружения аномалий с использованием распределенных источников данных и конфиденциальности данных. Этот подход позволяет организациям извлекать выгоду из коллективного обучения без обмена конфиденциальными данными, устраняя проблемы конфиденциальности, одновременно улучшая возможности обнаружения с помощью более крупных и разнообразных наборов данных обучения.

Объясняемый и интерпретируемый ИИ

Поскольку системы обнаружения аномалий используются в более критических приложениях, спрос на объяснимость продолжает расти. Будущим системам необходимо будет не только обнаруживать аномалии, но и давать четкие объяснения того, почему что-то было помечено как аномальное и какие особенности способствовали принятию решения.

Edge Computing и IoT

Распространение устройств IoT стимулирует спрос на легкие алгоритмы обнаружения аномалий, которые могут работать на устройствах с ограниченными ресурсами. Это позволяет обнаруживать в режиме реального времени с меньшими требованиями к задержке и пропускной способности, а также решать проблемы конфиденциальности путем обработки данных локально.

Мультимодальное обнаружение аномалий

Будущие системы будут все больше интегрировать несколько модальностей данных - объединение данных числовых датчиков, изображений, текста и аудио - для обеспечения более комплексного обнаружения аномалий. Этот мультимодальный подход может захватывать аномалии, которые могут быть упущены при анализе отдельных потоков данных в изоляции.

Автоматизированное машинное обучение (AutoML)

Методы AutoML делают обнаружение аномалий более доступным путем автоматизации выбора алгоритмов, разработки функций и настройки гиперпараметров. Эта демократизация обнаружения аномалий позволяет организациям без глубокого опыта машинного обучения внедрять эффективные системы обнаружения.

Обнаружение аномалии

Выходя за рамки корреляционного обнаружения, каузальные подходы направлены на понимание основных механизмов, которые генерируют аномалии. Это позволяет более надежно обнаруживать, что менее восприимчиво к ложным корреляциям и обеспечивает лучшее понимание для анализа и устранения первопричин.

Заключение

Обнаружение аномалий эволюционировало от простых статистических методов к сложным системам глубокого обучения, способным идентифицировать тонкие паттерны в сложных, высокоразмерных данных. В статье рассматриваются изменяющиеся условия методов обнаружения аномалий и подчеркивается важность продолжения исследований и инноваций. По мере того, как объемы данных продолжают расти и системы становятся более сложными, важность эффективного обнаружения аномалий будет только возрастать.

Успех в обнаружении аномалий требует понимания различных доступных методов, выбора соответствующих метрик оценки и тщательного рассмотрения конкретных требований и ограничений каждого приложения. Каждая модель обнаружения аномалий машинного обучения и глубокого обучения имеет сильные и слабые стороны, концентрируясь на точности и производительности при применении параметров качества для оценки. Ни один подход не работает лучше всего для всех сценариев, и практикующие специалисты должны сбалансировать факторы, включая точность, интерпретируемость, вычислительную эффективность и эксплуатационные требования.

Область продолжает быстро развиваться, с новыми архитектурами, методами и приложениями, появляющимися регулярно. Будущие направления исследований включают повышение производительности модели, использование нескольких методов проверки, оптимизацию использования ресурсов, создание высококачественных наборов данных и сосредоточение на реальных приложениях. Оставаясь в курсе этих разработок и следуя передовой практике для реализации, организации могут использовать возможности обнаружения аномалий для повышения безопасности, надежности, эффективности и принятия решений в своих операциях.

Независимо от того, защищаете ли вы финансовые системы от мошенничества, защищаете ли сети от киберугроз, обеспечиваете качество производства или отслеживаете критическую инфраструктуру, обнаружение аномалий предоставляет необходимые возможности для выявления необычных моделей, которые имеют наибольшее значение. По мере того, как технология продолжает созревать и становится более доступной, ее приложения расширятся в новые области, помогая организациям ориентироваться во все более сложном и богатом данными мире.

Для тех, кто хочет внедрить системы обнаружения аномалий, доступны многочисленные ресурсы и инструменты. Библиотеки с открытым исходным кодом, такие как , , , и , предоставляют реализации многих алгоритмов, обсуждаемых в этой статье. Специализированные рамки для обнаружения аномалий временных рядов и решения для доменов продолжают появляться, что облегчает, как никогда, начало работы с обнаружением аномалий в ваших собственных приложениях.