Table of Contents

Un'anomalia si riferisce ad un'osservazione che devia significativamente dal comportamento atteso in un sistema, spesso apparendo insolita, inconsistente o inaspettata. Questo potente approccio è diventato sempre più essenziale in numerose industrie e applicazioni, dalla protezione dei sistemi finanziari contro le frodi per garantire l'affidabilità delle apparecchiature industriali e la salvaguardia delle minacce di rete da parte delle infrastrutture informatiche.

Il rilevamento di anomalie è fondamentale per varie applicazioni, tra cui la sicurezza della rete, il rilevamento delle frodi, la manutenzione predittiva, la diagnosi dei guasti e il monitoraggio industriale e sanitario. Come le organizzazioni generano e raccolgono volumi sempre più grandi di dati, la capacità di identificare automaticamente i modelli insoliti è diventata indispensabile per mantenere l'efficienza operativa, la sicurezza e il controllo della qualità.

Che cosa è la rilevazione di Anomalia e perché si fa la materia?

Nonostante il fatto che gli outliers in genere costituiscono solo una piccola frazione di un dataset, sono spesso altamente cruciali perché portano informazioni importanti e possono rivelare informazioni critiche durante l'analisi. Queste anomalie possono indicare eventi critici come guasti di sistema, violazioni di sicurezza, difetti di produzione, o attività fraudolente che richiedono un'attenzione immediata.

L'importanza del rilevamento di anomalia è cresciuta esponenzialmente con la crescente complessità e volume di dati nei sistemi moderni. La rapida espansione dei dati da fonti diverse ha reso il rilevamento di anomalia sempre più essenziale per identificare osservazioni inattese che possono segnalare guasti di sistema, violazioni di sicurezza o frodi.

Tipi di anomalie

Le anomalie possono essere classificate in diversi tipi distinti in base alle loro caratteristiche e a come si manifestano nei dati. Capire questi tipi diversi è essenziale per selezionare i metodi di rilevamento appropriati:

  • Anomalie di punto:[] Punti di dati individuali che deviano significativamente dal resto del dataset. Questi sono il tipo più comune di anomalia, come una transazione insolitamente grande in un'affermazione della carta di credito o un punto improvviso nel tempo di risposta del server.
  • Anomalie contestuali:[] Punti di dati anomali in un contesto specifico ma possono essere normali in altri contesti. Ad esempio, una temperatura di 30°C potrebbe essere normale in estate ma anomala in inverno.
  • Anomalie opzionali:[] Una raccolta di punti di dati che insieme rappresentano un comportamento anomalo, anche se i singoli punti potrebbero non essere anomali da soli. Un esempio sarebbe una serie di piccole transazioni che insieme indicano attività fraudolente.
  • Anomalie di sequenza:[] Modelli in dati della serie temporale in cui la sequenza degli eventi devia dai modelli temporali attesi, particolarmente rilevanti nel monitoraggio delle applicazioni e dei sistemi di controllo dei processi.

Le anomalie dei punti, le anomalie delle sequenze e gli outlier possono manifestarsi in modo diverso attraverso diversi tipi di dati e strutture. La comprensione di queste distinzioni è essenziale per selezionare le tecniche di rilevamento delle anomalie appropriate.

Metodi e tecniche comuni per la rilevazione di anomalie

Il rilevamento di anomalie comprende una vasta gamma di metodologie, dagli approcci statistici tradizionali alle tecniche di apprendimento approfondito avanzato. Ogni metodo ha i suoi punti di forza, limitazioni e casi di utilizzo ideali. La scelta del metodo dipende da fattori quali le caratteristiche dei dati, le risorse computazionali, la disponibilità dei dati etichettati e i requisiti specifici dell'applicazione.

Metodi statistici

I metodi statistici rappresentano alcuni dei primi e più interpretabili approcci al rilevamento di anomalia, che presumono che i dati normali seguono una particolare distribuzione statistica, e le anomalie sono punti di dati che hanno bassa probabilità sotto questa distribuzione.

I metodi statistici comuni includono:

  • Z-Score Metodo:[] Identificare anomalie basate su quante deviazioni standard un punto dati è dalla media. I punti oltre una certa soglia (di solito 3 deviazioni standard) sono contrassegnati come anomalie.
  • Modelli di distribuzione gaussian:[ I dati di assume seguono una distribuzione normale e identificano i punti con una densità di probabilità bassa come anomalie.
  • Controllo di processo statistico:[] Utilizza i grafici di controllo e i test statistici per monitorare i processi e rilevare quando deviano dal comportamento previsto.
  • Decomposizione Serie Tempo:[] Separa i dati della serie temporale in trend, stagionali e componenti residui, con anomalie rilevate nel componente residuo.

I metodi statistici funzionano bene quando le distribuzioni dei dati sono ben comprese e relativamente stabili, ma possono lottare con dati ad alta dimensione o quando la distribuzione sottostante è complessa o sconosciuta.

Metodi basati sulla distanza e sulla densità

Le tecniche a distanza valutano la deviazione delle osservazioni da punti di dati rappresentativi utilizzando metriche a distanza, mentre i metodi di distribuzione si concentrano sull'identificazione delle anomalie attraverso punti con bassa probabilità. Questi approcci si basano sull'intuizione che le anomalie sono punti isolati che sono lontani dai loro vicini nello spazio delle caratteristiche.

Se un data point ha una densità significativamente inferiore rispetto alla sua zona vicina, può essere contrassegnato come un'anomalia. L'algoritmo Local Outlier Factor (LOF) è un metodo popolare basato sulla densità che confronta la densità locale di un punto con le densità dei suoi vicini per identificare gli outlier.

Le tecniche basate sulla distanza chiave e basate sulla densità includono:

  • K-Nearest Quartiere (KNN):[] Calcola la distanza dai vicini di k-nearest e punti di bandiera con distanze insolitamente grandi come anomalie.
  • Fattore di Outlier locale (LOF):[] Misura la deviazione locale di una data campione rispetto ai suoi vicini, identificando regioni di densità simile e punti che hanno densità sostanzialmente inferiore rispetto ai loro vicini.
  • DBSCAN:[]] Un algoritmo di clustering che può identificare gli outlier come punti che non appartengono a nessun cluster.

Tuttavia, poiché i sistemi target crescono in dimensioni e complessità, questi metodi incontrano sfide, in particolare le limitazioni nel trattamento dei dati multidimensionali e la mancanza di anomalie etichettate, che hanno spinto lo sviluppo di approcci di machine learning più sofisticati.

Approcci di apprendimento della macchina

I metodi di apprendimento automatico sono diventati sempre più popolari per il rilevamento di anomalie grazie alla loro capacità di apprendere modelli complessi dai dati senza richiedere una programmazione esplicita delle regole. Gli algoritmi di rilevamento di anomalie non supervisionati includono la macchina di supporto di una classe, la SVM di una classe con la Discesa di livello stocastico, la foresta di isolamento, il fattore di Outlier locale e la ripetizione di Robust.

Isolation Forest]] è particolarmente efficace per il rilevamento di anomalia. La valutazione rivela che SVM di Classe Unica, Foresta di Isolamento e Robust Covariance sono più efficaci nell'identificazione di outliers, con Isolation Forest leggermente superando gli altri algoritmi in termini di bilanciamento di precisione e richiamo.

SVM di Classe Unica[[[]] impara un limite di decisione intorno ai normali punti di dati nello spazio di funzionalità. Qualsiasi punto che cade al di fuori di questo confine viene classificato come anomalie. Questo metodo è particolarmente utile quando si dispone di dati normali solo per la formazione e la necessità di rilevare anomalie novelli.

I metodi di assemblaggio[] combinano algoritmi di rilevamento di anomalie multipli per migliorare le prestazioni e la robustezza complessive.

Metodi di apprendimento profondi

I progressi nell'apprendimento profondo hanno reso i metodi di rilevamento delle anomalie più potenti e adattabili, migliorando la loro capacità di gestire i dati ad alta dimensione e non strutturati.

Modelli di apprendimento approfonditi come Transformers, Graph Neural Networks, Variational Autoencoders, Generative Adversarial Networks e Diffusion sono adatti a rappresentare intricati, relazioni non lineari tra i vari sensori e sono abili nella cattura delle correlazioni temporali e delle dipendenze in modo efficace.

Metodi basati su autoencoder

Gli autoencoders sono reti neurali addestrate per ricostruire i dati di input. La chiave è che gli autoencoders formati su dati normali avranno un elevato errore di ricostruzione per dati anomali. I metodi basati sulla ricostruzione utilizzano un normale dataset per formare un modello che tenta di codificare i dati in uno spazio latente e quindi ricostruire i dati originali da questa rappresentazione.

Varianti di autoencoders utilizzati per il rilevamento di anomalia includono:

  • Vanilla Autoencoders:[] Architettura di base encoder-decoder che impara a comprimere e ricostruire i dati normali.
  • Autoencoders (VAEs):[ Autoencoders probabilistic che imparano una distribuzione sullo spazio latente, fornendo una migliore generalizzazione.
  • LSTM Autoencoders:[]] Usare reti di memoria a breve termine per catturare dipendenze temporali nei dati delle serie temporali, rendendoli particolarmente efficaci per il rilevamento di anomalia sequenziale.
  • Convolutional Autoencoders:[] Leva gli strati convoluzionali per rilevare anomalie nell'immagine e nei dati spaziali.

Reti adversariali Generative (GAN)

Per il rilevamento di anomalia, i GAN possono essere addestrati a generare modelli di dati normali. Le anomalie vengono quindi identificate come punti di dati che il discriminatore può facilmente distinguere dai dati normali generati, o che il generatore lotta per riprodurre con precisione.

Modelli basati su trasformatori

Le architetture trasformatrici, originariamente sviluppate per il trattamento del linguaggio naturale, sono state adattate per il rilevamento di anomalia nelle serie temporali e nei dati multivariati, i cui meccanismi di attenzione permettono loro di catturare dipendenze a lungo raggio e relazioni complesse tra variabili, rendendole particolarmente efficaci per rilevare anomalie sottili in dati ad alta dimensione.

Approcci ibridi e dell'Ensemble

I modelli di apprendimento approfondito per il rilevamento di anomalia sono ampiamente classificati in quattro categorie: metodi basati sulla previsione, basati sulla ricostruzione, basati sulla rappresentazione e ibridi. Ogni categoria è ulteriormente divisa in sottocategorie basate sulle architetture di rete neurali profonde utilizzate.

I modelli di apprendimento profondo ibrido migliorano significativamente l'accuratezza e l'adattabilità del rilevamento in ambienti di rete dinamici. Ad esempio, combinando metodi statistici con l'apprendimento automatico può fornire sia l'interpretazione che l'accuratezza di rilevamento elevata.

I sotto-detector statistici si basano su metriche come la mediana delle deviazioni, mediamente oltre un'ora un giorno fa, medie semplici e mobili, deviazioni standard, metodi minimi quadrati, istogrammi e combinazioni di questi. Combinando questi diversi approcci, i sistemi ibridi possono adattarsi a diversi tipi di anomalie e caratteristiche dei dati.

Imparare i paradigmi in Anomalia di rilevamento

La scelta del paradigma dell'apprendimento influisce significativamente sulla progettazione e sull'esecuzione dei sistemi di rilevamento delle anomalie, che si adattano a diversi scenari basati sulla disponibilità dei dati etichettati e sulla natura delle anomalie rilevate.

Apprendimento supervisionato

Il metodo supervisionato impiega un metodo distinto di apprendimento dei confini tra dati anomali e normali che si basano su tutte le etichette del set di formazione. Può determinare un valore di soglia appropriato che verrà utilizzato per classificare tutti i timestamp come anomali se il punteggio di anomalia assegnato a quei timestamp supera la soglia. Il problema con questo metodo non è applicabile a molte applicazioni reali o in quanto spesso non sono note anomalie.

Gli approcci supervisionati trattano l'individuazione di anomalia come un problema di classificazione, che richiede esempi etichettati di dati sia normali che anomali. Mentre questo può raggiungere alta precisione quando sono disponibili dati etichettati sufficienti, ottenere dati anomali etichettati è spesso costoso, che consumano tempo, o impraticabile. Inoltre, i modelli supervisionati possono lottare per rilevare nuovi tipi di anomalie non rappresentate nei dati di formazione.

Imparare senza supervisione

L'approccio non supervisionato non utilizza etichette e non fa distinzione tra dataset di formazione e test, queste tecniche sono le più flessibili in quanto si basano esclusivamente su caratteristiche intrinseche dei dati. I metodi non supervisionati sono l'approccio più comune per il rilevamento di anomalia, perché non richiedono dati etichettati e possono scoprire tipi di anomalie precedentemente sconosciuti.

I metodi non supervisionati funzionano imparando la struttura dei dati normali e identificando i punti che non si adattano a questa struttura appresa, rendendoli particolarmente preziosi in scenari in cui le anomalie sono rare, diverse o in evoluzione nel tempo. Tuttavia, i metodi non supervisionati possono produrre più falsi positivi rispetto agli approcci supervisionati e richiedono un'attenta messa a punto delle soglie di sensibilità.

Apprendimento semi-superviso

L'apprendimento semi supervisionato rappresenta un terreno intermedio tra approcci supervisionati e non supervisionati. In genere, questi metodi sono formati solo su dati normali, imparando a riconoscere che tipo di comportamento normale sembra. Durante l'inferenza, qualsiasi dato che devia significativamente da questo comportamento normale imparato è contrassegnato come anomalo.

Questo approccio è particolarmente pratico perché ottenere esempi di comportamento normale è di solito molto più facile che raccogliere esempi completi di tutte le anomalie possibili.

Imparare autonomamente

L'apprendimento auto supervisionato crea pseudo-label dai dati stessi, consentendo al modello di imparare rappresentazioni utili senza etichettare manuale.Per la rilevazione di anomalia, i metodi di auto-supervisione potrebbero comportare la predizione dei valori futuri in una serie di tempo, la ricostruzione di porzioni mascherate di dati, o l'apprendimento per distinguere tra diverse trasformazioni degli stessi dati.

Questi approcci hanno guadagnato popolarità perché possono sfruttare grandi quantità di dati non etichettati per imparare rappresentazioni robuste che sono utili per rilevare anomalie. Preformazione auto-supervisione seguita da una fine-tuning su una specifica attività di rilevamento di anomalia ha mostrato risultati promettenti in vari domini.

Misurazioni di valutazione per la rilevazione di anomalie

Valutare le prestazioni dei modelli di rilevamento di anomalia non è così semplice come altri problemi di apprendimento supervisionati, dove è possibile confrontare semplicemente le etichette prevedibili con le etichette vere. La natura altamente squilibrata dei problemi di rilevamento di anomalie, dove le anomalie sono rare rispetto alle istanze normali, richiede un'attenta selezione di metriche appropriate.

Precisione, Richiamo e F1-Score

Le prestazioni di rilevamento dell'anomalia vengono tipicamente valutate utilizzando metriche come precisione, richiamo, punteggio F1 e misure di area-under-the-curve. La precisione misura la percentuale di anomalie correttamente identificate da tutti i casi rilevati, aiutando a quantificare i falsi positivi.

La precisione misura la frazione delle anomalie rilevate che sono effettivamente vere anomalie, mentre il richiamo misura la frazione delle vere anomalie rilevate dal modello. Un'alta precisione significa che il modello non genera molti falsi positivi, mentre un alto richiamo significa che il modello non manca molte vere anomalie.

Il rapporto tra precisione e richiamo comporta importanti compromessi:

  • Alta precisione, Richiamo inferiore:[] Il sistema è conservatore, che segnala solo le anomalie più ovvie, riducendo al minimo i falsi allarmi, ma può mancare anomalie sottili.
  • Alta Richiamo, Bassa Precisione:[] Il sistema è sensibile, catturando la maggior parte delle anomalie ma potenzialmente generando molti falsi positivi.
  • Balanced F1-Score:[ Fornisce una singola metrica che considera sia la precisione che il richiamo, utile per confrontare diversi modelli.

La precisione e il richiamo sono spesso degli scambi, il che significa che migliorare uno può abbassare l'altro. Pertanto, si può desiderare di utilizzare una singola metrica che combina entrambi, come la F1-score, che è il mezzo armonico di precisione e richiamo.

ROC-AUC e PR-AUC

ROC-AUC traccia il vero tasso positivo contro il falso tasso positivo attraverso le soglie di classificazione, fornendo una visione aggregata delle prestazioni. PR-AUC si concentra sulla precisione e richiamare gli scambi, rendendolo più informativo per i set di dati altamente squilibrati dove le anomalie sono rare.

La curva del ricevitore (ROC) traccia il vero tasso positivo contro il falso tasso positivo a varie impostazioni di soglia. L'Area sotto la curva ROC (ROC-AUC) fornisce un singolo punteggio che riassume le prestazioni su tutte le soglie. Tuttavia, ROC-AUC può essere fuorviante per i dataset altamente bilanciati perché dà uguale peso a falsi positivi e falsi negativi.

La curva di Precision-Recall e la relativa Area Under the Curve (PR-AUC) sono spesso più informativi per il rilevamento di anomalia. La curva di precisione-richiamata e l'AP sono più adatti per problemi di rilevamento di anomalia con anomalie rare o dati squilibri, in quanto si concentrano più sulla classe positiva (anomalie) rispetto alla classe negativa (istanze normali).

Serie del tempo-Specifici Metrics

Le metriche standard progettate per la classificazione a punto possono essere inadeguate per il rilevamento di anomalia della serie temporale. La precisione e il richiamo delle serie temporali sono appropriati per valutare i metodi di rilevamento delle anomalie nei dati della serie temporale.

I parametri di precisione e di richiamo che sono stati progettati per la valutazione dell'algoritmo di rilevamento di anomalia del punto, fanno un povero lavoro di stima della qualità dei risultati per anomalie della serie temporale.

La valutazione anomalia della serie Time di prossimità (PATE) è una nuova metrica di valutazione che incorpora il rapporto temporale tra la previsione e gli intervalli di anomalia. PATE utilizza la ponderazione basata sulla prossimità considerando le zone tampone intorno agli intervalli di anomalia, consentendo una valutazione più dettagliata e informata di un rilevamento.

Metriche di dominio-Specifico

Il False Positive Rate è fondamentale anche in applicazioni come la diagnostica medica, dove non è corretto contrassegnare i pazienti sani come le risorse di scarto di anomalie.

Applicazioni diverse priorità diversi aspetti delle prestazioni:

  • Detezione della fraud:[] L'elevato richiamo è fondamentale per catturare transazioni fraudolente, anche a costo di alcuni falsi positivi che possono essere riesaminati manualmente.
  • Controllo di qualità di produzione:[ La precisione diventa critica dove i falsi allarmi potrebbero fermare inutilmente la produzione.
  • Sicurezza della rete:[[] L'equilibrio tra il rilevamento delle minacce (richiamare) ed evitare l'affaticamento all'erta dai falsi positivi (precisione).
  • Manutenzione predittiva:[ Il rilevamento precoce (tempo di caricamento) e il ritardo di rilevamento sono metriche importanti accanto a misure di precisione standard.

Il paradosso dell'accuratezza

Immaginate di provare a rilevare un tumore cerebrale molto raro in pazienti che si verificano solo 1 su 100.000. Per impostazione predefinita, si potrebbe prevedere "nessun tumore cerebrale" per ogni persona e essere 99,9% esatto del tempo. Tuttavia, il vostro modello non sarebbe utile. Dati di squilibrio, la valutazione delle prestazioni basate solo su accuratezza non è sufficiente - questo è conosciuto come il "paradosso di precisione", e la scelta di metriche più intelligenti per valutare i vostri modelli è molto critico.

Questo paradosso evidenzia perché l'accuratezza da sola è insufficiente per valutare i sistemi di rilevamento delle anomalie. Un modello che prevede semplicemente "normale" per tutte le istanze può raggiungere un'accuratezza molto elevata nei datasets squilibri, pur essendo completamente inutile per rilevare anomalie.

Applicazioni reali di rilevamento di anomalia

Il rilevamento di anomalie ha trovato applicazioni in quasi tutti i settori, fornendo valore identificando modelli insoliti che indicano problemi, opportunità o minacce. La versatilità delle tecniche di rilevamento di anomalia consente loro di essere adattati a domini diversi con caratteristiche e requisiti di dati variabili.

Servizi finanziari e Rilevazione delle frodi

Il settore finanziario è stato uno dei primi adottivi della tecnologia di rilevamento di anomalia. I sistemi di rilevamento delle frodi della carta di credito analizzano i modelli di transazione per identificare le attività sospette in tempo reale. Nel rilevamento delle frodi, un elevato richiamo assicura che la maggior parte delle transazioni fraudolente siano catturate, anche se alcuni legittimi sono erroneamente contrassegnati.

I sistemi di rilevamento dell'anomalia finanziaria monitorano vari indicatori tra cui:

  • Importo o frequenze di transazione insoliti
  • Transazioni da posizioni geografiche inaspettate
  • Modelli di spesa atipica rispetto al comportamento storico
  • Sequenze sospette di transazioni che potrebbero indicare il takeover del conto
  • Manipolazioni di mercato e schemi di trading insider

I moderni sistemi di rilevamento delle frodi utilizzano metodi di ensemble che combinano più algoritmi per raggiungere alti tassi di rilevamento, riducendo al minimo i falsi positivi che potrebbero inconvenienti legittimi clienti.

Rilevazione di sicurezza e di rete

I metodi basati su anomalie sono particolarmente importanti nel rilevare attacchi stealthy e zero-day che evadono le difese tradizionali. I sistemi di rilevamento delle intrusioni di rete (NIDS) utilizzano il rilevamento di anomalia per identificare attività dannose, tentativi di accesso non autorizzati e violazioni di sicurezza nelle reti di computer.

I modelli avanzati sfruttano le capacità di deep learning per identificare e imparare i modelli sottili nei dati, consentendo l'identificazione accurata e l'avvertimento precoce di comportamenti anomali in vari campi come il monitoraggio delle transazioni finanziarie, il rilevamento della minaccia di sicurezza informatica, la previsione di manutenzione delle attrezzature industriali e il monitoraggio della salute.

Le applicazioni di sicurezza informatica del rilevamento di anomalia includono:

  • Analisi del traffico di rete:[] Rilevamento di schemi insoliti nel traffico di rete che potrebbero indicare attacchi denial-of-service distribuiti (DDoS), esfiltrazione dei dati, o comunicazioni di comando e controllo.
  • User Behavior Analytics:[] Identificare account compromessi rilevando deviazioni dai normali schemi di comportamento dell'utente.
  • Detezione di malware:[ Riconoscere software dannoso basato su modelli comportamentali piuttosto che firme conosciute.
  • Insider Threat Detection:[] Identificare i dipendenti o gli appaltatori che si impegnano in attività non autorizzate o sospette.

I framework di Ensemble integrano paradigmi di apprendimento multipli (XGBost, Random Forest, GNN, LSTM e Autoencoder) per migliorare le prestazioni di rilevamento e garantire la resilienza in diverse impostazioni operative.

Produzione industriale e controllo qualità

Quasi l'85% delle aziende intervistate ha detto che stavano cercando tecnologie di rilevamento di anomalie per le loro anomalie di immagine industriali. Gli ambienti di produzione generano una grande quantità di dati dei sensori dalle apparecchiature di produzione, rendendoli i candidati ideali per il rilevamento automatico di anomalia.

La precisione diventa critica in scenari come il controllo di qualità di produzione, dove i falsi allarmi potrebbero fermare la produzione inutilmente.

  • Defetto:[] Identificare i difetti di produzione nei prodotti utilizzando sistemi di ispezione visiva alimentati da visione del computer e deep learning.
  • Manutenzione predittiva:[] Rilevamento dei primi segni di degrado o guasto delle apparecchiature monitorando le vibrazioni, la temperatura, la pressione e altre letture dei sensori.
  • Monitoraggio della procedura:[ Assicurare che i processi di produzione rimangano entro parametri accettabili e rilevando deviazioni che potrebbero influenzare la qualità del prodotto.
  • Anomalie della catena di fornitura:[] Identificare interruzioni, ritardi o irregolarità nelle operazioni della catena di fornitura.

I metodi di rilevamento di anomalia di visione industriale basati sull'apprendimento profondo coprono cinque paradigmi di apprendimento: completamente supervisionato, semi supervisionato, supervisionato, auto supervisionato e apprendimento non supervisionato, che possono rilevare difetti sottili che potrebbero essere mancati dagli ispettori umani durante l'esercizio a velocità di produzione.

Assistenza sanitaria e diagnosi medica

Le applicazioni sanitarie del rilevamento di anomalia vanno dal monitoraggio del paziente alla diagnosi e al rilevamento di malattie.

  • Monitoraggio paziente:[] Rilevazione di segni vitali anormali o misure fisiologiche che potrebbero indicare condizioni di paziente deterioramento in unità di cura intensiva.
  • Immagine medica:[] Identificare modelli anomali in raggi X, RM, TAC e altre immagini mediche che potrebbero indicare tumori, lesioni o altre patologie.
  • Rilevamento di rottura di casi:[] Monitoraggio dei dati epidemiologici per identificare i modelli insoliti che potrebbero indicare gli focolai di malattia emergenti.
  • Clinical Trial Monitoring: Rilevamento di eventi avversi o risposte inaspettate nei partecipanti alla sperimentazione clinica.
  • Raccolta di assistenza:[] Identificare le pretese di assicurazione fraudolente o le irregolarità di fatturazione.

I falsi positivi possono portare a procedure non necessarie e ansia dei pazienti, mentre i falsi negativi possono causare diagnosi non riuscite con conseguenze potenzialmente minacciose, che richiedono un'attenta calibrazione delle soglie di rilevamento e spesso comportano esperti umani nel processo decisionale.

Operazioni di tecnologia dell'informazione

I sistemi di telemetria svolgono un ruolo essenziale nella maggior parte delle industrie e nell'economia mondiale, poiché vengono utilizzati per raccogliere e analizzare i dati provenienti da sistemi di produzione e di servizio in tempo reale per la creazione e il mantenimento di un funzionamento redditizio e conveniente. Ad esempio, i sistemi di telemetria possono essere applicati per le aziende server che ospitano molte istanze software di informazione e comunicazione attuali per fornire servizi ai clienti di vari settori industriali verticali.

Il rilevamento rapido e accurato delle anomalie è essenziale per gli operatori di agire quando si verificano anomalie.

  • Monitoraggio delle infrastrutture e dell'argento:[] Rilevamento del degrado delle prestazioni, esaurimento delle risorse, o guasti del sistema nei data center e nell'infrastruttura cloud.
  • Application Performance Monitoring:[] Identificare anomalie nel comportamento delle applicazioni, tempi di risposta, tassi di errore e metriche dell'esperienza dell'utente.
  • Analisi del log:[]] Rileva automaticamente i modelli insoliti nei registri di sistema che potrebbero indicare errori, problemi di sicurezza o problemi operativi.
  • Pianificazione della capacità:[] Identificare modelli di crescita insoliti o consumo di risorse che potrebbero richiedere la scalabilità delle infrastrutture.

I metodi proposti mostrano prestazioni di rilevamento comparabili in termini di precisione, ritiri, metriche F-score e MCC agli approcci all'avanguardia. Allo stesso tempo, gli algoritmi proposti hanno il più piccolo ritardo di rilevamento massimo, che è un vantaggio definito per applicazioni pratiche. La latenza a bassa rilevazione è fondamentale nelle operazioni IT dove la risposta rapida può impedire interruzioni di servizio.

Internet delle cose (IoT) e Smart Systems

La proliferazione dei dispositivi IoT ha creato nuove opportunità e sfide per il rilevamento di anomalie. Le città intelligenti, i veicoli connessi, i dispositivi IoT industriali e i dispositivi IoT consumer generano flussi continui di dati dei sensori che richiedono il monitoraggio per le anomalie.

Le applicazioni di rilevamento di anomalia IoT includono:

  • Sicurezza domestica intelligente:[] Rilevamento di schemi insoliti nel comportamento di smart home device che potrebbero indicare violazioni di sicurezza o malfunzionamenti.
  • Monitoraggio ambientale:[] Identificare letture anomali da sensori ambientali che monitorano la qualità dell'aria, la qualità dell'acqua o le condizioni atmosferiche.
  • Gestione intelligente della griglia:[] Rilevamento delle anomalie nei modelli di consumo di energia, stabilità della griglia o prestazioni dell'attrezzatura.
  • Diagnostica del veicolo connessa:[] Monitoraggio dei dati del sensore del veicolo per rilevare potenziali problemi meccanici o condizioni di guida non sicure.

Gli ambienti IoT presentano sfide uniche, tra cui vincoli di risorse sui dispositivi edge, connettività intermittente e la necessità di un'elaborazione in tempo reale.

Energia e servizi

Le applicazioni del settore energetico del rilevamento di anomalia aiutano a ottimizzare le operazioni, prevenire i guasti e rilevare il furto o la frode:

  • Monitoraggio delle centrali:[] Rilevamento delle anomalie nelle prestazioni della turbina, nell'output del generatore o nei sistemi di raffreddamento che potrebbero indicare guasti imperfezionati.
  • Monitoraggio della pipelina:[] Identificare perdite, anomalie della pressione o irregolarità di flusso nelle tubazioni di petrolio e gas.
  • Rilevamento del furto energetico:[] Rilevamento di modelli di consumo insoliti che potrebbero indicare la manomissione del contatore o il furto di energia elettrica.
  • Renewable Energy Forecasting:[] Identificare anomalie nelle prestazioni del pannello solare o della turbina eolica che potrebbero indicare le esigenze di manutenzione.

Sfide e considerazioni nella rilevazione di anomalie

Mentre il rilevamento di anomalia ha dimostrato valore in molti ambiti, l'implementazione di sistemi efficaci comporta la navigazione di diverse sfide significative.

Qualità e disponibilità dei dati

L'efficacia di qualsiasi sistema di rilevamento delle anomalie dipende fortemente dalla qualità e dalla quantità dei dati disponibili.

  • Dati di formazione insufficienti:[ Molti scenari di rilevamento di anomalia non hanno dati storici sufficienti, in particolare per i tipi di anomalia rare.
  • La cicatrità di label:[] L'ottenimento di esempi di anomalie è spesso costoso o impraticabile, limitando l'uso di approcci supervisionati.
  • Data Imbalance:[ L'estrema rarità delle anomalie rispetto alle istanze normali crea uno squilibrio di classe grave che può bias modelli.
  • Dati di noisy:[ Gli errori del sensore, il rumore di misura e i problemi di qualità dei dati possono rendere difficile distinguere le vere anomalie dai dati artefatti.
  • Evolving Data Distributions:[ I modelli di comportamento normali cambiano spesso nel tempo, richiedendo modelli per adattarsi alla deriva del concetto.

Dati altamente dimensionali

Poiché i sistemi target crescono in dimensioni e complessità, i metodi incontrano sfide, in particolare le limitazioni nel trattamento dei dati multidimensionali e la mancanza di anomalie etichettate.

  • La maledizione della dimensionalità rende i metodi basati sulla distanza meno efficaci in quanto le dimensioni aumentano.
  • La complessità computazionale cresce con il numero di caratteristiche, rendendo il rilevamento in tempo reale più difficile.
  • La visualizzazione e l'interpretazione delle anomalie diventano più impegnative negli spazi ad alta dimensione.
  • Il rischio di sovraccarico aumenta con la dimensionalità, in particolare quando i dati di formazione sono limitati.

Le tecniche di riduzione della dimensione e i metodi di selezione delle caratteristiche possono aiutare ad affrontare queste sfide, ma devono essere applicate con attenzione per evitare di perdere informazioni rilevanti per il rilevamento di anomalia.

Dipendenze temporanee e contesto

La sfida del rilevamento di anomalia della serie temporale multivariata è la necessità di considerare sia i cambiamenti dinamici lungo la dimensione temporale che le interrelazioni tra osservazioni contemporaneamente.

  • Modelli e dipendenze temporali in diverse scale temporali
  • Variazioni stagionali e comportamenti periodici
  • Cambiamenti di tendenza e evoluzione a lungo termine
  • Rapporti tra variabili di serie di tempo multiple
  • Anomalie contesto-dipendenti che sono normali in alcune situazioni ma anomale in altre

Interpretabilità e Spiegabilità

Molti metodi avanzati di rilevamento dell'anomalia, particolarmente approcci di apprendimento profondo, operano come scatole nere, rendendo difficile capire perché un'istanza particolare è stata contrassegnata come anomala.

  • Gli operatori non possono fidarsi o agire in avvisi che non capiscono.
  • Il debug e il miglioramento del sistema diventa più difficile senza capire il suo processo decisionale.
  • Requisiti normativi in alcuni domini richiedono decisioni spiegabili.
  • L'analisi della causa della radice richiede la comprensione di quali caratteristiche o modelli ha innescato il rilevamento dell'anomalia.

Tecniche di AI spiegabili come SHAP (SHapley Additive exPlanations) e meccanismi di attenzione possono aiutare a fornire informazioni sulle decisioni del modello, ma aggiungono complessità e sovraccarico computazionale.

Requisiti di elaborazione in tempo reale

Molte applicazioni richiedono un rilevamento di anomalia per operare in tempo reale o in tempo prossimo, elaborando flussi di dati continui con latenza minima.

  • Limiti di efficienza computazionali che limitano la complessità del modello
  • Limitazioni di memoria per la memorizzazione di dati storici e parametri di modello
  • La necessità di un apprendimento incrementale per adattarsi a nuovi modelli senza riqualificarsi da zero
  • Velocità di rilevamento di bilanciamento con precisione

Falsi Positivi e Alert Fatigue

Una delle sfide pratiche più significative nel rilevamento di anomalia è la gestione di falsi positivi. Troppi falsi allarmi possono portare ad allertare la fatica, dove gli operatori iniziano a ignorare gli avvisi, potenzialmente mancanti anomalie genuine.

  • Attenta regolazione della soglia basata sulla tolleranza specifica dell'applicazione per i falsi positivi contro i falsi negativi
  • Metodi di Ensemble che richiedono più rivelatori di concordare prima di sollevare un avviso
  • Filtro contestuale che sopprime gli avvisi durante le finestre di manutenzione note o condizioni insolite previste
  • Sistemi di preconferenza che si verificano per gravità o fiducia
  • I loop di feedback che permettono agli operatori di segnare falsi positivi, consentendo al sistema di imparare e migliorare

Attacco avversario

Nelle applicazioni critiche alla sicurezza, gli avversari possono tentare di eludere i sistemi di rilevamento delle anomalie, creando con attenzione i loro attacchi per apparire normali. Questo gioco di gatto e mouso richiede sistemi di rilevamento delle anomalie per essere robusti contro la manipolazione avversaria, che è un'area attiva di ricerca.

Migliori Pratiche per l'attuazione di sistemi di rilevamento di anomalia

L'implementazione di un rilevamento di anomalie negli ambienti produttivi richiede un'attenta attenzione sia a considerazioni tecniche che operative, che possono contribuire a garantire sistemi di rilevamento di anomalia efficaci e manutenbili.

Inizia con obiettivi chiari

Prima di selezionare metodi o modelli di costruzione, definire chiaramente ciò che costituisce un'anomalia nel vostro contesto specifico e quali azioni dovrebbero essere intraprese quando vengono rilevate anomalie.

  • Quali tipi di anomalie sono più importanti da rilevare?
  • Qual è il compromesso accettabile tra falsi positivi e falsi negativi?
  • Quanto velocemente devono essere rilevate anomalie?
  • Quali risorse sono disponibili per l'indagine sugli avvisi?
  • Quali sono le conseguenze delle rilevazioni mancate rispetto ai falsi allarmi?

Capire i dati

L'esplorazione e la comprensione dei dati sono essenziali prima di implementare il rilevamento di anomalie, che include:

  • Analisi delle distribuzioni dei dati e dei modelli di identificazione nel comportamento normale
  • Comprendere modelli temporali, stagionalità e tendenze
  • Identificare e gestire i dati mancanti, i outlier e i problemi di qualità dei dati
  • Riconoscere le correlazioni e le dipendenze tra variabili
  • Documentazione delle anomalie note e delle loro caratteristiche

Scegliere i metodi appropriati

Diversi aspetti devono essere considerati come scegliere e implementare una tecnica di rilevamento anomalia adeguata, come le caratteristiche del flusso di dati sensoriali, il tipo di anormalità e la disponibilità dei dati di formazione.

  • Caratteristiche dei dati (dimensionalità, struttura temporale, tipo di dati)
  • Disponibilità di dati etichettati
  • Risorse computazionali e requisiti di latenza
  • Requisiti di pregibilità
  • La natura delle anomalie che devi rilevare

Spesso, a partire da metodi più semplici e gradualmente aumentando la complessità come necessario è più efficace che distribuire immediatamente sofisticati modelli di apprendimento profondo.

Valutazione robusta dell'esecuzione

La valutazione completa è fondamentale per comprendere le prestazioni del sistema e individuare le aree per il miglioramento:

  • Utilizzare metriche complementari multiple piuttosto che affidarsi a una singola misura
  • Valutare le prestazioni sui dati di test realistici che includono diversi tipi di anomalia
  • Considerare le metriche specifiche della serie temporale quando si lavora con i dati temporali
  • Eseguire la valutazione incrociata per garantire modelli generalizzando bene
  • Monitorare costantemente le prestazioni in produzione e monitorare le tendenze metriche nel tempo

Costruisci in Adaptability

I modelli di comportamento normali si evolvono spesso nel tempo, quindi i sistemi di rilevamento di anomalia devono adattarsi:

  • Meccanismi di implementazione per la riformazione periodica dei modelli con i dati recenti
  • Utilizzare approcci di apprendimento online che possono aggiornare i modelli in modo incrementale
  • Monitorare la deriva del concetto e attivare la riqualifica quando rilevato
  • Mantenere il controllo della versione per i modelli e le prestazioni della pista in tutte le versioni
  • Sistemi di progettazione per gestire con grazia i turni di distribuzione

Incorporare il feedback umano

L'esperienza umana rimane preziosa nei sistemi di rilevamento di anomalie:

  • Fornire meccanismi per gli operatori di etichettare falsi positivi e falsi negativi
  • Utilizzare feedback per migliorare continuamente le prestazioni del modello
  • Implementare approcci di apprendimento attivo che richiedono etichette per gli esempi più informativi
  • Combinare il rilevamento automatizzato con il giudizio umano per decisioni critiche
  • Documento e condivisione delle conoscenze di dominio sui modelli di anomalia

Assicurare Robustezza Operativa

I sistemi di rilevamento anomalia di produzione devono essere affidabili e manutenbili:

  • Implementare logging e monitoraggio completi del sistema di rilevamento stesso
  • Design per la tolleranza di guasto e il degrado aggraziato
  • Stabilire procedure di escalation chiare per diversi tipi di anomalie
  • Comportamento del sistema di documenti, soglie e decisioni di configurazione
  • Piano per aggiornamenti e manutenzione del sistema con minimo disagi

Direzioni e tendenze emergenti

Il campo di rilevamento di anomalia continua ad evolversi rapidamente, guidato da progressi nell'apprendimento automatico, aumentando i volumi di dati e i domini delle applicazioni emergenti.

Architettura avanzate di deep learning

Le tecniche basate sull'apprendimento profondo hanno avanzato il campo di rilevamento dell'anomalia all'interno di dataset multidimensionali, le architetture emergenti, tra cui trasformatori, reti neurali di grafi e modelli di diffusione, stanno spingendo i confini di ciò che è possibile nel rilevamento di anomalia.

I modelli ibridi emergenti, che combinano GAN con Autoencoders Variational o autoencoders per una maggiore robustezza, rappresentano indicazioni promettenti per la ricerca futura, che mirano a combinare i punti di forza delle diverse architetture, mitigando le loro singole debolezze.

Imparare fedelmente per la tutela della privacy

L'apprendimento federato fornisce un modo collaborativo per migliorare la rilevazione di anomalie utilizzando fonti di dati distribuite e la privacy dei dati. Questo approccio consente alle organizzazioni di beneficiare dell'apprendimento collettivo senza condividere dati sensibili, affrontando le preoccupazioni sulla privacy, migliorando le capacità di rilevamento attraverso i dataset di formazione più grandi e diversificati.

AI spiegabile e interpretabile

I sistemi di rilevamento delle anomalie sono impiegati in applicazioni più critiche, la domanda di spiegabilità continua a crescere. I sistemi futuri dovranno non solo rilevare anomalie, ma fornire anche chiare spiegazioni sul perché qualcosa è stato contrassegnato come anomale e quali caratteristiche hanno contribuito alla decisione.

Edge Computing e IoT

La proliferazione dei dispositivi IoT è la richiesta di algoritmi di rilevamento di anomalia leggera che possono essere eseguiti su dispositivi di bordo con restrizioni alle risorse, consentendo un rilevamento in tempo reale con requisiti di latenza e larghezza di banda ridotti, e affrontando anche le preoccupazioni sulla privacy elaborando i dati localmente.

Rilevazione di anomalia multimodale

I sistemi futuri integrano sempre più modalità di dati multiple, combinando dati numerici dei sensori, immagini, testi e audio, per fornire un rilevamento più completo dell'anomalia.

Imparare la macchina automatizzata (AutoML)

Le tecniche di AutoML stanno rendendo il rilevamento di anomalia più accessibile automatizzando la selezione di algoritmi, ingegneria delle caratteristiche e tuning di iperparametri. Questa democratizzazione del rilevamento di anomalia consente alle organizzazioni senza profonda esperienza di apprendimento della macchina per implementare sistemi di rilevamento efficaci.

Detezione causale dell'anomalia

Spostandosi oltre il rilevamento basato sulla correlazione, gli approcci causali mirano a comprendere i meccanismi sottostanti che generano anomalie, consentendo un rilevamento più robusto, meno sensibile alle correlazioni spurie e fornisce migliori insight per l'analisi e la bonifica delle cause.

Conclusioni

Il rilevamento di anomalie si è evoluto da semplici metodi statistici a sofisticati sistemi di apprendimento profondo in grado di identificare modelli sottili in dati complessi e di alta dimensione. La carta affronta l'ambiente in evoluzione dei metodi di rilevamento di anomalia e sottolinea l'importanza della ricerca e dell'innovazione continua.

Il successo del rilevamento di anomalia richiede la comprensione dei diversi metodi disponibili, la selezione di metriche di valutazione appropriate, e la considerazione attentamente i requisiti specifici e i vincoli di ogni applicazione. Ogni modello di apprendimento automatico e di rilevamento di anomalia profonda ha punti di forza e difetti, concentrandosi sulla precisione e sulle prestazioni durante l'applicazione di parametri di qualità per la valutazione.

Le future direzioni di ricerca includono il miglioramento delle prestazioni del modello, sfruttando più tecniche di validazione, ottimizzando l'utilizzo delle risorse, generando set di dati di alta qualità e concentrandosi sulle applicazioni del mondo reale.

Che tu stia proteggendo i sistemi finanziari dalle frodi, proteggendo le reti dalle minacce informatiche, garantendo qualità produttiva o monitorando le infrastrutture critiche, il rilevamento di anomalia fornisce capacità essenziali per identificare i modelli insoliti che più importano.

Per coloro che cercano di implementare sistemi di rilevamento delle anomalie, sono disponibili numerose risorse e strumenti. librerie open source come scikit-learn], TensorFlow, e ]PyTorch] fornire implementazioni di molti algoritmi discussi in questo articolo.