La gestione dei dati squilibri è una sfida comune nell'apprendimento automatico. Si verifica quando una classe supera significativamente gli altri, che influisce sulle prestazioni dei modelli predittivi.

Comprensione dei dati imbarazzati

I dataset Imbalanced sono caratterizzati da una distribuzione sproporzionata delle classi, ad esempio nel rilevamento delle frodi, transazioni reali in numero enormemente superiore a quelle fraudolente, che possono causare modelli a favore della classe di maggioranza, riducendo il rilevamento di istanze di classe minoritaria.

Tecniche pratiche per la manipolazione dell'equilibrio

Diversi metodi possono affrontare efficacemente lo squilibrio dei dati:

  • Risorsa:[] Regolare il set di dati tramite sovracampionamento delle classi minoritarie o sottocampionamento delle classi di maggioranza.
  • Generazione di dati sintetici:[] Usare tecniche come SMOTE per creare esempi artificiali di classi minoritarie.
  • Accostamenti algoritmici:[ Modelli di vuoto che sono intrinsecamente robusti allo squilibrio, come i metodi di ensemble.
  • Imparare a costi sensibili:[ Assegnare maggiori costi di di disclassificazione agli errori di classe minoritaria.

Metrica di performance per i dati imbalancati

La valutazione dei modelli sui dati squilibri richiede metriche specifiche:

  • Precisione:[] La proporzione di vere previsioni positive tra tutte le previsioni positive.
  • Richiesta:[] La proporzione dei positivi effettivi correttamente identificati.
  • F1 Punteggio:[] Il mezzo armonico di precisione e richiamo.
  • AUC-ROC:[] Misura la capacità del modello di distinguere tra le classi attraverso le soglie.