La gestione di datasets squilibrio è una sfida comune nell'apprendimento delle macchine. Quando una classe supera significativamente altri, i modelli possono diventare biased, portando a prestazioni povere nelle classi minoritarie.

Comprendere i set di dati imbarcati

Un dataset sbilanciato si verifica quando la distribuzione delle classi è irregolare. Ad esempio, nel rilevamento delle frodi, le transazioni fraudolente sono rare rispetto a quelle legittime.

Tecniche di lettura dati

Le tecniche di livello dei dati modificano il dataset alla distribuzione della classe di equilibrio.

  • Oversampling:[[] Aumentare il numero di campioni di classe minoritaria, spesso utilizzando tecniche come SMOTE.
  • Scontro:[] Ridurre i campioni di classe di maggioranza per abbinare la dimensione della classe minoritaria.
  • Agomentazione dei dati:[] Creazione di nuovi campioni sintetici per migliorare la rappresentazione delle classi minoritarie.

Strategie di Algoritmo-Level

La regolazione dell'algoritmo di apprendimento può anche affrontare lo squilibrio di classe.

  • L'apprendimento sensibile ai costi:[ Assegnare maggiori costi di di disclassificazione agli errori di classe minoritaria.
  • Aggiustare pesi di classe:[ Modificare l'importanza delle classi durante la formazione di modello.
  • Metodi di montaggio:[] Combinando modelli multipli per migliorare il rilevamento delle classi minoritarie.

Misurazione di valutazione

L'utilizzo di metriche appropriate è essenziale per valutare le prestazioni del modello sui dati squilibri.

  • Precisione:[] La proporzione dei veri positivi tra i positivi predetti.
  • Richiesta:[] La proporzione dei positivi effettivi correttamente identificati.
  • F1 Punteggio:[] Il mezzo armonico di precisione e richiamo.
  • AUC-ROC:[] Misura la capacità del modello di distinguere tra le classi.