Lo squilibrio di classe si verifica quando alcune classi in un dataset sono significativamente sottorappresentate rispetto ad altri. Questo squilibrio può portare a prestazioni di modelli poveri, soprattutto in compiti come la classificazione in cui le classi minoritarie sono critiche.

Tecniche comuni per affrontare la classe Imbalance

Diversi metodi sono utilizzati per mitigare lo squilibrio di classe nelle reti neurali, che possono essere applicati singolarmente o combinati per ottenere risultati migliori.

Metodi di lettura dati

Gli approcci a livello di dati modificano il dataset alla distribuzione della classe di equilibrio, tra cui:

  • Oversampling:[] Aumentare il numero di campioni di classe minoritaria, spesso attraverso la duplicazione o la generazione di dati sintetici.
  • Scontro:[] Ridurre il numero di campioni di classe di maggioranza per abbinare le classi minoritarie.
  • SMOTE:[[] La tecnica di sovracampionamento della minoranza sintetica crea nuovi esempi sintetici per le classi minoritarie.

Tecniche di Algoritmo-Level

Questi metodi modificano l'algoritmo di apprendimento per gestire meglio i dati sbilanciati.

  • L'apprendimento sensibile ai costi:[ Assegna maggiori costi di di squalifica alle classi minoritarie.
  • Perdita focale:[] Si concentra l'allenamento su esempi difficili da classificare, riducendo l'impatto di negativi facili.

Esempi di dati reali-mondiali

Nella diagnosi medica, i dataset contengono spesso meno casi positivi. Applicare oversampling o SMOTE può migliorare la sensibilità del modello. Nel rilevamento delle frodi, dove le transazioni fraudolente sono rare, l'apprendimento sensibile ai costi aiuta il modello a priorità identificare questi casi in modo efficace.