Ingegneria civile e strutturale
Approcci pratici per la gestione di Dataset Imbalanced nell'apprendimento delle macchine
Table of Contents
La gestione di datasets squilibrio è una sfida comune nell'apprendimento delle macchine. Quando una classe supera significativamente altri, i modelli possono diventare biased, portando a prestazioni povere nelle classi minoritarie.
Comprendere i set di dati imbarcati
Un dataset sbilanciato si verifica quando la distribuzione delle classi è irregolare. Ad esempio, nel rilevamento delle frodi, le transazioni fraudolente sono rare rispetto a quelle legittime.
Tecniche di lettura dati
Le tecniche di livello dei dati modificano il dataset alla distribuzione della classe di equilibrio.
- Oversampling:[[] Aumentare il numero di campioni di classe minoritaria, spesso utilizzando tecniche come SMOTE.
- Scontro:[] Ridurre i campioni di classe di maggioranza per abbinare la dimensione della classe minoritaria.
- Agomentazione dei dati:[] Creazione di nuovi campioni sintetici per migliorare la rappresentazione delle classi minoritarie.
Strategie di Algoritmo-Level
La regolazione dell'algoritmo di apprendimento può anche affrontare lo squilibrio di classe.
- L'apprendimento sensibile ai costi:[ Assegnare maggiori costi di di disclassificazione agli errori di classe minoritaria.
- Aggiustare pesi di classe:[ Modificare l'importanza delle classi durante la formazione di modello.
- Metodi di montaggio:[] Combinando modelli multipli per migliorare il rilevamento delle classi minoritarie.
Misurazione di valutazione
L'utilizzo di metriche appropriate è essenziale per valutare le prestazioni del modello sui dati squilibri.
- Precisione:[] La proporzione dei veri positivi tra i positivi predetti.
- Richiesta:[] La proporzione dei positivi effettivi correttamente identificati.
- F1 Punteggio:[] Il mezzo armonico di precisione e richiamo.
- AUC-ROC:[] Misura la capacità del modello di distinguere tra le classi.