Tecniche di fabbricazione avanzate
Risolvere i Dataset Imbalanced: Tecniche pratiche con Fondazioni matematiche
Table of Contents
I dati imbarcati sono comuni in molte applicazioni del mondo reale, come il rilevamento delle frodi, la diagnosi medica e il rilevamento di anomalia.
Comprendere l'equilibrio dei dati
[LT] [[Squilibrio di dati] [[Scomparso di dati] [[Scomparso]] [[Scomparso di dati] [[Scomparso di dati] [[Scomparso di] [[Scomparso di]] [[Scom]]] [[Scomparso di livello di maggioranza] [[Scom]]]] [FLT]]]] [[[[[[[[[[[FLT]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]] [[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[[Squilibr]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]
Tecniche per la movimentazione di equilibratura
Diversi metodi possono mitigare gli effetti dello squilibrio dei dati, che possono essere suddivisi in metodi di livello dei dati e di livello degli algoritmi.
Metodi di lettura dati
- Oversampling:[[] Aumentare i campioni di classe minoritaria, spesso utilizzando metodi come SMOTE, che genera punti di dati sintetici basati su campioni di minoranza esistenti.
- Semplificazione:[] Ridurre campioni di classe di maggioranza per bilanciare il set di dati, che può rischiare di perdere informazioni preziose.
- Hybrid si avvicina:[] Combinando sovracampionamento e sottocampionamento per ottimizzare il bilanciamento dei dati.
Metodi di Algoritmo-Livello
- L'apprendimento sensibile ai costi:[ Assegnare maggiori costi di di disclassificazione a errori di classe minoritaria per influenzare l'attenzione del modello.
- Metodi di assemblaggio:[] Utilizzando tecniche come aumentare per migliorare il rilevamento delle classi minoritarie.
- Adjusting Decision soglie:[] Modificare la probabilità cutoff per favorire le previsioni di classe minoritaria.
Fondazioni matematiche
Molte tecniche sono basate su concetti statistici e matematici, ad esempio, SMOTE crea campioni sintetici interpolando tra i punti di classe minoritaria:
x[]]new[ = xi + lambda (x]j - x]i]]]]] ]]]]]]]]]]
x]i[] e ]xj][]]] sono campioni di classe di minoranza e lambda] è un numero casuale tra i dati di classe sintetica di dati di cui la funzione 1.