Table of Contents
Klasseubalanse er en vanlig utfordring i maskinlæring der en klasse betydelig uttaler andre. Denne ubalansen kan føre til fordomsfrie modeller som fungerer dårlig på minoritetsklasser. Implementering effektive teknikker kan forbedre forutsetning nøyaktighet og modell rettferdighet.
Forståelse klasse imbalance
Klasseubalanse oppstår når fordelingen av klasser i et datasett er ujevn. For eksempel i svindeldetektering er svindeltransaksjoner mye færre enn legitime. Denne ubalansen kan føre til at modeller favoriserer majoritetsklassen, reduserer deteksjonen av minoritetsklasse forekomster.
Teknikker til å adressere klasseubalanse
Flere metoder kan bidra til å redusere problemene i klasseubalansen:
- Resampling: Juster datasettet ved å oversamle minoritetsklasser eller undersamle flertall klasser.
- Syntetisk datagenerasjon: Bruk teknikker som SMOTE for å skape syntetiske eksempler på minoritetsklasser.
- Employ-modeller som er robuste til ubalanse, som ensemblemetoder.
- Særlig læring: Tildel høyere feilklassifiseringskostnader til minoritetsklasser.
Beregninger for å evaluere klasseimbalanse
Metrics bidrar til å kvantifisere omfanget av ubalanse og modellytelse. Vanlige beregninger inkluderer:
- Imbalanseforhold: Forholdet mellom antall flertall og minoritetsklasseinstanser.
- Presisjon og minne: Mål nøyaktigheten av positive spådommer og evnen til å finne alle positive tilfeller.
- ]F1 Score: Harmonisk gjennomsnitt av presisjon og tilbakemelding, balansere begge metrikkene.