Het omgaan met onevenwichtige datasets is een veel voorkomende uitdaging in machine learning. Wanneer een klasse aanzienlijk in de minderheidsklasse is, kunnen modellen bevooroordeeld raken, wat leidt tot slechte prestaties.

Onevenwichtige gegevenssets begrijpen

Een onevenwichtige dataset treedt op wanneer de verdeling van klassen ongelijk is. Bijvoorbeeld, in fraude detectie, frauduleuze transacties zijn zeldzaam in vergelijking met legitieme. Herkennen van deze onbalans is de eerste stap naar het effectief aanpakken ervan.

Technieken op gegevensniveau

De gegevensniveautechnieken wijzigen de dataset om klassendistributie in evenwicht te brengen.

  • Oversampling: Verhoogt het aantal minderheidsklassemonsters, vaak met behulp van technieken zoals SMOTE.
  • Ondergrondse steekproef: De monsters van de meerderheidsklasse verminderen om de minderheidsklasse te vergelijken.
  • Data Augmentation: Nieuwe synthetische monsters maken om de minderheidsklasse vertegenwoordiging te verbeteren.

Algoritme-niveaustrategieën

Het aanpassen van het leeralgoritme kan ook betrekking hebben op klassenonbalans. Technieken omvatten:

  • Kostengevoelig leren: Hogere foutclassificatiekosten toewijzen aan minderheidsklassenfouten.
  • Aanpassen van klassegewichten: Het belang van klassen tijdens modeltraining wijzigen.
  • Samenvoegen van methoden: Meerdere modellen combineren om de detectie van minderheidsklassen te verbeteren.

Evaluatie Metrics

Het gebruik van geschikte metrics is essentieel voor het evalueren van modelprestaties op onevenwichtige gegevens.

  • Precisie: Het aandeel van de positieven onder de voorspelde positieven.
  • Herroep: Het aandeel van de feitelijke positieven correct geïdentificeerd.
  • F1 Score: Het harmonische gemiddelde van precisie en terugroepen.
  • AUC-ROC: Meet het vermogen van het model om onderscheid te maken tussen klassen.