Ubalanserte data er en vanlig utfordring i maskinlæring, hvor en klasse betydelig uttaller andre. Denne ubalansen kan føre til fordomsfrie modeller som utfører dårlig på minoritetsklasser. Kostfølsomme læringsteknikker løser dette problemet ved å tildele ulike kostnader til feilklassifiseringer, hjelpe modeller med fokus på minoritetsklasser.

Forstå ubalanserte data

Ubalanserte datasett forekommer i ulike felt som svindeldeteksjon, medisinsk diagnose og spam filtrering. I disse tilfellene er minoritetsklassen ofte viktigere, men mindre representert. Standard algoritmer har tendens til å favorisere majoritetsklassen, noe som resulterer i lav tilbakemelding for minoritetsklassen.

Kostnadsfølsom læringsteknikk

Kostnadsfølsom læring innebærer å endre læringsprosessen til å regne for ulike feilklassifiseringskostnader. Ved å tildele høyere kostnader til feil på minoritetsklasser, modeller blir mer følsomme for disse klassene, forbedrer den generelle ytelsen.

Vanlige tilnærminger

  • Innenriksklasse vekter i tapsfunksjonen for å straffe feilklassifisere minoritetsklasser kraftigere.
  • Cost matriser: Definere en matrise som angir kostnadene for hver type feilklassifisering, som leder modellen for å minimere totalkostnaden.
  • Samplingteknikker: Kombinere kostnadsfølsomme metoder med oversampling eller undersampling for å balansere datasettet.