Klasseubalanse oppstår når visse klasser i et datasett er betydelig underrepresentert i forhold til andre. Denne ubalansen kan føre til dårlig modellytelse, spesielt i oppgaver som klassifisering der minoritetsklasser er kritiske. Å håndtere klasseubalanse er avgjørende for å utvikle nøyaktige og pålitelige nevrale nettverk.

Vanlige teknikker til å adressere klasseubalanse

Flere metoder brukes til å redusere klasseubalanse i nevrale nettverk. Disse teknikkene kan brukes individuelt eller kombineres for bedre resultater.

Datanivåmetoder

Datanivå tilnærminger endrer datasettet til balanseklassefordeling. Disse inkluderer:

  • Oversampling: Øke antall minoritetsklasseprøver, ofte gjennom duplisering eller syntetisk datagenerasjon.
  • Undersampling: Reduser antall flertall klasseprøver til å matche minoritetsklasser.
  • SMOTE: Syntetisk minoritetssyntetisk oversamplingsteknikk skaper nye syntetiske eksempler for minoritetsklasser.

Algoritme-nivå teknikker

Disse metodene endrer læringsalgoritmen for bedre å håndtere ubalanserte data. Eksempler inkluderer:

  • Særlig læring: tildeler høyere feilklassifiseringskostnader til minoritetsklasser.
  • Fokal tap: Fokuserer på trening på hard-to-klassifiserte eksempler, noe som reduserer virkningen av enkle negative.

Eksempler på virkelige data

I medisinsk diagnose inneholder datasett ofte færre positive tilfeller. Å påføre oversampling eller SMOTE kan forbedre modellfølsomhet. I svindeldetektering, der svindeltransaksjoner er sjeldne, hjelper kostnadsfølsom læring modellen å prioritere å identifisere disse tilfellene effektivt.