Manipularea seturilor de date dezechilibrate este o provocare comună în procesul de învăţare a maşinilor. Când o clasă depăşeşte în mod semnificativ alte clase, modelele pot deveni părtinitoare, ceea ce duce la performanţe slabe în clasele minorităţilor. Implementarea strategiilor practice poate îmbunătăţi precizia modelului şi corectitudinea.

Înțelegerea seturilor de date dezechilibrate

Un set de date dezechilibrat apare atunci când distribuția claselor este inegală. De exemplu, în detectarea fraudei, tranzacțiile frauduloase sunt rare în comparație cu cele legitime. Recunoscând acest dezechilibru este primul pas spre abordarea eficientă a acesteia.

Tehnici la nivel de date

Tehnicile de nivel de date modifică setul de date pentru a echilibra distribuția clasei. Metodele comune includ:

  • Suprasampling: Creșterea numărului de probe de clasă minoritară, adesea folosind tehnici precum SMOTE.
  • Subsamping: Reducerea probelor clasei majoritare pentru a se potrivi cu mărimea clasei minoritare.
  • Augmentarea datelor: Crearea de noi probe sintetice pentru a spori reprezentarea clasei minoritare.

Strategii de nivel algoritm

Ajustarea algoritmului de învățare poate aborda și dezechilibrul de clasă. Tehnicile includ:

  • Învăţare sensibilă la nivel superior: Atribuirea unor costuri mai mari de clasificare greşită erorilor de clasă minoritară.
  • Ajustarea greutăților clasei: Modificarea importanței claselor în timpul formării de modele.
  • ]Metode de ansamblu: Combinarea mai multor modele pentru îmbunătățirea detectării clasei minoritare.

Metrici de evaluare

Utilizarea unor indicatori adecvaţi este esenţială pentru evaluarea performanţei modelului privind datele dezechilibrate.

  • Precizie: Procentul de pozitive reale printre pozitivele prezise.
  • Rechemare: Procentul de pozitive reale identificate corect.
  • Scor F1: Media armonică a preciziei și a rechemarii.
  • ASC-ROC:Măsoară capacitatea modelului de a distinge între clase.