Dezechilibrul clasei apare atunci când anumite clase dintr-un set de date sunt semnificativ subreprezentate comparativ cu altele. Acest dezechilibru poate duce la performanţe slabe ale modelului, în special în sarcinile de clasificare în care clasele minoritare sunt critice. Abordarea dezechilibrului de clasă este esenţială pentru dezvoltarea de reţele neuronale exacte şi fiabile.

Tehnici comune pentru a aborda problema clasei

Mai multe metode sunt folosite pentru a atenua dezechilibrul de clasă în rețelele neuronale. Aceste tehnici pot fi aplicate individual sau combinate pentru rezultate mai bune.

Metode la nivel de date

Abordările la nivel de date modifică setul de date pentru a echilibra distribuția clasei.

  • Supraeșantionare: Creșterea numărului de eșantioane de clasă minoritară, adesea prin suprapunere sau generarea de date sintetice.
  • Subsamping: Reducerea numărului de probe de clasă majoritară pentru a se potrivi claselor minoritare.
  • Tehnica de supra-eșantionare a minorităților sintetice creează noi exemple sintetice pentru clasele minoritare.

Tehnici de nivel algoritmului

Aceste metode modifică algoritmul de învățare pentru a gestiona mai bine datele dezechilibrate. Exemplele includ:

  • Învățare sensibilă la nivel de grup: Atribuie clase minoritare costuri mai mari de clasificare greșită.
  • Pierderea focalizării: Se concentrează pe formarea pe exemple greu de clasificat, reducând impactul negativelor ușoare.

Exemple de date reale

În diagnosticul medical, seturi de date conțin adesea mai puține cazuri pozitive. Aplicarea suprasamplerii sau SMOTE poate îmbunătăți sensibilitatea modelului. În detectarea fraudei, în cazul în care tranzacțiile frauduloase sunt rare, învățarea sensibilă la costuri ajută modelul să acorde prioritate identificării acestor cazuri în mod eficient.