Kapag mas marami ang mga tao kaysa sa iba, ang mga modelo ay maaaring maging may kinikilingan, anupat hindi mahusay sa klase ng minorya.

Pag - unawa sa mga Dakta na Hindi Pa Nasusunod

Halimbawa, sa pag - alam ng pandaraya, bihirang - bihira ang mga pandaraya kung ihahambing sa mga lehitimong transaksiyon na ito.

Mga Pamamaraan ng Data-Level

Ang mga pamamaraang Data-level ay nagreresulta sa dataset upang balansehin ang distribusyon ng klase. Ang mga karaniwang paraan ay kinabibilangan ng:

  • [[Pampasa:] Dumarami ang mga sampol ng klaseng minoridad, na kadalasang gumagamit ng mga pamamaraang katulad ng SMOTE.
  • Pampasa sa ilalim: Ang pagpapaliit sa mga sampol ng karamihan ng klase upang tumugma sa sukat ng klaseng minoridad.
  • Data Augmentation: Nakalilikha ng mga bagong sintetikong sampol upang mapaganda ang representasyon ng mga uring minorya.

Mga Strategy ng Algorithm-Level

Ang pagbabago sa pagkatuto ng algorithm ay maaari ring lumutas sa di - pagkakatimbang ng klase.

  • Cost-sensitive learning: Pagtatalaga ng mas mataas na mga di-klaseng halaga sa mga pagkakamali ng minoryang klase.
  • [Pagsasaayos ng mga pabigat ng klase: Nagpapahiwatig ng kahalagahan ng mga klase sa panahon ng pagsasanay ng modelo.
  • Mga paraan ng pag-aaral: Pinagsasama ang maramihang modelo upang mapabuti ang pag-aanalisa ng mga uring minorya.

Mga Metiko ng Pag - aalis ng Tubig

Ang paggamit ng angkop na mga metriko ay mahalaga sa pagsusuri ng modelong pagganap sa hindi balanseng datos. Ang karaniwang mga metriko ay kinabibilangan ng:

  • [ Ang proporsiyon ng mga tunay na positibong bagay sa mga hinulaang positibo.
  • [Talaksan:] Ang proporsiyon ng mga aktuwal na positibong tama ang pagkakatukoy.
  • F1 Score: Ang harmonikong kahulugan ng prekwensiya at pag-aalala.
  • AUC-ROC: Sinusukat ang kakayahan ng modelo na makilala ang pagkakaiba sa pagitan ng mga klase.