Ang di - pagkakatimbang ng mga impormasyon ay nangyayari kapag ang pamamahagi ng mga klase sa isang dataset ay hindi pantay.

Pag - unawa sa Pag - abuso sa Date

Sa maraming real-world na senaryo, ang ilang mga klase ay mas karaniwan kaysa sa iba. halimbawa, sa scam detection, ang mga pandarayang transaksiyon ay bihira kumpara sa mga lehitimo. ang hindi balanseng ito ay maaaring maging sanhi ng mga modelo na pumabor sa karamihan ng mga klase, hindi pinapansin ang klaseng minorya.

Pagsukat sa Epekto

Upang suriin kung paano naaapektuhan ng di - pagkakatimbang ng impormasyon ang isang modelo, maaaring gumamit ng ilang metriko:

  • [Accuracy: Maaaring nakaliligaw sa hindi balanseng datasets, dahil ang mataas na katumpakan ay makakamit sa pamamagitan ng palaging paghula sa karamihang klase.
  • [[Paunawain at gunitain: Magbigay ng mga kabatiran sa kakayahan ng modelo na matukoy ang mga positibong kaso.
  • F1 Score: Pinagsasama ang presipitasyon at paggunita upang makapagbigay ng timbang na sukat.
  • ROC-AUC: Sinusukat ang kakayahan ng modelo na makilala ang pagkakaiba sa pagitan ng mga klase sa ibayo ng mga entidad.

Pagkalkula sa Epekto

Ang isang paraan upang tiyakin ang epekto ng di - pagkakatimbang ng impormasyon ay ihambing ang modelong paggawa sa timbang na pag - iwas sa di - timbang na mga dataset.

  • Paglalapat ng mga paraang pampagagana tulad ng pag-eebolb o pag-iinam.
  • Ginagamit ang sintetikong data genre tulad ng SMOTE.
  • Pag - iwas sa mga metriko bago at pagkatapos ng mga pamamaraan sa pagbalanse.
  • Sinusuri ang mga pagbabago sa presipitasyon, alaala, at iskor na F1.

Sa pagsukat sa mga metrikong ito, maaaring tantiyahin ng mga manggagamot kung gaano kalaki ang impluwensiya ng hindi pagkakatimbang sa mga modelong prediksiyon at matukoy ang angkop na mga estratehiyang mithiyon.