Sibil & Inhinyeriyang Pampasabog
Praktikal na mga Paraan sa Paggamit ng mga Di - pa - naaasiwang Data sa Pag - aaral sa Makina
Table of Contents
Kapag mas marami ang mga tao kaysa sa iba, ang mga modelo ay maaaring maging may kinikilingan, anupat hindi mahusay sa klase ng minorya.
Pag - unawa sa mga Dakta na Hindi Pa Nasusunod
Halimbawa, sa pag - alam ng pandaraya, bihirang - bihira ang mga pandaraya kung ihahambing sa mga lehitimong transaksiyon na ito.
Mga Pamamaraan ng Data-Level
Ang mga pamamaraang Data-level ay nagreresulta sa dataset upang balansehin ang distribusyon ng klase. Ang mga karaniwang paraan ay kinabibilangan ng:
- [[Pampasa:] Dumarami ang mga sampol ng klaseng minoridad, na kadalasang gumagamit ng mga pamamaraang katulad ng SMOTE.
- Pampasa sa ilalim: Ang pagpapaliit sa mga sampol ng karamihan ng klase upang tumugma sa sukat ng klaseng minoridad.
- Data Augmentation: Nakalilikha ng mga bagong sintetikong sampol upang mapaganda ang representasyon ng mga uring minorya.
Mga Strategy ng Algorithm-Level
Ang pagbabago sa pagkatuto ng algorithm ay maaari ring lumutas sa di - pagkakatimbang ng klase.
- Cost-sensitive learning: Pagtatalaga ng mas mataas na mga di-klaseng halaga sa mga pagkakamali ng minoryang klase.
- [Pagsasaayos ng mga pabigat ng klase: Nagpapahiwatig ng kahalagahan ng mga klase sa panahon ng pagsasanay ng modelo.
- Mga paraan ng pag-aaral: Pinagsasama ang maramihang modelo upang mapabuti ang pag-aanalisa ng mga uring minorya.
Mga Metiko ng Pag - aalis ng Tubig
Ang paggamit ng angkop na mga metriko ay mahalaga sa pagsusuri ng modelong pagganap sa hindi balanseng datos. Ang karaniwang mga metriko ay kinabibilangan ng:
- [ Ang proporsiyon ng mga tunay na positibong bagay sa mga hinulaang positibo.
- [Talaksan:] Ang proporsiyon ng mga aktuwal na positibong tama ang pagkakatukoy.
- F1 Score: Ang harmonikong kahulugan ng prekwensiya at pag-aalala.
- AUC-ROC: Sinusukat ang kakayahan ng modelo na makilala ang pagkakaiba sa pagitan ng mga klase.