Ang supervised learning ay isang malawakang ginagamit na paraan ng pagkatuto ng makina na kinasasangkutan ng pagsasanay ng mga modelo sa mga may pangalang datos. Gayunpaman, ang mga manggagamot ay kadalasang nahaharap ang karaniwang mga patibong na maaaring makaapekto sa pagsasagawa at pagkamaaasahan ng kanilang mga modelo.Ang pag-unawa sa mga isyung ito at pagkakapit ng angkop na mga kalkulasyon ay maaaring makatulong sa pag-iinam ng kanilang epekto.

Labis na Angkop at Angkop

Ang labis na pag-aangkop ay nangyayari kapag ang isang modelo ay nag-aaral ng mga impormasyong pagsasanay nang mahusay, kabilang ang ingay, na humahantong sa hindi maayos na paglalahat sa bagong datos. underangkop kapag ang modelo ay masyadong simple upang makuha ang mga saligang padron. ang mga kalkulasyon gaya ng pagsasanay at mga adventation error rate ay maaaring makatulong upang matukoy ang mga isyung ito.

Halimbawa, kung ihahambing ang pagkakamali sa pagsasanay (Etrain) at ang pagkakamali sa harmonya (E]val) ay maaaring magpahiwatig ng labis na pag-aangkop kung ang E na pag-inom ay napakababa samantalang ang E[C. Ang parehong mataas na pag-iwas ay parehong mataas, na nagmumungkahi ng mataas na pagkakamali sa ilalim ng ⁇ .

Pag - aaral sa Klase

Ang di - pagkakatimbang ng klase ay nangyayari kapag ang ilang klase ay kulang na kinatawan sa dataset, na humahantong sa may kinikilingang mga modelo.

Ipagpalagay nang ang dataset ay may 1000 sampol, na ang 900 ay kabilang sa klase A at 100 sa klase B. Ang mga porsiyento ng pamamahagi ng klase ay:

Klase A: (900/1000) * 100 = 90%

Klase B: (100/1000) * 100 = 10%

Pag - aalis sa Pagiging Huwaran

Ang mga metriko gaya ng katumpakan, prekwensiya, pag-aalala, at F1-score ay mahalaga para sa isang pag-chesting ng modelong pagganap. ang mga kalkulasyon ay kinasasangkutan ng pagkalito ng mga bahaging matrix:

  • Tunay na Positibo (TP)
  • Maling Positibo (FP)
  • Huwad na mga Negatibo (FN)

Halimbawa, ang prekwensiya ay kinakalkula bilang:

Precision = TP / (TP + FP)

Pakikitungo sa Maiingay na Data

Ang mga datos na noisy ay maaaring pumilipit sa pagsasanay ng modelo. ang mga kalkulasyon gaya ng ingay-to-signal ratio ay tumutulong sa quancial data quality.

Ipagpalagay nang ang dataset ay naglalaman ng 100 maiingay na sampol mula sa 1000 kabuuang sampol.

Noise Ratio = (Tsino ng maiingay na sampol) / (Total sampol) = 100 / 1000 = 0.1 o 10%