Pag - unawa at Pagkalkula sa Munisipal na Impormasyon Para sa Pagpili ng Katangian
Sa segment selection, ang mutual information ay isang estadistikal na hakbang na ginagamit upang suriin ang dependency sa pagitan ng dalawang variables., tumutulong ito upang matukoy ang mga katangian na may pinaka-kaugnay na impormasyon tungkol sa target variable. Ang paraang ito ay malawak na ginagamit sa pag-aaral ng makina upang mapabuti ang modelong pagganap sa pamamagitan ng pagpili ng pinaka-interminasyong katangian.
Ano ba ang Mutual Information?
Ang mutual information ay nagreresulta sa dami ng impormasyong nakuha tungkol sa isang random na pabagu-bago sa pamamagitan ng isa pa. Ito ay sumusukat sa pagbawas ng hindi katiyakan ng isang magkakaibang ibinigay na kaalaman sa isa pa. Ang isang mas mataas na parehong halaga ng impormasyon ay nagpapahiwatig ng mas malakas na dependensiya sa pagitan ng mga variables.
Pagkalkula sa Impormasyon ng Mag - isa
Ang pormula ay batay sa pinagsamang distribusyon ng probabilidad at sa indibiduwal na distribusyon ng variables. Ang pangkalahatang pormula ay:
I(X;Y) = ⁇ p(x,y) log (p(x,y) / (p(x) p(y)))[]
Saan:
- p(x,y) ang magkasanib na probabilidad ng X at Y
- p(x) at p(y) ang mga gilid na probabilidad
Pagkakapit sa Pagpili ng Katangian
Sa feature selection, ang mutual information ay tumutulong upang malaman kung aling mga katangian ang pinaka-kaugnay sa target variable. Ang mga katangian na may mas mataas na mutual information scores ay itinuturing na mas impormatibo at presitituted para sa modelong pagsasanay. Ang prosesong ito ay nagbabawas ng dimensiyonalidad at pagpapabuti ng model eficity.
Kabilang sa mga karaniwang pamamaraan ang pagkalkula ng mutual na impormasyon sa pagitan ng bawat tampok at ng puntirya, pagkatapos ay pagpili ng mga pang-itaas na tampok batay sa mga iskor. Ang pamamaraang ito ay lalo nang kapaki-pakinabang sa paghawak ng mataas-dimensiyonal na datos.