Ang pagkalkula ng mga impormasyong pakinabang ay isang mahalagang hakbang sa paggawa ng mga punong de-pasiya.Natutulungan nitong malaman ang pinakamahusay na tampok upang hatiin ang mga datos sa bawat node, na pinabubuti ang katumpakan ng modelo. Ang prosesong ito ay kinasasangkutan ng pagsukat ng pagbabawas ng entropiya matapos na mahati ang isang dataset batay sa isang espesipikong katangian.

Pag - unawa sa Kaguluhan

Ang Entropy ay sumusukat sa diperensiya o karumihan sa isang dataset. Ito ay kinakalkula gamit ang probabilidad ng bawat klase sa loob ng dataset. Ang isang dataset na may halong mga klase ay may mas mataas na entropy, habang ang isang purong dataset ay may mas mababang entropy.

Ang pormula para sa entropiya ay:

[Entropy = -if ⁇ p[ log[2 p [[[FLT:[[[[[[LT:6][[[[[[[[LT:7]]

Dumarami ang Nakalkulang Impormasyon

Ang pagkakamit ng impormasyon ay ang pagkakaiba ng entropiya ng orihinal na dataset at ng timbang na average na entropy pagkatapos ng isang split. Ito ay nagreresulta kung gaano kalaking kawalang katiyakan ang nababawasan sa pamamagitan ng paghahati ng data batay sa isang katangian.

Ang pormula para sa pakinabang sa impormasyon ay:

Inpormasyong Gain = Entropiya(magulang) - ⁇ (timbang ng bata) ⁇ Entropy(child)

Praktikal na mga Hakbang sa Pagkalkula

Upang makabuo ng impormasyong makukuha sa pagsasanay, sundin ang mga hakbang na ito:

  • Tuusin ang larawan ng buong dataset.
  • Paghahati ng dataset batay sa tampok na sinusuri.
  • Tuusin ang entropiya para sa bawat subset na nilikha ng split.
  • Pag - isipan ang katamtamang timbang ng mga entropiya na ito.
  • Ihulog ang halagang ito mula sa orihinal na entropiya upang mahanap ang mga pakinabang ng impormasyon.

Halimbawa

Halimbawa ang isang dataset ay may paunang entropiya ng 0.94. Pagkatapos na mahati batay sa isang katangian, ang nabigatang average na entropy ng subsets ay 0.5.Ang mga nakamit na impormasyon mula sa split na ito ay 0.44, na nagpapahiwatig ng malaking pagbawas sa kawalang katiyakan.