Table of Contents
Beregne informasjon gevinst er et grunnleggende steg i å bygge beslutningstrær. Det hjelper bestemme den beste funksjonen å dele dataene på hver node, forbedre nøyaktigheten av modellen. Denne prosessen innebærer å måle reduksjonen i entropi etter at et datasett er delt basert på en bestemt attributt.
Forstå Entropy
Entropi måler forstyrrelsen eller urenhet i et datasett. Det beregnes ved hjelp av sannsynligheten for hver klasse i datasettet. Et datasett med blandede klasser har høyere entropi, mens et rent datasett har lavere entropi.
Formlen for entropi er:
Entropy = - ⁇ pi] log2 p]]i]]]
Beregne informasjonsgevinst
Informasjonsforsterkning er forskjellen mellom entropien til det opprinnelige datasettet og vektet gjennomsnittlig entropi etter en splittet. Det kvantifiserer hvor mye usikkerhet reduseres ved å dele dataene basert på en funksjon.
Formlen for informasjonsgevinst er:
Informasjon Gain = Entropy(foreldre) - ⁇ (vekt av barn) × Entropy(barn)
Praktiske beregningssteg
For å beregne informasjonsgevinsten i praksis, følg disse trinnene:
- Beregn entropien til hele datasettet.
- Deling av datasettet basert på funksjonen som vurderes.
- Beregn entropien for hver delgruppe som er opprettet av splittelsen.
- Beregn det vektede gjennomsnittet av disse entropiene.
- Trekk denne verdien fra den opprinnelige entropien for å finne informasjonsgevinsten.
Eksempel
Antak et datasett har en initial entropi på 0,94. Etter spalting basert på en funksjon, er den vektede gjennomsnittlige entropien til undergrupperne 0,5. Opplysningsfordelen fra denne splittelsen er 0,44, noe som indikerer en betydelig reduksjon i usikkerhet.