Berekenen van informatiewinst voor de beslissingsboom Bouwen in de praktijk
Het berekenen van informatiewinst is een fundamentele stap in het bouwen van beslissingsbomen. Het helpt bepalen van de beste functie om de gegevens te splitsen op elke knooppunt, het verbeteren van de nauwkeurigheid van het model. Dit proces omvat het meten van de vermindering in entropie nadat een dataset is gesplitst op basis van een specifieke eigenschap.
Begrijpen van entropie
Entropie meet de aandoening of onzuiverheid in een dataset. Het wordt berekend met behulp van de waarschijnlijkheid van elke klasse binnen de dataset. Een dataset met gemengde klassen heeft een hogere entropie, terwijl een pure dataset een lagere entropie heeft.
De formule voor entropie is:
Entropie = -
Berekenen van informatiewinst
Informatiewinst is het verschil tussen de entropie van de oorspronkelijke dataset en de gewogen gemiddelde entropie na een splitsing. Het kwantificeert hoeveel onzekerheid wordt verminderd door de gegevens op basis van een functie te partitioneren.
De formule voor informatiewinst is:
Informatiewinst = Entropie(ouder) -
Praktische berekeningsstappen
Om informatiewinst in de praktijk te berekenen, volg deze stappen:
- Bereken de entropie van de hele dataset.
- Partitie van de dataset op basis van de functie die wordt geëvalueerd.
- Bereken de entropie voor elke subset die door de split wordt gemaakt.
- Bereken het gewogen gemiddelde van deze entropies.
- Trek deze waarde af van de oorspronkelijke entropie om de informatie te verkrijgen.
Voorbeeld
Stel dat een dataset een eerste entropie van 0,94 heeft. Na splitsing op basis van een functie, is de gewogen gemiddelde entropie van de subgroepen 0,5. De informatiewinst van deze split is 0,44, wat wijst op een significante vermindering van onzekerheid.