Berekenen van informatiewinst voor de beslissingsboom Bouwen in de praktijk

Het berekenen van informatiewinst is een fundamentele stap in het bouwen van beslissingsbomen. Het helpt bepalen van de beste functie om de gegevens te splitsen op elke knooppunt, het verbeteren van de nauwkeurigheid van het model. Dit proces omvat het meten van de vermindering in entropie nadat een dataset is gesplitst op basis van een specifieke eigenschap.

Begrijpen van entropie

Entropie meet de aandoening of onzuiverheid in een dataset. Het wordt berekend met behulp van de waarschijnlijkheid van elke klasse binnen de dataset. Een dataset met gemengde klassen heeft een hogere entropie, terwijl een pure dataset een lagere entropie heeft.

De formule voor entropie is:

Entropie = -

Berekenen van informatiewinst

Informatiewinst is het verschil tussen de entropie van de oorspronkelijke dataset en de gewogen gemiddelde entropie na een splitsing. Het kwantificeert hoeveel onzekerheid wordt verminderd door de gegevens op basis van een functie te partitioneren.

De formule voor informatiewinst is:

Informatiewinst = Entropie(ouder) -

Praktische berekeningsstappen

Om informatiewinst in de praktijk te berekenen, volg deze stappen:

  • Bereken de entropie van de hele dataset.
  • Partitie van de dataset op basis van de functie die wordt geëvalueerd.
  • Bereken de entropie voor elke subset die door de split wordt gemaakt.
  • Bereken het gewogen gemiddelde van deze entropies.
  • Trek deze waarde af van de oorspronkelijke entropie om de informatie te verkrijgen.

Voorbeeld

Stel dat een dataset een eerste entropie van 0,94 heeft. Na splitsing op basis van een functie, is de gewogen gemiddelde entropie van de subgroepen 0,5. De informatiewinst van deze split is 0,44, wat wijst op een significante vermindering van onzekerheid.