Berechnung von Informationsgewinn für die Konstruktion von Entscheidungsbäumen in der Praxis

Die Berechnung des Informationsgewinns ist ein grundlegender Schritt bei der Erstellung von Entscheidungsbäumen. Sie hilft dabei, das beste Merkmal für die Aufteilung der Daten an jedem Knoten zu bestimmen, wodurch die Genauigkeit des Modells verbessert wird.

Entropie verstehen

Die Entropie misst die Unordnung oder Unreinheit in einem Datensatz. Sie wird anhand der Wahrscheinlichkeit jeder Klasse innerhalb des Datensatzes berechnet. Ein Datensatz mit gemischten Klassen hat eine höhere Entropie, während ein reiner Datensatz eine geringere Entropie aufweist.

Die Formel für Entropie ist:

Entropie = -Σ pi log2 pi

Berechnung des Informationsgewinns

Der Informationsgewinn ist die Differenz zwischen der Entropie des ursprünglichen Datensatzes und der gewichteten durchschnittlichen Entropie nach einem Split, der quantifiziert, wie viel Unsicherheit durch Partitionierung der Daten auf der Grundlage eines Merkmals reduziert wird.

Die Formel für den Informationsgewinn lautet:

Informationsgewinn = Entropie(Elternteil) - Σ (Gewicht des Kindes) × Entropie(Kind)

Praktische Berechnungsschritte

Um den Informationsgewinn in der Praxis zu berechnen, folgen Sie diesen Schritten:

Beispiel

Angenommen, ein Datensatz hat eine anfängliche Entropie von 0,94. Nach der Aufteilung auf der Grundlage eines Merkmals beträgt die gewichtete durchschnittliche Entropie der Teilmengen 0,5. Der Informationsgewinn aus dieser Aufteilung beträgt 0,44, was auf eine signifikante Verringerung der Unsicherheit hinweist.