Beräkning av informationsvinst är ett grundläggande steg i att bygga beslutsträd. Det hjälper till att bestämma den bästa funktionen för att dela data vid varje nod, förbättra noggrannheten i modellen. Denna process innebär att mäta minskningen av entropi efter en datamängd delas upp baserat på ett specifikt attribut.
Förstå Entropy
Entropi mäter sjukdomen eller orenheten i en datamängd. Det beräknas med sannolikheten för varje klass inom datamängden. En datamängd med blandade klasser har högre entropi, medan en ren datamängd har lägre entropi.
Formeln för entropi är:
]Entropy = - Õ p[ i] log[]]]]2]]][[[[]]]]][[[[]]]]]]]]]]]]]][[[[[[[[[[[[[[[[[[[[[[[[[[[FL]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]][[[[[[[[[
Beräkning av informationsvin
Informationsvinst är skillnaden mellan den ursprungliga datasetets entropi och den viktade genomsnittliga entropien efter en split. Det kvantifierar hur mycket osäkerhet som minskas genom att partitionera data baserat på en funktion.
Formeln för informationsvinst är:
Information Gain = Entropy (förälder) - ≥ (vikt på barn) × Entropy(barn)]
Praktiska beräkningssteg
För att beräkna informationsvinst i praktiken, följ dessa steg:
- Beräkna entropi av hela datasetet.
- Dela dataset baserat på funktionen som utvärderas.
- Beräkna entropi för varje delmängd som skapats av splittringen.
- Beräkning av det viktade genomsnittet av dessa entropier.
- Subtrahera detta värde från den ursprungliga entropi för att hitta informationsvinsten.
Exempel
Anta att en datamängd har en initial entropi på 0,94. Efter att ha delats baserat på en funktion är den viktade genomsnittliga entropi av delmängderna 0,5. Informationsvinsten från denna split är 0,44, vilket indikerar en signifikant minskning av osäkerheten.