Расчет информационного выигрыша при строительстве деревьев решений на практике
Расчет прироста информации является фундаментальным шагом в построении деревьев решений. Он помогает определить наилучшую особенность для разделения данных на каждом узле, повышая точность модели. Этот процесс включает измерение снижения энтропии после разделения набора данных на основе конкретного атрибута.
Понимание энтропии
Энтропия измеряет расстройство или примеси в наборе данных. Она рассчитывается с использованием вероятности каждого класса в наборе данных. Набор данных со смешанными классами имеет более высокую энтропию, в то время как чистый набор данных имеет более низкую энтропию.
Формула для энтропии:
Энтропия = -∑ pi log2 pi
Расчет информационного выигрыша
Информационный прирост — это разница между энтропией исходного набора данных и средневзвешенной энтропией после разделения. Он количественно определяет, насколько неопределенность уменьшается путем разделения данных на основе функции.
Формула получения информации заключается в следующем:
Информационный прирост = энтропия (родитель) - ∑ (вес ребенка) × энтропия (ребенок)
Практические шаги расчета
Чтобы вычислить полученную информацию на практике, выполните следующие действия:
- Вычислите энтропию всего набора данных.
- Разделите набор данных на основе оцениваемой функции.
- Вычислите энтропию для каждого подмножества, созданного разделением.
- Вычислите средневзвешенное значение этих энтропий.
- Вычтите это значение из исходной энтропии, чтобы найти информационный выигрыш.
Пример
Предположим, что набор данных имеет начальную энтропию 0,94. После расщепления на основе признака средневзвешенная энтропия подмножеств составляет 0,5.Получение информации от этого расщепления составляет 0,44, что указывает на значительное снижение неопределенности.