Table of Contents
计算信息收益是构建决策树的一个基本步骤。它有助于确定在每个节点分割数据的最佳特性,提高模型的准确性。这一过程涉及在数据集根据特定属性进行分割后测量Entropy的减少量。
理解内涵
Entropy 测量数据集中的杂乱或杂乱。它是用数据集内每个类的概率来计算的。一个混合类的数据集具有更高的 ⁇ ,而纯数据集具有较低的 ⁇ 。
⁇ 的配方为:
输入= - ⁇ p i 日志 2 ] p i ]]
计算信息收益
信息增益是原始数据集的 ⁇ 与一个分割后加权平均 ⁇ 的差数,它量化了根据一个特性分割数据减少多少不确定性.
信息收益的公式是:
信息增益=Entropy(父母) - ⁇ (儿童重量) → Entropy(儿童)
实际计算步骤
为了计算实际的信息收益,遵循这些步骤:
- 计算整个数据集的 ⁇ 。
- 根据正在评估的特性分割数据集 。
- 计算由拆分创建的每个子集的 ⁇ 。
- 计算这些 ⁇ 的加权平均值.
- 从原始的 ⁇ 中减去此值以找到信息收益.
示例
如果数据集的初始演算为0.94,则在根据特性进行分割后,子集的加权平均演算为0.5。这种分割所产生的信息收益为0.44,表明不确定性显著减少。