Table of Contents
데이터 세트는 데이터 세트의 기본 단계로, 데이터 세트는 특정 속성을 기반으로 한 데이터 세트의 감소를 측정합니다. 데이터 세트는 특정 속성을 기반으로 한 데이터 세트가 나타날 때, 데이터 세트의 감소를 측정하는 데 도움이됩니다.
Entropy 이해
Entropy는 데이터셋에 장애 또는 불순을 측정합니다. 데이터셋 내에서 각 클래스의 확률을 계산합니다. 혼합 클래스의 데이터셋은 높은 엔트로피를 가지고 있으며, 순수 데이터셋은 더 낮은 엔트로피를 가지고 있습니다.
entropy의 공식은:
엔트로피 = - ∑ p]i]]] ]]2]] p]i] ]]
캘리포니아
정보 이득은 원래 데이터 세트의 열광과 분할 후 체중 평균 열광의 차이입니다. 그것은 기능에 따라 데이터를 분할하여 얼마나 많은 불확실한 감소를 정량화합니다.
정보 이득의 공식은:
정보가 = Entropy(parent) - ∑(아이들의 무게) × Entropy(아이)
실제 계산 단계
연습에 대한 정보 이득을 계산하려면, 다음 단계를 따르십시오:
- 전체 dataset의 열 대변을 계산합니다.
- 평가되는 기능에 근거를 둔 dataset를 분할하십시오.
- 분할에 의해 생성 된 각 하위 세트에 대한 열광을 계산합니다.
- 이 열 대의 중량을 계산합니다.
- 원본의 엔트로피에서이 값을 뺍니다.
이름 *
데이터 세트를 공급하는 것은 0.94의 초기 엔트로피가 있습니다. 기능을 기반으로 나누는 후, 하위 세트의 무게가 큰 평균 엔트로피는 0.5입니다. 이 분할의 정보 이득은 0.44이며, 불확실한 감소를 나타냅니다.