情報収集の計算は、決定ツリーの構築の基本的なステップです。各ノードでデータを分割し、モデルの精度を向上させるための最良の機能を決定するのに役立ちます。このプロセスは、特定の属性に基づいてデータセットが分割された後に、エントロピーの減少を測定することを含みます。

Entropyの理解

酵素は、データセット内の障害や不純物を測定します。データセット内の各クラスの確率を用いて計算されます。混合クラスを持つデータセットは、より高いエントロピーを持ち、純粋なデータセットはエントロピーが低いです。

entropy の式は次のとおりです。

]Entropy = - Δ pi] log]2 p]i

情報収集の計算

情報ゲインは、元のデータセットと分割後の重み付き平均エントロピーのエントロピーの違いです。機能に基づいてデータを分割することで、不確実性がどのくらい減少するかを数値化します。

情報ゲインの式は次のとおりです:

情報ゲイン=エントロピー(親) - ➽(子供)×エントロピー(子供)

実用的な計算ステップ

情報の収集を実践するために、次の手順に従ってください。

  • データセット全体に不適切を計算します。
  • 評価される機能に基づいてデータセットを分割します。
  • 分割で生成されたサブセットごとにエントロピーを計算します。
  • これらのエントロピーの重みのある平均を計算します。
  • 元のエントロピーからこの値を抽出して、情報の取得を見つけます。

事例紹介

データセットは0.94の初期のエントロピーを持っています。 機能に基づいて分割した後、サブセットの重み付き平均エントロピーは0.5です。 この分割からの情報収集は、不確実性を大幅に削減することを示す0.44です。