クラスタリングは、類似のデータポイントをグループ化するために使用される監視されていない学習の一般的な技術です。 これらのクラスタの質を評価し、有意な洞察を確実にするために不可欠です。 メトリックをクラスタリングすることで、アルゴリズムが実行されているかを評価するための定量的な対策が提供されます。

一般的なクラスタリングメトリック

いくつかのメトリックは、クラスタリング結果を評価するために使用されます。 最も人気のあるものは次のとおりです。

  • [] シルエットスコア[]: オブジェクトが他のクラスターと比較して、独自のクラスターにどのように類似しているかを測定します。
  • []Davies-Bouldin Index[:各クラスターと最も類似したものの間の平均類似性を評価します。
  • Calinski-Harabasz Index[: 両方分散の比率を、内面分散に昇格する。

メトリックの計算

ほとんどのクラスタリングライブラリは、これらのメトリックを計算する関数を提供します。例えば、Pythonのscikit-learnライブラリでは、次のことができます。

[]silhouette score()[, []]]davies bouldin score()[], []]]]calinski harabasz score()]].

これらの関数は、データポイントとその割り当てられたクラスターラベルを入力として要求します。データの事前処理と正規化は、メトリックの信頼性を向上させます。

通訳実績

より高音のシルエットスコアは、明確に定義されたクラスターを示しています, 低いスコアは、重複または不断のグループを示唆しながら、. Davies-Bouldin インデックス, 値が低い, 異なるクラスターを示す. Calinski-Harabasz インデックスは、より高いスコアを支持します, より良いクラスタリング構造を反映しています.