階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階
階層クラスタリングは、類似のデータポイントをクラスターにグループ化するためにデータ解析で使用される方法です。 さまざまなレベルの類似性におけるデータポイント間の関係を示す、デンドログラムと呼ばれるツリーのような構造を作成します。 この技術は、クラスタの数を事前に定義することなく、データ内の自然なグループ化を理解するのに便利です。
階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階層階
階層クラスタリングは、ステップバイステッププロセスでクラスタを構築します。個々のデータポイントから始まり、より大きなクラスターにそれらをマージしたり、大規模なクラスタで始まり、より小さなものに分割したり、凝集したりすることができます。選択は、特定の分析の目標に依存します。
階層クラスタリングの実装手順
実装には、いくつかの重要なステップが含まれます。
- データ作成:] データを収集し、処理し、適切にスケールアップします。
- []距離メトリックの選択:[ 類似性を測定する方法を選択します。例えば、Euclideanやマンハッタンの距離。
- [] 連携基準:[] は、クラスターをマージする方法を決定し、オプションには、シングル、完了、または平均的なリンクが含まれます。
- Dendrogram:[の構成アルゴリズムを使用して、選択したパラメータに基づいて階層ツリーを構築します。
- クラスターの決定:]] 最終クラスターを定義するために、特定のレベルでデドログラムをカットします。
実用的なヒント
階層的なクラスタリングを適用するときは、次のヒントを検討してください。
- デンドログラムを視覚化して、データの関係を把握します。
- 最適なフィット方法を見つけるために、さまざまなリンク方法で実験。
- ドメインの知識を使用して、クラスターの適切な数を選択します。
- 偏差が大きい範囲の機能から防ぐためにデータがスケールアップされていることを確認します。