Hierarchical clustering은 클러스터에 유사한 데이터 포인트를 그룹화하는 데이터 분석에서 사용되는 방법입니다. 그것은 다양한 유사한 수준에서 데이터 포인트 중 관계를 보여주는 데 dendrogram라는 나무 같은 구조를 만듭니다. 이 기술은 클러스터의 수를 미리 정의하지 않고 데이터 내의 자연 그룹화에 대한 유용합니다.

Hierarchical 클러스터링 이해

Hierarchical 클러스터링은 단계별 프로세스에서 클러스터를 구축합니다. 그것은 개인 데이터 포인트로 시작하고 더 큰 클러스터로 merging하거나 디비스를 merging, 1 개의 큰 클러스터로 시작하고 더 작은 것들로 분할 할 수 있습니다. 선택은 특정 분석 목표에 따라 다릅니다.

Hierarchical 클러스터 구현 단계

구현은 몇 가지 핵심 단계가 포함되어 있습니다.

  • Data Preparation: 수집 및 전처리 데이터, 적절하게 정리하고 확장됩니다.
  • ]거리의 거리의 거리의 거리의 위치를 측정:] Euclidean 또는 Manhattan 거리와 같은 유사성을 측정하는 방법을 선택하십시오.
  • Linkage Criteria: 클러스터를 합병하는 방법을 결정하고, 옵션은 단일, 완전한, 또는 평균 링크가 포함되어 있습니다.
  • Ddendrogram: 선택된 매개 변수에 따라 계층 트리를 구축하는 알고리즘을 사용합니다.
  • Determining Clusters:] 최종 클러스터를 정의하기 위해 특정 수준에서 dendrogram을 잘라.

연습 팁

계층 클러스터링을 적용할 때 다음 팁을 고려하십시오.

  • 데이터 관계를 이해하기 위해 dendrogram을 시각화합니다.
  • 가장 적합한 것을 찾을 수있는 다른 링크 방법 실험.
  • 클러스터의 적절한 수를 선택하기 위해 도메인 지식을 사용합니다.
  • Data를 더 큰 범위로 기능에서 bias를 방지하기 위해 스케일링됩니다.