Hierarchical clustering은 클러스터의 계층 구조를 구축하는 클러스터 분석의 방법입니다. 그것은 데이터 분석에서 그룹 유사한 개체에 널리 사용됩니다. 이 기술은 데이터의 구조를 이해하고 자연 그룹화를 식별하는 데 유용합니다.

Hierarchical 클러스터의 기본 개념

계층 클러스터링 뒤에 주요 아이디어는 dendrogram라는 나무 같은 구조를 만드는 것입니다. 이 표는 데이터 포인트가 유사성의 다양한 수준에서 그룹화되는 방법을 보여줍니다. 이 과정은 개별 데이터 포인트와 결합하여 하나의 클러스터에 모든 데이터 포인트와 분할을 시작으로, 수 있습니다.

히어로시의 단계

관련 일반적인 단계는:

  • Euclidean 거리와 같은 선택된 미터를 사용하여 데이터 포인트 사이의 거리를 계산합니다.
  • 링크리지 크리터에 기반한 두 개의 가장 가까운 지점 또는 클러스터를 넣으십시오.
  • 새로운 클러스터를 반영하기 위해 거리 매트릭스를 업데이트합니다.
  • 모든 데이터 포인트가 단일 클러스터 또는 정지 크리터로 그룹화될 때까지 merging 프로세스를 반복합니다.

Practical 구현 예

Python의 SciPy 라이브러리를 사용하여 계층 클러스터링은 효율적으로 구현할 수 있습니다. 다음 예제는 데이터셋에서 agglomerative 클러스터링을 수행하는 방법을 설명합니다.

코드 스니펫:

``python import numpy as np from scipy.cluster.hierarchy import linkage, dendrogram import matplotlib.pyplot as plt # 샘플 데이터 = np.array ([1, 2], [3, 4], [5, 6], [8, 8], [9, 10]]]) # hierarchical clustering connected = linkage(data, method==single plt’dul(single).

Hierarchical 클러스터링의 응용

Hierarchical clustering은 유전자 발현 분석, 고객 세그먼트 마케팅 및 객체 인식에 대한 이미지 분석과 같은 다양한 분야에서 사용됩니다. 여러 수준에서 데이터 구조를 공개하는 능력은 다양한 도구입니다.