Table of Contents
Hierarchical clustering은 데이터 분석에서 그룹과 유사한 데이터 포인트를 기능에 따라 클러스터에 사용하는 방법입니다. 복잡한 데이터셋 내에서 패턴과 구조를 식별하는 다양한 분야에서 널리 사용됩니다. 이 문서는 계층 클러스터링의 방법을 탐구하고 실용적인 응용 프로그램을 민주화하는 사례 연구.
Hierarchical 클러스터링 방법
Hierarchical 클러스터링은 다른 수준에서 형성된 클러스터의 배열을 설명하는 데 dendrogram이라는 나무 같은 구조를 구축합니다. 두 가지 주요 접근법이 있습니다. agglomerative 및 divisive.
Agglomerative 클러스터링
이 하단 업 방법은 각 데이터 포인트를 개별 클러스터로 시작합니다. 즉, 클러스터의 가장 가까운 쌍을 멈출 때까지 클러스터의 근접한 쌍을 충족합니다. 클러스터 또는 거리 임계값과 같은 클러스터의 원하는 수와 같은.
디바이브 클러스터링
이 상단의 접근법은 단일 클러스터의 모든 데이터 포인트로 시작합니다. 즉, 가장 특정 클러스터에 가장 넓은 계층을 생성하는 디미라리티를 기반으로 한 작은 그룹으로 클러스터를 분리합니다.
사례 연구
Hierarchical clustering은 다양한 실제 시나리오에서 성공적으로 적용되었습니다. 예를 들어, biology의 마케팅, 유전자 표현 분석 및 문서 분류에 대한 고객 세그먼트가 포함되어 있습니다.
- Customer Segmentation: 기업 그룹 고객 맞춤 마케팅 전략에 대한 구매 행동을 기반으로.
- Genomics: 생물 기능을 이해하기 위해 유사한 표현 패턴을 가진 유전자를 분류하는 연구자.
- Document Clustering:] 쉬운 탐색을 위한 주제로 문서의 큰 컬렉션을 구성합니다.