Table of Contents
클러스터링은 유사한 데이터 포인트를 그룹에 사용되는 데이터 분석에 공통된 기술입니다. 이러한 클러스터의 품질을 평가하는 것은 정확성이 결정하는 엔지니어링 응용 분야에서 의미있는 결과를 보장하기 위해 필수적입니다. 다양한 미터 및 계산은 아래 데이터 구조와 클러스터링 정렬을 잘 조절하는 방법을 잘 조절하는 데 도움이 됩니다.
내부 평가 미터
내부 메트릭은 데이터 자체에 따라 클러스터의 응집 및 분리를 평가합니다. 그들은 외부 라벨 또는 지상 진실을 필요로하지 않습니다. 이 메트릭은 컴팩트하고 명백한 클러스터가 무엇인지 결정하는 데 도움이됩니다.
- 실루엣 점수:다른 클러스터와 비교된 그 자체 클러스터에 어떻게 유사한 객체가 어떻게 측정합니다. 값은 -1에서 1, 더 나은 클러스터링을 나타내는 더 높은 점수와 함께 배열합니다.
- Dunn Index:다른 클러스터와 최대 인트라 클러스터의 관측 사이의 가장 작은 거리 사이의 비율을 평가합니다. 더 높은 값은 더 나은 분리를 제안합니다.
- Davies-Bouldin Index: 각 클러스터와 가장 유사한 것 사이의 평균 유사성을 계산합니다. 낮은 값은 더 나은 클러스터링을 나타냅니다.
외부 평가 미터
외부 메트릭은 선명한 지상 진실 또는 상표에 클러스터링 결과를 비교합니다. 그들은 감독된 시나리오와 같은 사실 분류가 알려질 때 유용합니다.
- Adjusted Rand Index (ARI): 예측 클러스터와 진정한 라벨 사이의 유사성을 측정, 기회에 맞게 조정. 값은 -1에서 1로 나뉩니다.
- 정상화 된 상호 정보 (NMI): 클러스터링과 진정한 라벨 사이의 상호 의존성을 정의하고, 0과 1 사이의 범위에 정상화.
- Homogeneity Score: 각 클러스터가 단일 클래스의 회원인 데이터 포인트만 포함되는 경우 체크.
계산 및 해석
이 미터를 계산하는 것은 특정 공식과 거리 측정을 포함합니다. 예를 들어, Silhouette Score는 각 지점의 평균 인트라 클러스터 거리와 평균 가장 가까운 클러스터 거리를 사용합니다. 외부 미터는 종종 혼란 매트릭스 또는 연속성 테이블이 진정한 라벨을 가진 예측 클러스터를 비교해야합니다.
결과를 해석하는 것은 컨텍스트에 달려 있습니다. 더 높은 Silhouette 점수와 NMI 값은 더 나은 클러스터링 품질을 나타냅니다. Davies-Bouldin 인덱스가 잘 투여 된 클러스터를 제안합니다. 여러 미터를 결합하면 종합적인 평가를 제공합니다.