Table of Contents
Unsupervised 모델은 라벨 출력없이 데이터를 분석하는 데 사용됩니다. 성능 평가는 데이터 구조를 이해하는 모델 캡처를 측정하는 특정 미터가 필요합니다. 이 문서는 일반적인 미터, 계산 및 결과를 해석하는 방법을 논의합니다.
일반적인 평가 미터
몇몇 미터는 질 측정 및 차원 감소 평가를 포함하여 unsupervised 모형을 평가하기 위하여 이용됩니다. 이 미터는 효과적으로 모형이 자료 본을 대표하는 방법을 결정하는 것을 도울 것입니다.
미터 및 계산
널리 사용되는 메트릭은 Silhouette Score이며, 다른 클러스터와 비교하여 객체가 자체 클러스터에 어떻게 유사한지 측정합니다. -1에서 1까지의 범위는 더 나은 클러스터링을 나타내는 더 높은 값입니다.
또 다른 메트릭은 클러스터 분리와 조밀함을 평가하는 Davies-Bouldin Index입니다. 낮은 값은 더 나은 클러스터링 품질을 제안합니다.
차원 감소를 위해, 설명된 Variance 비율은 주요 성분에 의해 얼마나 많은 정보가 유지되는지 나타냅니다. 그것은 각 성분에 의해 설명된 variance를 요약해서 산출됩니다.
결과의 해석
높은 Silhouette 점수는 잘 정의된 클러스터를 불허하며, Davies-Bouldin Index 값이 명확한 분리를 제안한다. 치수 감소에서, 더 높은 설명 된 Variance 비율은 더 효과적인 데이터 압축을 나타냅니다.
다른 모델이나 매개 변수 설정에서 이러한 메트릭을 비교하는 것이 중요합니다. 특정 데이터셋에 가장 적합한 접근 방식을 선택하십시오.