Table of Contents
데이터 포인트 사이의 유사성을 측정하는 것은 비초시 데이터 분석에 필수적입니다. 미리 정의된 라벨없이 데이터셋 내에서 패턴, 그룹화 및 관계 식별에 도움이 됩니다. 다양한 계산 및 메트릭은 어떻게 알맞는지 또는 다른 데이터 포인트가 있는지 확인하는 데 사용됩니다.
일반적인 유사성 미터
몇몇 미터는 유사한 측정하기 위하여 이용됩니다, 자료와 분석 목표의 다른 유형을 위해 각 적당한. 가장 일반적인은 Euclidean 거리, cosine 유사성 및 Jaccard 색인을 포함합니다.
Euclidean 거리
Euclidean 거리는 공간에 있는 2개 점 사이 똑바른 선 거리를 산출합니다. 그것은 수치 데이터에 널리 이용되고 모든 특징의 맞은 다름의 합계의 정연한 뿌리로 computed.
Cosine 유사성
Cosine 유사성은 두 개의 벡터 사이의 각도의 코신을 측정합니다. 그것은 텍스트 또는 문서 분석과 같은 높은 치수 데이터에 특히 유용합니다. 벡터의 규모가 방향보다 덜 중요합니다.
Jaccard 인덱스
Jaccard 인덱스는 두 세트 사이의 유사성을 평가하여 조합의 크기로 교차의 크기를 분할하여. 그것은 일반적으로 바이너리 또는 categorical 데이터를 위해 사용됩니다.
- Euclidean 거리
- Cosine 유사성
- Jaccard 인덱스
- 맨해튼 거리
- Pearson 상관 계수