데이터 포인트 사이의 유사성을 측정하는 것은 비초시 데이터 분석에 필수적입니다. 미리 정의된 라벨없이 데이터셋 내에서 패턴, 그룹화 및 관계 식별에 도움이 됩니다. 다양한 계산 및 메트릭은 어떻게 알맞는지 또는 다른 데이터 포인트가 있는지 확인하는 데 사용됩니다.

일반적인 유사성 미터

몇몇 미터는 유사한 측정하기 위하여 이용됩니다, 자료와 분석 목표의 다른 유형을 위해 각 적당한. 가장 일반적인은 Euclidean 거리, cosine 유사성 및 Jaccard 색인을 포함합니다.

Euclidean 거리

Euclidean 거리는 공간에 있는 2개 점 사이 똑바른 선 거리를 산출합니다. 그것은 수치 데이터에 널리 이용되고 모든 특징의 맞은 다름의 합계의 정연한 뿌리로 computed.

Cosine 유사성

Cosine 유사성은 두 개의 벡터 사이의 각도의 코신을 측정합니다. 그것은 텍스트 또는 문서 분석과 같은 높은 치수 데이터에 특히 유용합니다. 벡터의 규모가 방향보다 덜 중요합니다.

Jaccard 인덱스

Jaccard 인덱스는 두 세트 사이의 유사성을 평가하여 조합의 크기로 교차의 크기를 분할하여. 그것은 일반적으로 바이너리 또는 categorical 데이터를 위해 사용됩니다.

  • Euclidean 거리
  • Cosine 유사성
  • Jaccard 인덱스
  • 맨해튼 거리
  • Pearson 상관 계수