Table of Contents
거리 측정은 데이터 포인트와 유사한 차이를 평가하기 위해 알고리즘을 활성화하는 데 필수적인 도구입니다. 클러스터링, 치수 감소 및 무독성 검출 프로세스에 영향을줍니다. 이러한 측정이 계산되고 적용된 방법을 이해하는 것은 기계 학습 모델의 효과를 향상시킵니다.
일반적인 거리 측정
몇몇 거리 측정은 unsupervised 학습에서 널리 이용됩니다. 선택은 자료 유형 및 특정한 신청에 달려 있습니다.
- Euclidean 거리: 공간에 2점 사이의 직선 거리를 계산합니다.
- Manhattan 거리:] 차원의 절대 차이를 합리화 그리드 같은 경로에 근거한 거리를 측정합니다.
- Cosine 유사성: 두 벡터 사이의 각도의 코신을 증발시켜, 그들의 오리엔테이션 유사성을 나타내는.
- Jaccard Index:] 바이너리 또는 카카테고리 데이터에 유용한 무한 세트와 유사성을 측정합니다.
거리 측정의 계산
계산은 측정에 따라 다릅니다. 예를 들어, 점 사이의 Euclidean 거리 A]와 B 좌표 (x]]1]], y1) 및 (x[FLTLT:8]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]][
√ ((x]2 - x]]1]]]]]]]2]+]2]]] - y1)2]]2]]
다른 조치는 자체 공식이 있으며 종종 summations 또는 ratios를 포함하는 기능을 가지고 있습니다.
거리 측정의 신청
거리 측정은 다양한 unsupervised 학습 작업에서 사용됩니다:
- 클러스터링: K-means와 같은 알고리즘은 비슷한 데이터 포인트를 그룹에 거리 계산에 의존합니다.
- 차원 감소: t-SNE 사용 거리와 같은 기술로 낮은 치수의 데이터 구조를 보존합니다.
- Anomaly Detection: 일반적인 데이터 클러스터에서 거리를 기반으로 아웃리에 식별합니다.