Table of Contents
단어는 비슷한 단어나 구문이 벡터 표현에 근거한 방법을 측정하기 위해 자연어 처리에서 사용됩니다. 이 점수는 semantic 분석, 정보 검색 및 기계 번역과 같은 작업에 도움이 됩니다.
Word Embeddings에 대한 이해
Word embeddings는 Word2Vec, GloVe, 또는 FastText와 같은 알고리즘에 의해 생성 된 단어의 밀도 벡터 표현입니다. 각 단어는 비슷한 단어가 함께 위치 한 높은 차원 공간으로 맵핑됩니다.
비슷한 성적 점수
두 단어 embeddings 사이 유사성을 계산하는 가장 일반적인 방법은 cosine 유사성을 사용합니다. 이 두 벡터 사이의 각도의 코신을 측정하고, 이와 유사한 방향으로 설명합니다.
Cosine 유사성을 계산하는 단계
- 단어의 벡터 표현을 얻습니다.
- 두 개의 벡터의 점토 제품을 계산합니다.
- 각 벡터의 크기 (길이)를 계산합니다.
- 점진적 제품의 도트 제품을 나눕니다.
코신 유사성을위한 공식은 다음과 같습니다.
코시 유사성 = (A · B) / (|A| *|B|)
점수를 해석
-1에서 1까지의 Cosine 유사점 점수 범위. 1점에 가까운 점수는 높은 유사성을 나타냅니다. 0은 유사성을 나타내지 않으며 -1은 반대의 의미를 나타냅니다.