Table of Contents
는 언어의 가장 중요한 작업입니다. 그것은 정보 검색, 텍스트 요약 및 질문에 대한 답변과 같은 응용 프로그램에 도움이. 이 가이드는 두 가지 일반적인 방법 : 코신 유사성 및 Jaccard 유사성을 사용하여 문장 유사성을 계산하는 방법을 설명합니다.
이해 관계
문장의 유사성은 두 문장과 같은 방법을 측정하는 것은 그들의 내용에 근거합니다. 그것은 숫자 벡터로 문장을 변환하고 특정 수학 공식을 사용하여이 벡터를 비교합니다. 두 인기있는 방법은 코신 유사성 및 Jaccard 유사성입니다.
Cosine 유사성
코신 유사성은 두 개의 벡터 사이의 각도의 코신을 계산합니다. 그것은 -1에서 1까지의 범위, 즉 1 동일한 벡터를 나타냅니다, 0은 정교함을 나타냅니다, -1은 벡터 반대를 나타냅니다. 그것을 계산하기 위해, 문장은 먼저 벡터로 변환, 종종 TF-IDF 또는 단어 embeddings와 같은 기술을 사용하여.
Cosine 유사성을 위한 공식은:
코시 유사성 = (A · B) / (||A||||||B||||]
벡터와 "·" 도트 제품을 기소하고|A||||B||||| 벡터의 규모입니다.
Jaccard 유사성
Jaccard 유사성은 두 세트 사이의 오버랩을 측정합니다. 그것은 세트의 조합의 크기로 나뉘는 교차로의 크기로 계산됩니다. 이 방법은 문장의 존재 또는 부재를 비교할 때 유용합니다.
Jaccard 유사성의 공식은 다음과 같습니다.
Jaccard 유사성 = |A ∩ B|/ |A ゚ B|
A와 B는 각 문장에서 단어를 설정합니다. 간호자는 일반적인 단어를 계산하고, denominator는 두 문장에서 총 고유 단어를 계산합니다.
계산 단계
문장의 유사성을 계산하려면 다음 단계를 따르십시오.
- 습득 및 습격을 제거하여 사전처리 문장.
- 벡터로 문장을 변환하거나 단어의 세트.
- 비슷한 점수를 얻기 위해 코신 또는 Jaccard 공식을 적용하십시오.
더 높은 점수는 문장 사이의 더 큰 유사성을 나타냅니다.