測定文の類似性は、自然言語処理における重要なタスクです。それは、情報検索、テキストの要約、質問の回答などのアプリケーションで役立ちます。このガイドでは、コサイン類似性とジャカード類似性を2つの一般的な方法を使用して、文章の類似性を計算する方法について説明します。

センテンス類似性を理解する

文章の類似性は、その内容に基づいて2つの文様がどのようになるかを測定します。 これは、文章を数値ベクトルに変換し、特定の数学式を使用して、これらのベクトルを比較することを含みます。 2つの一般的な方法は、Cosine類似性およびJaccard類似性です。

化粧品の類似性

同等性は、二つのベクトル間の角度のコサインを計算します。 1つは同じベクトル、0は直角性を表し、-1は反対のベクトルを示します。それを計算するために、文は最初にベクトルに変換され、多くの場合、TF-IDFや単語の埋め込みなどの技術を使用して、します。

Cosineの類似性のための方式はあります:

[ 化粧品類似性 = (A・B) / (|A||||||B|||)[[]

A・Bがベクトルである場合、ドット製品を「・」と表記し、|A|||・||B|はベクトルの大きさです。

ジャカード類似性

ジャックカードの類似性は、2セット間の重複を測定します。 これは、セットのユニオンの大きさによって分かれている交差点のサイズとして計算されます。 この方法は、文章の存在や単語の欠如を比較するときに便利です。

ジャカードの類似性のための式は次のとおりです。

ジャックカード類似性 = |A ☞ B| |A ́B|[

AとBが各文から単語のセットである場合。 数字は共通語をカウントし、デノミネーターは両方の文間で合計のユニークな単語をカウントします。

計算のための実用的なステップ

文の類似性を計算するには、次の手順に従ってください。

  • 句読点を取除き、単語を止めることによる前処理の文。
  • 文をベクトルに変換したり、単語のセットにしたりします。
  • 類似点スコアを得るためにコサインまたはジャックカード式を適用します。

より高いスコアは、文章間のより類似性を示します。