監視されていないデータ解析では、データポイント間の類似性を測定する。定義済みのラベルなしでデータセット内のパターン、グループ化、および関係を識別するのに役立ちます。さまざまな計算とメトリックは、どのように異なるデータポイントが重要であるかを定量化するために使用されます。

一般的な類似性メトリック

複数のメトリックは、さまざまな種類のデータと分析の目標に適した、類似性を測定するために使われます。 最も一般的なのは、Euclidean距離、コサイン類似性、およびJaccardインデックスが含まれます。

エークリッド距離

ユークリッド距離は、空間内の2つの点間の直線距離を計算します。それは、数値データに広く使用され、すべての機能の四角形の差の列の根として計算されます。

化粧品の類似性

同等性は、2つのベクトル間の角度のコサインを測定します。特に、テキストや文書解析などの高次元データに有用で、ベクトルの倍率は、その方向よりも重要ではありません。

ジャックカード指数

Jaccard指数は、そのユニオンのサイズで交差点のサイズを分割することにより、2セット間の類似性を評価します。 これは、バイナリまたは分類データに一般的に使用されます。

  • エークリッド距離
  • 同等性コサイン
  • ジャックカード指数
  • マンハッタン・距離
  • ピアソン相関係数