距離測定は、監視されていない学習において不可欠なツールであり、アルゴリズムがデータポイント間の類似性や差分を評価することを可能にします。 それらは、クラスタリング、寸法の縮小、異常検知プロセスに影響を及ぼします。 これらの措置がどのように計算され、適用されたのかを理解することで、機械学習モデルの有効性が向上します。

一般的な距離測定

監視されていない学習では、いくつかの距離測定が広く使用されています。選択はデータの種類と特定のアプリケーションによって異なります。

  • ] 空距離: は、スペースの2つのポイント間の直線距離を計算します。
  • []マンハタン距離:[]]]グリッドのようなパスに基づいて距離を測定し、寸法の絶対的な違いを要約します。
  • []Cosine類似性:[]]]は、2つのベクトル間の角度のコサインを評価し、その方向の類似性を示します。
  • ジャックカードインデックス:[]] は、バイナリや分類データに便利な、finiteセット間の類似性を測定します。

距離計測の計算

計算は、測定値によって異なります。例えば、ポイント[]]とのBの座標(x]]1[]]]]、y]])と(x])と(]]]1[]]]]]1[]]]]]]]、[[FLT:]]]))))) [[[F]]]]]] [[[[[[[[[[FLT:[FLT:[FLT:[FLT:[FLT:[F]]]]]]]]]]]]]]]]]] [[[[[[[[[[[[[[[[[[[F]]]]]]]]]]]]]]]]]]]]]

√(((x)]2] - x]]]1]])[]2] +(]]2[[[[]]]] - []]]])[[22]]]

その他の対策は、独自の式を持ち、多くの場合、機能の要約や比率を関与しています。

距離計測の適用

距離測定は、さまざまな監視されていない学習タスクで使用されます。

  • :]の解析は、K-meansのようなアルゴリズムは、類似のデータポイントをグループ化するために距離計算に依存しています。
  • 寸法の縮小:[]] t-SNEなどの技術は、低次元のデータ構造を維持するために距離を使用しました。
  • 異常検知:]] 一般的なデータクラスターからの距離に基づいてアウトレイを識別します。