Att mäta likhet mellan datapunkter är avgörande i oövervakad dataanalys. Det hjälper till att identifiera mönster, grupperingar och relationer inom datamängder utan fördefinierade etiketter. Olika beräkningar och mätvärden används för att kvantifiera hur lika eller olika datapunkter är.

Vanliga likhetsmetri

Flera mätvärden används för att mäta likheter, var och en lämplig för olika typer av data och analysmål. De vanligaste inkluderar euklidiskt avstånd, kosin likhet och Jaccard index.

Euklidisk avstånd

Euklidiskt avstånd beräknar raklinjen mellan två punkter i rymden. Det används allmänt för numeriska data och beräknas som kvadratroten av summan av kvadratdifferenser över alla funktioner.

Kosin likhet

Kosin likhet mäter kosinet i vinkeln mellan två vektorer. Det är särskilt användbart för högdimensionella data, såsom text eller dokumentanalys, där storleken på vektorer är mindre viktig än deras orientering.

Jaccard Index

Jaccard-indexet utvärderar likhet mellan två uppsättningar genom att dela storleken på deras skärningspunkt med storleken på deras union. Det används vanligen för binära eller kategoriska data.

  • Euklidiskt avstånd
  • Kosin likhet
  • Jaccard index
  • Manhattan Avstånd
  • Pearson korrelation koefficient