Table of Contents
Datapisteiden samankaltaisuuden mittaaminen on olennaista valvomattomassa data-analyysissä. Se auttaa tunnistamaan kuvioita, ryhmittymiä ja suhteita dataaineistoissa ilman ennalta määriteltyjä tarroja. Eri laskelmia ja mittareita käytetään määrittämään, miten samanlaisia tai erilaisia tietopisteitä on.
Yleinen Samankaltaisuus Metrics
Useita mittareita käytetään mittaamaan samankaltaisuutta, jokainen sopii erityyppisiin tietoihin ja analyysi tavoitteisiin. Yleisimpiä ovat Euclidean etäisyys, kosine samankaltaisuus, ja Jaccard indeksi.
Eukleidean etäisyys
Eukleidean etäisyys laskee suoran linjan etäisyys kahden pisteen välillä avaruudessa. Sitä käytetään laajalti numeerisia tietoja ja se lasketaan neliöjuuri summa neliöiden eroja kaikkien ominaisuuksien.
Kosiinin samankaltaisuus
Kosiini samankaltaisuus mittaa kahden vektorin välisen kulman kosinia. Se on erityisen hyödyllinen korkean dimensionaalisille tiedoille, kuten teksti- tai asiakirja-analyysille, jossa vektorien suuruus on vähemmän tärkeä kuin niiden suunta.
Jaccard- indeksi
Jaccard-indeksi arvioi samankaltaisuutta kahden sarjan välillä jakamalla niiden risteysalueiden koon niiden liiton koolla. Sitä käytetään yleisesti binäärisiin tai kategorisiin tietoihin.
- Eukleidean etäisyys
- Kosiinin samankaltaisuus
- Jaccard- indeksi
- Manhattanin etäisyys
- Pearson-koreferenssikerroin