Table of Contents
Samankaltaisuuspisteitä käytetään luonnollisen kielen käsittelyssä mittaamaan, miten samanlaiset kaksi sanaa tai lausetta perustuvat vektoriedustuksiin. Nämä tulokset auttavat esimerkiksi semanttisessa analyysissa, tiedonhaussa ja konekäännöksissä.
Sanan ymmärtäminen
Sanan upottaminen on tiheää vektoriedustusta algoritmien kuten Word2Vecin, GloVen tai FastTextin tuottamista sanoista. Jokainen sana on kartoitettu korkea-ulotteiseen tilaan, jossa samanlaiset sanat sijoitetaan lähemmäs toisiaan.
Samankaltaisuuden pisteiden laskeminen
Yleisin menetelmä laskea samankaltaisuus kahden sanan upotus on käyttäen kosine samankaltaisuus. Tämä mittaa cosine kulman välillä kaksi vektoria, osoittaa, miten samanlaisia niiden suuntiin ovat.
Kosiinin samankaltaisuuden laskentavaiheet
- Hanki vektorikuvat sanoista.
- Lasketaan kahden vektorin pistetuote.
- Lasketaan kunkin vektorin suuruus (pituus).
- Jaa piste tuote suuruusluokan mukaan.
Kosiinin samankaltaisuuden kaava on:
Kosine Yhtäläisyys = (A · B) / (...A. * ....................................................................................................................................................................................................................................
Tulosten tulkinta
Kosiinin samankaltaisuuspisteet vaihtelevat -1-1. A pisteet lähellä 1 osoittaa suurta samankaltaisuutta, 0 ei viittaa samankaltaisuuteen, ja -1 osoittaa vastakkaisia merkityksiä.