Similarité quantifiante : Calculs et mesures pour l'analyse de données non supervisée

La mesure de la similitude entre les points de données est essentielle dans l'analyse des données non supervisées. Elle aide à identifier les modèles, les regroupements et les relations au sein des ensembles de données sans étiquettes prédéfinies.

Similarité commune

Plusieurs mesures sont utilisées pour mesurer la similitude, chacune convenant à différents types de données et objectifs d'analyse. Les plus courantes sont la distance euclidienne, la similitude cosine et l'indice Jaccard.

Distance euclidienne

La distance euclidienne calcule la distance linéaire entre deux points dans l'espace. Elle est largement utilisée pour les données numériques et est calculée comme la racine carrée de la somme des différences carrées sur toutes les caractéristiques.

Similarité avec les cosinus

La similitude des cosinus mesure le cosinus de l'angle entre deux vecteurs. Elle est particulièrement utile pour les données à haute dimension, comme l'analyse de texte ou de document, où l'ampleur des vecteurs est moins importante que leur orientation.

Index de Jaccard

L'indice Jaccard évalue la similitude entre deux ensembles en divisant la taille de leur intersection par la taille de leur union. Il est couramment utilisé pour les données binaires ou catégoriques.