Mesure et instrumentation
Calcul des paramètres de regroupement : une approche pratique de l'évaluation de l'apprentissage non supervisé
Table of Contents
Le regroupement est une technique courante d'apprentissage non supervisé utilisée pour regrouper des points de données similaires. L'évaluation de la qualité de ces groupes est essentielle pour assurer des renseignements significatifs.
Statistiques communes de regroupement
Plusieurs mesures sont utilisées pour évaluer les résultats des regroupements. Les plus populaires sont les suivants :
- Score de silhouette: Mesure la similitude d'un objet avec son propre cluster par rapport à d'autres clusters.
- Indice de Davies-Bouldin : Évaluer la similitude moyenne entre chaque cluster et son plus similaire.
- Calinski-Harabasz Index: évalue le rapport de dispersion entre les groupes à dispersion à l'intérieur des groupes.
Calcul des paramètres
La plupart des bibliothèques de regroupement fournissent des fonctions pour calculer ces paramètres. Par exemple, dans la bibliothèque de Scikit-learn de Python, vous pouvez utiliser :
silhouette score(), davies bouldin score(), et calinski harabasz score().
Ces fonctions exigent que les points de données et les étiquettes de regroupement qui leur sont attribuées soient entrées. Le prétraitement et la normalisation appropriés des données améliorent la fiabilité des mesures.
Interprétation des résultats
Les scores de silhouette plus élevés indiquent des grappes bien définies, tandis que les scores plus bas suggèrent des groupes chevauchants ou mal séparés. Pour l'indice Davies-Bouldin, les valeurs plus basses sont meilleures, ce qui indique des grappes distinctes.