Table of Contents
Clustering er en vanlig teknikk i uovervåket læring som brukes til å gruppere lignende datapunkter. Evaluere kvaliteten på disse klyngene er viktig for å sikre meningsfull innsikt. Clustering metriske gir kvantitative tiltak for å vurdere hvor godt algoritmen har utført.
Vanlige Clustering Metrics
Flere metrikker brukes til å evaluere klyngeresultater. De mest populære inkluderer:
- Silhouette Score: Måler hvor lignende et objekt er til sin egen klynge sammenlignet med andre klynger.
- Davies-Bouldin Index: Evaluerer gjennomsnittlig likhet mellom hver klynge og dens mest lignende.
- Calinski-Harabasz Index: Assesserer forholdet mellom clusterdispersjon til inner-cluster dispersjon.
Beregner metrics
De fleste biblioteker gir funksjoner for å beregne disse metrikkene. For eksempel i Pythons Scikit-learn-bibliotek kan du bruke:
silhouette score(), ]davies bouldin score() og calinski harabasz score()].
Disse funksjonene krever datapunktene og deres tildelte klyngeetiketter som inngang. Korrekt forbehandling og normalisering av data forbedre påliteligheten til metrikkene.
Tolkningsresultater
Høyere silhuettscore indikerer veldefinerte klynger, mens lavere poeng tyder på overlappende eller dårlig adskilte grupper. For Davies-Bouldin-indeksen er lavere verdier bedre, noe som indikerer forskjellige klynger. Calinski-Harabasz-indeksen favoriserer høyere poeng, noe som reflekterer bedre klyngestruktur.