Klustrering är en vanlig teknik i oövervakat lärande som används för att gruppera liknande datapunkter. Utvärdera kvaliteten på dessa kluster är avgörande för att säkerställa meningsfulla insikter. Klustreringsmetri ger kvantitativa åtgärder för att bedöma hur väl algoritmen har utfört.
Vanliga Clusteringsmetri
Flera mätvärden används för att utvärdera klusterresultat. De mest populära inkluderar:
- Silhouette Score]: Åtgärder som liknar ett objekt är för sitt eget kluster jämfört med andra kluster.
- ]Davies-Bouldin Index: Utvärderar den genomsnittliga likheten mellan varje kluster och dess mest likartade.
- ]Calinski-Harabasz Index: Bedöm förhållandet mellan klusterspridning till dispersion av kluster.
Beräkning av metrikerna
De flesta klustring bibliotek ger funktioner för att beräkna dessa mätvärden. Till exempel, i Pythons scikit-learn bibliotek, kan du använda:
]] ]] []]]]]] davies bouldin score()]] och ]]]]calinski harabasz score()]]].
Dessa funktioner kräver datapunkter och deras tilldelade klusteretiketter som ingång. Korrekt förbehandling och normalisering av data förbättrar mätningarnas tillförlitlighet.
Tolkningsresultat
Högre silhuettpoäng indikerar väldefinierade kluster, medan lägre poäng tyder på överlappning eller dåligt separerade grupper. För Davies-Bouldin-indexet är lägre värden bättre, vilket indikerar distinkta kluster. Calinski-Harabasz-indexet gynnar högre poäng, vilket återspeglar bättre klustringsstruktur.