Messung und Instrumentierung
Berechnung von Clustering-Metriken: Ein praktischer Ansatz für die Bewertung von unüberwachtem Lernen
Table of Contents
Clustering ist eine gängige Technik beim unüberwachten Lernen, die zur Gruppierung ähnlicher Datenpunkte verwendet wird. Die Bewertung der Qualität dieser Cluster ist unerlässlich, um aussagekräftige Erkenntnisse zu gewährleisten. Clustering-Metriken bieten quantitative Maßnahmen zur Beurteilung der Leistung des Algorithmus.
Gemeinsame Clustering-Metriken
Mehrere Metriken werden verwendet, um Clustering-Ergebnisse zu bewerten, darunter:
- Silhouette Score: Bemisst, wie ähnlich ein Objekt seinem eigenen Cluster im Vergleich zu anderen Clustern ist.
- Davies-Bouldin Index: Bewertet die durchschnittliche Ähnlichkeit zwischen jedem Cluster und seinem ähnlichsten.
- Calinski-Harabasz Index: Bewertet das Verhältnis zwischen Cluster-Dispersion und innerhalb von Cluster-Dispersion.
Berechnung der Metriken
Die meisten Clustering-Bibliotheken bieten Funktionen zur Berechnung dieser Metriken. In Pythons scikit-learn-Bibliothek können Sie beispielsweise folgendes verwenden:
silhouette score(), davies bouldin score() und calinski harabasz score().
Diese Funktionen erfordern die Datenpunkte und die ihnen zugeordneten Cluster-Labels als Eingabe, eine korrekte Vorverarbeitung und Normalisierung der Daten verbessert die Zuverlässigkeit der Metriken.
Interpretationsergebnisse
Höhere Silhouettenwerte deuten auf gut definierte Cluster hin, während niedrigere Werte auf überlappende oder schlecht getrennte Gruppen hindeuten. Für den Davies-Bouldin-Index sind niedrigere Werte besser, was auf unterschiedliche Cluster hinweist. Der Calinski-Harabasz-Index bevorzugt höhere Werte, was eine bessere Clusterstruktur widerspiegelt.