La valutazione della qualità di questi cluster è essenziale per garantire risultati significativi, soprattutto nelle applicazioni ingegneristiche in cui l'accuratezza influisce sul processo decisionale. Vari metriche e calcoli aiutano a quantificare quanto bene il clustering si allinea alla struttura dei dati sottostanti.

Misuratori di valutazione interna

Le metriche interne valutano la coesione e la separazione dei cluster basati esclusivamente sui dati stessi, non richiedono etichette esterne o verità di terra, queste metriche aiutano a determinare quanto siano compatte e distinte le cluster.

  • Silhouette Punteggio:[] Misura come un oggetto simile sia al proprio cluster rispetto ad altri cluster. I valori variano da -1 a 1, con punteggi più alti che indicano un cluster migliore.
  • Dunn Index:[]] Valuta il rapporto tra la distanza più piccola tra le osservazioni in diversi cluster e la distanza intra-cluster più grande.
  • Davies-Bouldin Index:[] Calcola la somiglianza media tra ogni cluster e quello più simile.

Misuratori di valutazione esterna

Le metriche esterne paragonano i risultati di clustering a una verità o etichette predefinite del terreno, utili quando si conoscono le vere classificazioni, come negli scenari supervisionati.

  • Indice Rand corretto (ARI):[] Misura la somiglianza tra i cluster predetti e le etichette vere, regolando per caso.
  • Normalized Mutual Information (NMI): Quantifica la dipendenza reciproca tra le etichette di clustering e true, normalizzata per range tra 0 e 1.
  • Omogeneità punteggio:[] Controlla se ogni cluster contiene solo punti di dati che sono membri di una singola classe.

Calcoli e Interpretazione

Il calcolo di queste metriche comporta formule specifiche e misure di distanza, ad esempio, il Silhouette Score utilizza la distanza media di intercluster e la distanza media più vicina per ogni punto.

I punteggi più alti di Silhouette e i valori NMI indicano una migliore qualità di clustering, mentre gli indici Davies-Bouldin inferiori suggeriscono cluster ben separati. Combinando metriche multiple fornisce una valutazione completa.