Clustering este o tehnică comună în învățare nesupravegheată utilizate pentru a grupa puncte de date similare. Evaluarea calității acestor grupuri este esențială pentru a asigura perspective semnificative. Matematicile clustere oferă măsuri cantitative pentru a evalua cât de bine a efectuat algoritmul.

Metrici comune de clustere

Mai multe indicatori sunt folosite pentru a evalua rezultatele de clustering. Cele mai populare includ:

  • Scor Silhouette: Măsoară cât de similar este un obiect cu propriul său grup comparativ cu alte grupuri.
  • Davies-Bouldin Index: Evaluează similitudinea medie dintre fiecare grup și cel mai similar.
  • Indicele Calinski-Harabasz: evaluează raportul dintre dispersia între gloster și dispersie în interiorul clusterului.

Calcularea datelor

Majoritatea bibliotecilor clustere oferă funcții pentru a calcula aceste indicatori. De exemplu, în biblioteca de scikit-learn Python, puteți folosi:

silhouette score(), davies bouldin score() și calinski harabasz score().

Aceste funcţii necesită punctele de date şi etichetele lor atribuite ca intrare. Preprocesarea şi normalizarea corectă a datelor îmbunătăţesc fiabilitatea indicatorilor.

Interpretare rezultate

Scorurile mai mari de siluetă indică clustere bine definite, în timp ce scorurile mai mici sugerează suprapuse sau slab separate grupuri. Pentru indicele Davies-Bouldin, valorile mai mici sunt mai bune, indicând grupuri distincte. Indexul Calinski-Habasz favorizează scoruri mai mari, reflectând o structură mai bună de clusterare.