Clustering adalah teknik umum dalam pembelajaran yang tidak diawasi yang digunakan untuk mengelompokkan titik data yang serupa. Mengevaluasi kualitas dari kluster ini sangat penting untuk memastikan wawasan yang bermakna. kluster metrik memberikan langkah kuantitatif untuk menilai seberapa baik algoritme telah dilakukan.

Metrik Kluster Biasa

Beberapa metrik digunakan untuk mengevaluasi hasil pengelompokan.

  • [[GALALT:0]]Silhouette Skor: Mengukur bagaimana serupa suatu objek dengan kluster sendiri dibandingkan dengan kluster lain.
  • [[EZALT:0]]Davies-Bouldin Index: Mengevaluasi kesamaan rata-rata antara setiap kluster dan yang paling mirip.
  • [[ZOZOZLT:0]]Callinski-Harabasz Indeks: Assess rasio antara-kluster dispersi ke dispersi inside-cluster.

Menghitung Metrik

Pustaka pengelompokan kinalis kebanyakan menyediakan fungsi untuk menghitung metrik ini. Misalnya, di perpustakaan scikit-learn Python, Anda dapat menggunakan:

OCLC [[1621-FLT:0]]silhouette score()[, davies bouldin score()[, and calinski harabasz score().

Fungsi-fungsi ini memerlukan data poin dan label cluster mereka yang ditugaskan sebagai input. preproses yang tepat dan normalisasi data meningkatkan keandalan metrik.

Hasil Tafsiran Tafsiran

Skor siluet yang lebih tinggi menunjukkan cluster yang didefinisikan dengan baik, sementara skor yang lebih rendah menyarankan kelompok yang saling tumpang tindih atau terpisah yang kurang baik. Untuk indeks Davies-Bouldin, nilai yang lebih rendah lebih baik, menunjukkan cluster yang berbeda. Indeks Calinski-Harabasz lebih menyukai skor yang lebih tinggi, mencerminkan struktur clustering yang lebih baik.