Kombinasyon, benzer veri noktalarına kullanılan denetimsiz öğrenmede yaygın bir tekniktir. Bu kümelerin kalitesini değerlendirmek anlamlı öngörüler sağlamak için gereklidir. Clustering metrics, algoritmanın nasıl iyi yapıldığını değerlendirmek için nicel önlemler sağlar.

Yaygın Kompiyon

kümeleme sonuçlarını değerlendirmek için birkaç ölçüm kullanılır. En popüler şunları içerir:

  • [FONT:0]Silhouette Puan[[[Döntgen: 1 ): Bir nesnenin diğer kümelere kıyasla kendi kümelerine nasıl benzediğini ölçüler.
  • [FONT:0]Davies-Bouldin Index): Her küme ile en benzerleri ve en benzerleri arasında ortalama benzerlik.
  • [FONT=0)Calinski-Harabasz Index): Kısmi dağıtımın içi dağıtımların oranı.

Topları hesaplamak

Çoğu kümeleme kütüphanesi bu ölçümleri hesaplamak için işlevleri sağlar. Örneğin, Python'un scikit- learning kütüphanesinde kullanabilirsiniz:

[FONT=0] [FONT=0) [FONT=0][/FONT=0][/FONT=0][/FONT=0][/FONT=FONT=0][/FONT=FONT=FONT=FONT=FONT=I][/FONT=FONT=I][/FONT=FONT=I][/FONT=I][/FONT=I][/FONT=FONT=I][/FONT=FONT=I][/FONT=I][/FONT=I][/FONT=I][/FONT=)

Bu fonksiyonlar veri noktaları ve atan küme etiketlerinin giriş olarak kullanılmasını gerektirir. Verilerin işlenmesi ve normalleştirilmesi metriklerin güvenilirliğini geliştirir.

Sonuçlar

Yüksek silhouette puanları iyi tanımlanmış kümeleri gösterirken, düşük puanlar çakışlama veya kötü ayrı gruplar önerir.For the Davies-Bouldin index, daha düşük değerler daha iyi, farklı kümeler gösterir. Calinski-Harabasz indeksi daha yüksek puanlar sunar, daha iyi kümeleme yapısını yansıtır.