Ang pagkokokoberte ay isang karaniwang pamamaraan sa hindi nababale - wala na pagkatuto na ginagamit upang pagbukud - bukodin ang katulad na mga puntos ng datos. Ang pag - ahon sa kalidad ng mga kumpol na ito ay mahalaga upang matiyak ang makabuluhang mga kabatiran.

Karaniwang mga Metric na Namumuo

Ilang metriko ang ginagamit upang suriin ang mga resulta ng pagkukumpol, at ang pinakapopular ay:

  • Silhouette Score: Nasusukat kung gaano kahawig ang isang bagay sa sarili nitong kumpol kumpara sa ibang kumpol.
  • Davies-Bouldin Index: Tanghalang ang katamtamang pagkakatulad ng bawat kumpol at ng pinaka kahalintulad nito.
  • Calinski-Harabasz Index[: Asseses ang ratio ng pagitan ng-cluster distancy sa loob-cluster division.

Pagkalkula sa mga Metric

Karamihan sa mga nakakulumpon na aklatan ay nagbibigay ng mga tungkulin upang pagsabayin ang mga metrikong ito. Halimbawa, sa scikit-learning library ni Python, magagamit mo:

silhouette score(), davies bouldin score()[, at calinski harabasz score().

Ang mga tungkuling ito ay nangangailangan ng mga punto ng datos at ang mga itinalagang cluster label bilang input. Ang wastong preprocessing at normalisasyon ng datos ay nagpapabuti sa pagkamaaasahan ng mga metriko.

Mga Resulta ng Pagpapaliwanag

Ang mas mataas na mga scorage ay nagpapahiwatig ng mga mahusay na-fluential cluster, habang ang mga mas mababang iskor ay nagmumungkahi ng mga magkakasanib o hindi gaanong hiwalay na grupo. para sa Davies-Bouldin index, mas mahusay ang mga mas mababang halaga, na nagpapahiwatig ng mga natatanging kumpol. Ang Calinski-Harabasz index ay mas pabor sa mas mataas na iskor, na sumasalamin sa mas mahusay na clustering istraktura.