Η συστάδα είναι μια κοινή τεχνική στην μη επιτηρούμενη μάθηση που χρησιμοποιείται για την ομαδοποίηση παρόμοιων σημείων δεδομένων. \" αξιολόγηση της ποιότητας αυτών των συστάδων είναι απαραίτητη για να διασφαλιστεί η ουσιαστική διορατικότητα.

Κοινή Συγκεντρωτική Μετρολογία

Αρκετές μετρήσεις χρησιμοποιούνται για την αξιολόγηση των αποτελεσμάτων συσπειρωσιμότητας.

  • Silhouette Score: Μέτρα για το πόσο παρόμοιο είναι ένα αντικείμενο με το δικό του σμήνος σε σύγκριση με άλλα συμπλέγματα.
  • Ντέιβιες-Μπούλντιν Index: Αξιολογεί τη μέση ομοιότητα μεταξύ κάθε συστάδας και του πιο παρόμοιου.
  • Calinski-Harabasz Index: Βοηθά την αναλογία μεταξύ διασποράς του συμπλέκτη προς διασπορά εντός του συμπλέκτη.

Υπολογίζοντας τα Μετρικά

Οι περισσότερες βιβλιοθήκες που συστέλλουν παρέχουν λειτουργίες για τον υπολογισμό αυτών των μετρικών. Για παράδειγμα, στη βιβλιοθήκη scikit-learn της Python, μπορείτε να χρησιμοποιήσετε:

σιλουέτα σκορ(), νταβιές μπουλντέν σκορ(), και calinski harabasz score()].

Οι λειτουργίες αυτές απαιτούν τα σημεία δεδομένων και τις αναγνωρισμένες ετικέτες συστάδων τους ως είσοδο.

Ερμηνευτικά Αποτελέσματα

Υψηλότερες βαθμολογίες σιλουέτα δείχνουν καλά καθορισμένη συστάδες, ενώ χαμηλότερες βαθμολογίες υποδηλώνουν αλληλεπικαλυπτόμενες ή κακώς διαχωρισμένες ομάδες. Για το δείκτη Davies-Bouldin, χαμηλότερες τιμές είναι καλύτερες, υποδεικνύοντας διακριτές συστάδες. Ο δείκτης Calinski-Harabasz ευνοεί υψηλότερες βαθμολογίες, αντανακλώντας καλύτερη δομή συσπειρωτισμού.