Misurazione e strumentazione
Valutazione dei risultati di clustering: Rand Index e attuazione pratica regolata
Table of Contents
La valutazione della qualità di questi cluster è essenziale per determinare la loro efficacia. L'indice di Rand rettificato (ARI) è una metrica popolare per questo scopo, fornendo una misura di somiglianza tra le etichette vere e i risultati di clustering.
Comprendere l'indice Rand rettificato
L'ARI confronta l'uscita di clustering con la verità di terra, regolando per raggruppamenti di probabilità. Il suo valore varia da -1 a 1, dove 1 indica un accordo perfetto, 0 suggerisce clustering casuale, e i valori negativi implicano meno accordo che previsto per caso.
Calcolo dell'indice Rand rettificato
La maggior parte dei linguaggi di programmazione offrono librerie per calcolare l'ARI. Ad esempio, in Python, la libreria a scikit-learn fornisce una funzione semplice:
Esempio:
# "Piathon" #
da sklearn.metrics import Adjust rand score
etichettas true = [0, 0, 1, 1, 2, 2]
etichettas pred = [0, 0, 1, 1, 0, 2]
punteggio = corretto rand score(labels true, labels pred)
stampa("Indice Rand corretto:", punteggio)
- Sì.
Consigli pratici per l'attuazione
Quando si applica l'ARI, assicurarsi che le etichette vere siano disponibili per il confronto, è anche importante interpretare il punteggio in contesto, considerando il metodo specifico di dataset e clustering utilizzato.
Inoltre, i dati di preelaborazione e la selezione di algoritmi di clustering appropriati possono influenzare i risultati ARI. L'esperimento con diversi parametri aiuta a ottimizzare le prestazioni di clustering.