Medición e Instrumentación
Cálculo de la medición de la agrupación: un enfoque práctico para la evaluación de aprendizaje no supervisada
Table of Contents
La agrupación es una técnica común en el aprendizaje no supervisado que se utiliza para agrupar puntos de datos similares. Evaluar la calidad de estos grupos es esencial para asegurar una visión significativa. La métrica de la fusión proporciona medidas cuantitativas para evaluar la eficacia del algoritmo.
Metrices de cribado comunes
Se utilizan varias métricas para evaluar los resultados de agrupación.
- Punto de la Silueta: Mide lo similar que es un objeto a su propio grupo en comparación con otros grupos.
- Índice de los Davies-Bouldin: Evalua la similitud media entre cada grupo y su más similar.
- Indice de Calinski-Harabasz: Evalua la relación entre la dispersión de los componentes a la dispersión dentro de los componentes.
Calculando la Métula
La mayoría de las bibliotecas de agrupación ofrecen funciones para calcular estas métricas. Por ejemplo, en la biblioteca de cikit-learn de Python, se puede utilizar:
silhouette score()], ]davies bouldin score()[, y calinski harabasz score().
Estas funciones requieren los puntos de datos y sus etiquetas de racimo asignadas como entrada. Procesamiento adecuado y normalización de los datos mejoran la fiabilidad de las métricas.
Resultados de interpretación
Las puntuaciones de silueta más altas indican los racimos bien definidos, mientras que las puntuaciones más bajas sugieren grupos superpuestos o mal separados. Para el índice Davies-Bouldin, los valores inferiores son mejores, indicando grupos distintos.El índice Calinski-Harabasz favorece puntuaciones más altas, reflejando una mejor estructura de agrupación.