La agrupación es una técnica común en el aprendizaje no supervisado que se utiliza para agrupar puntos de datos similares. Evaluar la calidad de estos grupos es esencial para asegurar una visión significativa. La métrica de la fusión proporciona medidas cuantitativas para evaluar la eficacia del algoritmo.

Metrices de cribado comunes

Se utilizan varias métricas para evaluar los resultados de agrupación.

  • Punto de la Silueta: Mide lo similar que es un objeto a su propio grupo en comparación con otros grupos.
  • Índice de los Davies-Bouldin: Evalua la similitud media entre cada grupo y su más similar.
  • Indice de Calinski-Harabasz: Evalua la relación entre la dispersión de los componentes a la dispersión dentro de los componentes.

Calculando la Métula

La mayoría de las bibliotecas de agrupación ofrecen funciones para calcular estas métricas. Por ejemplo, en la biblioteca de cikit-learn de Python, se puede utilizar:

silhouette score()], ]davies bouldin score()[, y calinski harabasz score().

Estas funciones requieren los puntos de datos y sus etiquetas de racimo asignadas como entrada. Procesamiento adecuado y normalización de los datos mejoran la fiabilidad de las métricas.

Resultados de interpretación

Las puntuaciones de silueta más altas indican los racimos bien definidos, mientras que las puntuaciones más bajas sugieren grupos superpuestos o mal separados. Para el índice Davies-Bouldin, los valores inferiores son mejores, indicando grupos distintos.El índice Calinski-Harabasz favorece puntuaciones más altas, reflejando una mejor estructura de agrupación.