A agregação é uma técnica comum em aprendizagem não supervisionada usada para agrupar pontos de dados semelhantes. A avaliação da qualidade desses clusters é essencial para garantir insights significativos. As métricas de agrupamento fornecem medidas quantitativas para avaliar o quão bem o algoritmo tem sido executado.

Métricas comuns de agrupamento

Várias métricas são usadas para avaliar os resultados de agrupamento. As mais populares incluem:

  • Silhuette Score: Mede o quão similar um objeto é ao seu próprio cluster em comparação com outros clusters.
  • Índice Davies-Bouldin: Avalia a semelhança média entre cada cluster e o seu mais semelhante.
  • Índice de Calinski-Harabasz: Avalia a razão entre dispersão de agrupamentos e dispersão de agrupamentos internos.

Calculando as métricas

A maioria das bibliotecas de agrupamento fornecem funções para calcular estas métricas. Por exemplo, na biblioteca de Python scikit- learn, você pode usar:

silhuette score(), davies bouldin score(), e calinski harabasz score().

Essas funções requerem os pontos de dados e seus rótulos de cluster atribuídos como entrada. O pré-processamento e normalização adequados dos dados melhoram a confiabilidade das métricas.

Interpretar Resultados

Os escores de silhueta mais elevados indicam agrupamentos bem definidos, enquanto os escores mais baixos sugerem sobreposição ou má separação. Para o índice Davies-Bouldin, valores mais baixos são melhores, indicando agrupamentos distintos. O índice Calinski-Harabasz favorece escores mais elevados, refletindo melhor estrutura de agrupamento.