Кластеризация является распространенным методом в неконтролируемом обучении, используемом для группировки аналогичных точек данных. Оценка качества этих кластеров имеет важное значение для обеспечения значимой информации. Кластерные метрики обеспечивают количественные показатели для оценки того, насколько хорошо алгоритм выполнил свою работу.

Общие кластерные метрики

Для оценки результатов кластеризации используется несколько метрик. Наиболее популярными являются:

  • Сильюэтный балл: Измеряет, насколько объект похож на свой собственный кластер по сравнению с другими кластерами.
  • Индекс Дэвиса-Булдина: Оценивает среднее сходство между каждым кластером и его наиболее похожим.
  • Calinski-Harabasz Index: Оценка соотношения между рассеянием кластеров и внутрикластерной дисперсией.

Вычисление метрик

Большинство библиотек кластеризации предоставляют функции для вычисления этих показателей. Например, в библиотеке scikit-learn Python можно использовать:

silhouette score(), davies bouldin score() и calinski harabasz score(].

Эти функции требуют точек данных и назначенных ими кластерных меток в качестве входных данных.Правильная предварительная обработка и нормализация данных повышают надежность метрик.

Толкование результатов

Более высокие силуэтные баллы указывают на четко определенные кластеры, в то время как более низкие баллы предполагают перекрывающиеся или плохо разделенные группы. Для индекса Дэвиса-Булдина более низкие значения лучше, что указывает на отдельные кластеры. Индекс Калински-Харабаша благоприятствует более высоким баллам, отражая лучшую структуру кластеризации.