Кластеризация является распространенным методом анализа данных, используемым для группировки аналогичных точек данных. Оценка качества этих кластеров имеет важное значение для обеспечения значимых результатов, особенно в инженерных приложениях, где точность влияет на принятие решений. Различные метрики и расчеты помогают количественно оценить, насколько хорошо кластеризация согласуется с базовой структурой данных.

Внутренние метрики оценки

Внутренние метрики оценивают сплочённость и разделение кластеров, основываясь исключительно на самих данных. Им не нужны внешние метки или наземная истина. Эти метрики помогают определить, насколько компактны и различны кластеры.

  • Сильюэтный балл: Измеряет, насколько объект похож на свой собственный кластер по сравнению с другими кластерами. Значения варьируются от -1 до 1, с более высокими баллами, указывающими на лучшую кластеризацию.
  • Индекс Данна: Оценивает соотношение наименьшего расстояния между наблюдениями в разных кластерах и наибольшего внутрикластерного расстояния. Более высокие значения предполагают лучшее разделение.
  • Индекс Дэвиса-Булдина: Расчет среднего сходства между каждым кластером и его наиболее похожим.Нижние значения указывают на лучшую кластеризацию.

Внешние метрики оценки

Внешние метрики сравнивают результаты кластеризации с заранее заданной истинной точкой или метки. Они полезны, когда известны истинные классификации, например, в контролируемых сценариях.

  • Скорректированный индекс рэнда (ARI): Измеряет сходство между предсказанными кластерами и истинными метками, корректируя на случайность. Значения варьируются от -1 до 1.
  • Нормализованная взаимная информация (NMI): Количественно определяет взаимную зависимость между кластеризацией и истинными метками, нормализованными в диапазоне от 0 до 1.
  • Оценка однородности: Проверяет, содержит ли каждый кластер только точки данных, которые являются членами одного класса.

Расчеты и интерпретации

Расчет этих метрик включает в себя конкретные формулы и меры расстояния. Например, в Silhouette Score используется среднее внутрикластерное расстояние и среднее расстояние ближайшего кластера для каждой точки. Внешние метрики часто требуют матрицы путаницы или таблицы непредвиденных обстоятельств, сравнивающих предсказанные кластеры с истинными метками.

Более высокие оценки силуэта и значения NMI указывают на лучшее качество кластеризации, в то время как более низкие индексы Дэвиса-Булдина предполагают хорошо разделенные кластеры. Объединение нескольких метрик обеспечивает комплексную оценку.