Table of Contents
集群是无监督学习中的一种基本技术,它根据数据特征将数据点组起来。 理解集群背后的数学原理有助于设计有效的算法并解释其结果。
集群中的距离测量
距离测量数据点之间的相似性。常见的测量数据包括欧几利得距离、曼哈顿距离和科辛相似性。 选择测量数据会影响星团的形成,并会影响算法对外部的敏感度。
计算中心
Centroids代表一个集群的中心,通常作为集群内所有数据点的平均值计算。数学上,对于一个带点的集群,[x1],],,,.,xn],中间行星C是:
C=(1/n) ⁇ i=1]n ]xi ]]]]
组合算法的设计原则
有效的集群算法遵循某些原则优化集群,其中包括最小化集群内部差异和最大化集群间距离. K- Means 迭代更新的中间行星等算法,以提高集群凝聚力.
评价分组业绩
诸如Silhouette Score和Davies-Bouldin指数等计量标准可以量化集群的质量。它们评估数据点与其他集群相比,在集群内是否适合,指导参数选择和算法调试。