Table of Contents
维度降低方法是无监督学习中必不可少的工具,通过减少特性数量,同时保存重要信息,帮助简化复杂的数据集,这些技术提高了计算效率和可视化,使数据分析更加可控.
主要构成部分分析(PCA)
PCA是使用最广泛的维度减小技术之一,它将原始特性转化为一组新的不相关变量,称为主元件,这些元件捕捉数据中的最大差异.
PCA有效减少了具有许多相关特征的数据集的维度,如图像数据或基因表达数据,对于将高维数据直观化为两三个维度也是有益的.
t- 分布的 Stochastic 邻居嵌入( t- SNE)
t-SNE是一种非线性技术,它通过将高维数据映射成两三个维度来突出其可视化,它强调维护局部结构,使集群更加明显.
t-SNE通常用于图像识别,基因组学,客户分割等应用中. 它在计算上集约,但提供了复杂数据分布的透视.
统一手表式近似和投影(UMAP)
UMAP是一种较新的非线性技术,它比 t-SNE 更能更快地计算和更好地保存全球数据结构,适合大型数据集,并提供有意义的可视化.
UMAP被用于包括生物信息学和图像分析在内的各个领域,以有效探索数据模式和关系.
在无监督学习中使用案例
减小尺寸的方法被用于集群、异常检测和数据可视化,有助于确定固有的数据分组和外部,从而帮助更好地了解数据结构。
- 数据可视化
- 特征提取
- 减少噪音
- 机器学习模型的预处理