特征选择和维度降低是监督学习中必不可少的技术,有助于改进模型性能、减少过度适应和降低计算成本,该指南概述了有效应用这些技术的共同方法和最佳做法。

特性选择技术

特性选择涉及从原始数据集中选择一个相关特性的子集,它简化了模型,增强了可解释性,常见的方法包括过滤器,包装器,以及嵌入式技术.

过滤方法

过滤方法根据关联性或相互信息等统计计量来评价特征,它们速度快,适合高维度数据.

包装方法

包装方法通过不同子集的培训模型选择特征,选择最佳的组合,它们更准确但具有计算强度。

嵌入方法

嵌入式方法在模式培训中包含特征选择,如拉索回归,它惩罚了不太重要的特征.

减少影响技术

减少尺寸可以将数据转化为一个低维空间,保存基本信息,当特征高度相关或处理高维数据时,这种功能是有用的。

主要构成部分分析(PCA)

PCA通过将数据投射到解释最大差异的主要组件上来减小维度,它被广泛用于可视化和降噪.

t- 分布的 Stochastic 邻居嵌入( t- SNE)

t-SNE是将高维数据以两三个维度可视化的一种技术,强调局部结构,对集群分析有用.

最佳做法

在应用特征选择或减少维度时,考虑下列最佳做法:

  • 在选择技术之前先了解数据和问题.
  • 使用交叉验证来评价特征选择的影响.
  • 结合多种方法,以取得更好的结果.
  • 注意过度减少,可能导致信息丢失.