特性选择是建立有效机器学习模型的关键步骤,它涉及确定最相关的变量,以提高模型的准确性并减少复杂性,定量方法提供了根据数字标准评价和选择特征的系统方法。

通用定量方法

几种定量技术被广泛用于特征选择,这些方法使用统计计量或算法标准评估特征的重要性,选择合适的方法取决于数据和具体问题.

过滤方法

滤镜方法根据其与目标变量的统计关系来评价特征,它们具有计算效率,适合高维度数据. 常见的滤镜技术包括:

  • 校正系数: 测量特征与目标之间的线性关系.
  • 奇方测试: 评估绝对变量之间的独立性.
  • 元信息: 量化变量之间共享的信息量.

包装方法

包装方法通过培训模型评价特征子集,选择产生最佳业绩的组合,这些方法在计算上更加密集,但往往产生更准确的结果。

  • 前置选择: 无特性的开始,一次添加一个.
  • 背面消除:[] 以所有特性开始,去掉最不重要的.
  • 递归特性消除:[ 斜体删除基于模型权重的特性.

嵌入方法

嵌入式方法在模型培训过程中包含特征选择,它们通过利用规范化技术或基于树的算法来平衡效率和效果。

  • 拉索回归:[] 使用L1正规化将不太重要的特征系数缩到零.
  • 决定树算法:[]自然地根据信息收益或基尼杂质选择特征.
  • 野生森林: 综合特征分数跨多棵树.