Table of Contents
特性选择是建立有效机器学习模型的关键步骤,它涉及确定最相关的变量,以提高模型的准确性并减少复杂性,定量方法提供了根据数字标准评价和选择特征的系统方法。
通用定量方法
几种定量技术被广泛用于特征选择,这些方法使用统计计量或算法标准评估特征的重要性,选择合适的方法取决于数据和具体问题.
过滤方法
滤镜方法根据其与目标变量的统计关系来评价特征,它们具有计算效率,适合高维度数据. 常见的滤镜技术包括:
- 校正系数: 测量特征与目标之间的线性关系.
- 奇方测试: 评估绝对变量之间的独立性.
- 元信息: 量化变量之间共享的信息量.
包装方法
包装方法通过培训模型评价特征子集,选择产生最佳业绩的组合,这些方法在计算上更加密集,但往往产生更准确的结果。
- 前置选择: 无特性的开始,一次添加一个.
- 背面消除:[] 以所有特性开始,去掉最不重要的.
- 递归特性消除:[ 斜体删除基于模型权重的特性.
嵌入方法
嵌入式方法在模型培训过程中包含特征选择,它们通过利用规范化技术或基于树的算法来平衡效率和效果。
- 拉索回归:[] 使用L1正规化将不太重要的特征系数缩到零.
- 决定树算法:[]自然地根据信息收益或基尼杂质选择特征.
- 野生森林: 综合特征分数跨多棵树.