Table of Contents
特性选择是机器学习中用来确定模型培训最相关的变量的过程,它有助于改进模型性能,减少过度适应,并降低计算成本。本条讨论通用技术并提供实例来说明其应用。
过滤方法
过滤方法基于统计计量来评价特征的相关性,它们速度快,适合高维度数据,常见技术包括关联系数,基方位测试,以及相互信息.
例如,使用相关性,选择了与目标变量高度相关性的特征,而低相关性的特征则被丢弃。这种方法很简单,但可能忽略了特征之间的相互作用。
包装方法
包装方法通过培训模型和选择能产生最佳性能的组合来评价特征的子集,它们更加准确,但计算密集。
技术包括递归特性消除(RFE)和前向或后向选择。例如,RFE反复训练一个模型,去掉最不重要的特性,并精炼子集,直到实现最佳性能。
嵌入方法
嵌入式方法在示范培训过程中进行特征选择,其中包含惩罚不太重要的特征的规范化技术。
例如拉索(L1正规化)和Random Forest等树基算法,它们提供了特征重要性分数,这些方法平衡了准确性和效率.
实例
假设您拥有一个包含众多预测房屋价格的功能的数据集。 您可以使用过滤方法选择与价格关系最高的功能。 然后, 应用 RFE 来用包装方法来完善子集。 最后, 训练一个带有嵌入式特征重要性分数的模型来完成选择 。