特性缩放是许多机器学习算法中,特别是无监督学习中的一个重要预处理步骤. 适当的缩放确保所有特性都平等地有助于分析,并改善诸如集群和维度降低等算法的性能.

为何要放大特性事项

在无监督的学习中,算法往往依赖于距离测量或相似度度量。 如果特征是在不同尺度上的,那么具有较大范围的特征就可以主导这些计算,导致偏差的结果。 缩放有助于使特征贡献正常化,提高模型的准确性。

通用缩放技术

  • Min-Max 缩放:[] 将特性转换为固定范围,通常为[0,1].
  • 标准化:[ 中心特征围绕中间点,标准偏差为1.
  • robust 缩放: 使用中位数和间位数范围来降低外位数的影响.

扩大规模的最佳做法

将数据分解到培训和测试集中后应用缩放技术,以防止数据泄漏。只将缩放器安装在培训数据上,然后转换培训和测试数据。这种方法保持了评估过程的完整性。