数据正常化和缩放是机器学习中必不可少的预处理步骤,它们有助于通过确保特性对学习过程作出同等贡献来改进模型性能,这些技术的正确应用可以导致模型更加准确和稳定。

了解数据正常化和扩展

数据正常化可以将数据调整到一个共同的尺度,而不会扭曲数值范围的差异。 缩放通常涉及将特性转换成特定范围或分布。 这两种技术都旨在使特性具有可比性,并提高算法的效率。

通用技术

  • Min-Max 缩放:[ 将特性转换为固定范围,通常为0至1.
  • 标准化:[] 围绕平均值将数据中心,标准偏差为1.
  • Robust 缩放: 使用中位数和方位间范围,与外置有效.

最佳做法

将数据分割到培训和测试集中后应用常态化和缩放,以防止数据泄漏。选择基于算法和数据分布的技术。例如,基于树的模型往往不需要缩放,而像SVM和k-NN这样的算法则从中大大受益。