Table of Contents
機能のスケーリングは、機械学習アルゴリズムのデータの準備に重要なステップです。 これは、モデルのパフォーマンスと収束速度を向上させるために、機能値の範囲を調整することを含みます。 数学の基礎を理解することは、異なるデータセットに適した技術を選択するのに役立ちます。
機能の数学的基礎スケーリング
機能のスケーリング方法は、データの分布を変更する数学的な変換に基づいています。 一般的な技術には正規化と標準化が含まれます。 正規化は、通常、特定の範囲に機能を再スケールします。 [0, 1]、式を使用して:
]正規化値 = (x - min) / (max - min)
標準化は、データが0の手段と1の標準的な偏差を持つように変換します。
[標準値 = (x - μ) / σ[]
機能スケーリングのための実用的なテクニック
機能のスケーリングを実装するには、データとアルゴリズムに基づいて正しい方法を選ぶことが含まれます。例えば、k-nearest隣人やニューラルネットワークなどのアルゴリズムは正規化の恩恵を受けており、線形回帰と記号論理回帰は標準化を頻繁に使用します。
一般的な技術は下記のものを含んでいます:
- 最小限のスケーリング
- Zコア標準化
- 強力なスケーリング
- MaxAbs スケールリング
トレーニングデータにスケーリングパラメータを合わせ、データ漏洩を防ぐため、テストデータと同じ変換を適用することが大切です。