Table of Contents
特長スケーリングは、特に監視されていない学習で、多くの機械学習アルゴリズムで重要な前処理ステップです。 適切なスケーリングは、すべての機能が分析に等しく貢献し、クラスタリングや寸法減少などのアルゴリズムのパフォーマンスを向上させることを保証します。
なぜ特徴のスケーリングのマッター
監視されていない学習では、アルゴリズムは、距離測定や類似度メトリックに依存します。 異なるスケールで機能する場合、より大きな範囲の機能は、これらの計算を支配し、偏った結果につながることができます。 スケールは、機能の貢献を正規化し、モデルの精度を向上させるのに役立ちます。
一般的なスケーリング技術
- []最小値のスケーリング:[は、通常、固定範囲に機能を変更します[0, 1]。
- 標準化:]センターは、平均の周りの特徴を1の標準的な偏差で特徴付けます。
- ]Robust Scaling:[は、上書きの影響を削減するために、中触範囲とインタークタイル範囲を使用します。
スケールアップに最適な練習
データの分割後にスケーリング技術を適用して、データ漏洩を防ぐためのトレーニングとテストセットに分割します。 トレーニングデータにスケーラを合わせ、両方のトレーニングとテストデータを変換します。 このアプローチは、評価プロセスの完全性を維持します。