Table of Contents
機能選択とエンジニアリングは、指示された学習において必須のステップです。モデルのパフォーマンスを改善し、オーバーフィッティングを削減し、トレーニング時間を削減します。この記事では、実用的方法を選択して、エンジニアの機能を有効にします。
機能選択技術
機能選択は、データセットから最も関連性の高い機能を選択することを含みます。 一般的な技術には、フィルタ方法、ラッパー方法、および埋め込み方法が含まれます。
フィルター方法
フィルタ方式は、相関、chi-square、または相互情報などの統計的な対策に基づいて機能を評価します。それらは、計算的に効率的で、高次元データに適しています。
Wrapper メソッド
Wrapper は、さまざまなサブセットでモデルをトレーニングし、パフォーマンスを評価し、機能を選択することで、機能を選択します。 テクニックには、再帰的機能の排除と前方選択が含まれます。
組込み方法
組込み方式は、モデルのトレーニング中に機能選択を組み込んでいます。例えば、Lasoや決定ツリーベースの重要度測定などの正規化手法も取り入れています。
機能 工学戦略
機能エンジニアリングは、モデル学習を強化する意味のある機能に生データを変換します。新しい機能の作成、分類変数のエンコーディング、数値データをスケーリングする機能を含みます。
新機能の創出
新機能の生成は、数学的な組み合わせ、集計、ドメイン固有の変換を含むことができます。これらは、データの隠されたパターンを明らかにすることができます。
定性変数のエンコーディング
分類データを数値形式に変換することは重要です。一般的な方法は、ワンホットエンコーディング、ラベルエンコーディング、ターゲットエンコーディングを含みます。
数値データのスケーリング
スケールは、多くのアルゴリズムに利益をもたらす、機能が比較可能なスケールにあることを保証します。 テクニックには、最小限のスケーリングと標準化が含まれます。