Table of Contents
特長選択は、モデルのトレーニングのための最も関連性の高い変数を識別するために機械学習で使用されるプロセスです。それはモデルのパフォーマンスを改善し、過度のコストを削減し、計算コストを削減するのに役立ちます。この記事は、一般的な技術について議論し、そのアプリケーションを説明するための実用的な例を提供します。
フィルター方法
フィルタ方式は、統計的な対策に基づいて機能の関連性を評価します。それらは高速で、高次元データに適しています。一般的な技術には、相関係数、chi-squareテスト、および相互情報が含まれます。
例えば、相関性を使うと、ターゲット変数に対する高い相関性を持つ機能が選択され、低相関性を持つものが破棄されます。この方法は単純ですが、機能間の相互作用を見逃すかもしれません。
Wrapper メソッド
Wrapper メソッドは、モデルを訓練し、最適なパフォーマンスを発揮する組み合わせを選択することで、機能のサブセットを評価します。 それらはより正確で、計算的に集中的です。
テクニックには、再帰的機能の除去(RFE)と前方または後方選択が含まれます。例えば、RFEはモデルを繰り返し訓練し、最小重要な機能を削除し、サブセットを最適な性能が達成されるまで磨きます。
組込み方法
組込み方式は、モデルのトレーニングプロセス中に機能選択を実行します。 それらはより少ない重要な機能を貫通する正規化技術を組み込んでいます。
機能重要スコアを提供するRandom ForestsのようなLasso(L1正規化)とツリーベースのアルゴリズムを含む。これらのメソッドは精度と効率のバランスをとっています。
実用事例
住宅価格を予測する多くの機能を備えたデータセットを持っているとします。 フィルターメソッドを使用すると、価格に対する最も高い相関性を持つ機能を選ぶかもしれません。 その後、RFEを適用して、サブセットをラッパーメソッドで絞り込むことができます。 最後に、埋め込まれた機能重要度スコアを持つモデルを訓練して、選択を確定します。