Table of Contents
機能選択は、効果的な機械学習モデルの構築に重要なステップです。それは、モデルの精度を改善し、複雑性を低下させるために最も関連性の高い変数を特定することを含みます。定量的な方法は、数値基準に基づいて機能を評価し、選択するための体系的なアプローチを提供します。
共通量的方法
機能選択のために、いくつかの定量技術が広く使用されています。これらの方法は、統計的な対策やアルゴリズム的な基準を使用して機能の重要性を評価します。適切な方法を選択すると、データと特定の問題によって異なります。
フィルター方法
フィルターメソッドは、ターゲット変数と統計的な関係に基づいて機能を評価します。それらは計算的に効率的で、高次元データに適しています。一般的なフィルタテクニックは次のとおりです。
- []Correlation係数:[は、機能とターゲット間の線形関係を測定します。
- [Chi-Square Test:[] 分類変数間の独立性を強調する。
- [] 相互情報:] は変数間で共有される情報量を量ります。
Wrapper メソッド
Wrapper メソッドは、トレーニングモデルによる機能のサブセットを評価し、最適なパフォーマンスを得られるコンビネーションを選択します。 それらはより計算的に集中的に集中するが、より正確な結果が得られることが多いです。 以下が含まれます。
- []フォワードセレクション:]]は、機能なしで始まり、一度に1つを追加します。
- ]後方排除:[]]は、すべての機能から始まり、最も重要な機能を削除します。
- ] 再帰的特徴の除去:[ 繰り返し、モデル重量に基づいて機能を削除します。
組込み方法
組み込み方式は、モデルのトレーニングプロセス内で機能選択を組み込む。正規化技術やツリーベースのアルゴリズムを活用して、効率性と有効性のバランスをとります。注目すべき例は次のとおりです。
- [] ラスソ回帰:[ は、L1正規化を使用して、重要な機能係数をゼロに縮小します。
- [Decision Tree Algorithms:[]] 情報ゲインやGini不純物に基づいて機能を選択しました。
- []ランダムフォレスト:[]]複数の木を渡る特徴の重要なスコアを集計します。