Table of Contents
機能選択は、モデルのパフォーマンスを改善し、複雑性を低下させるために、監視されていない学習の重要なステップです。 監督された学習とは異なり、それはラベル付きデータに依存せず、プロセスをより困難にしています。 この記事では、監視されていない設定で機能選択に使用される一般的な技術と戦略について説明します。
未監督機能選択のためのテクニック
ラベル付きデータなしで関連機能を識別するために、いくつかの方法が使用されます。 これらの技術は、データセット内の機能と関係の本質的な特性を測定することに焦点を当てています。
変化の境界
この方法は、サンプル全体で低分散機能で機能を削除し、少しのバリエーションの機能は非公式化が少ないと仮定します。
クラスタリングベースの選択
機能は、クラスタリング結果への貢献に基づいて評価されます。クラスタの分離を改善する特徴は保持されます。
効果的な機能選択のための戦略
機能選択の実装には、有意義な結果を確実にするために戦略的な計画が必要です。複数の技術の組み合わせは、より良い結果をもたらすことが多いです。
寸法の縮小
プリンシパルコンポーネント分析(PCA)のような方法は、機能選択の補助、データ分散のほとんどを節約しながら、機能の数を減らします。
反復的な選択
意図的に削除またはクラスタリング性能に基づいて機能を追加することで、データセットの最も関連性の高い機能を特定できます。
- 機能の重要性を評価する
- 複数の技術を使用する
- 測定メトリックのクラスタリングで検証
- 寸法を削減