Table of Contents
不均衡なデータを扱うことは機械学習の共通の挑戦です。それは1つのクラスが他の数をかなりoutnumbers、予測モデルの性能に影響を与えるとき起こります。適切な技術を適用することで、モデルの正確さと信頼性を向上させることができます。
バランスの取れたデータについて
不均衡なデータセットは、クラスを不均衡な分布によって特徴付けられます。例えば、不正検知では、本物取引は膨大な数の不正なもの。この不均衡は、モデルが過半数クラスを好むようにし、少数位クラスのインスタンスの検出を減らすことができます。
バランスの取れる実用的な技術
複数のメソッドは、データの不均衡を効果的に対処できます。
- []:[]] をリサンプリングするマイナーティクラスまたは過半数クラスをオーバーサンプリングすることにより、データセットを調整します。
- 合成データ生成:[] 微細なクラスを人工的に例にするためにSMOTEのような技術を使用してください。
- アルゴリズムのアプローチ:[エンサンブルメソッドなどの不均衡に強いモデルを雇用する。
- 集中学習:] より高誤分類コストを少数級エラーに割り当てます。
バランスデータのための性能メトリック
不均衡なデータに対するモデルの評価には、特定のメトリックが必要です。
- 予測:]]] 正の予測の割合は、すべての肯定的な予測の間で。
- Recall:]]]] 実際の正当の割合は正しく識別されます。
- F1 スコア:]] 精度とリコールの調和的な意味。
- [AUC-ROC:[]]は、閾値を渡るクラス間で区別するモデルの能力を測定します。