Table of Contents
データセット内のクラス分布が不均一であるときにデータ不均衡が起こります。これは、監視された学習モデルのパフォーマンスに著しく影響し、偏見予測とマイナーティクラスの精度が低下する可能性があります。
データ・インバランスの理解
多くの現実世界シナリオでは、いくつかのクラスは他のものよりも一般的です。例えば、不正な検出では、不正な取引は正当なものと比較してまれです。この不均衡は、マイナーなクラスを無視して、モデルを大部分のクラスを好む可能性があります。
衝撃を測定する
データ不均衡がモデルにどのように影響するかを評価するために、いくつかのメトリックが使用できる:
- Accuracy:]は、大部分のクラスを常に予測することで、高精度を達成できるため、不均衡なデータセットで誤解を招くかもしれません。
- 予測とリコール:[] 肯定的な例を識別するモデルの能力に洞察を提供します。
- F1 スコア:]] バランスの取れた測定を与えるために精密およびリコールを結合して下さい。
- [ROC-AUC:]]は、閾値を渡るクラス間で区別するモデルの能力を測定します。
影響を計算する
データ不均衡の影響を定量化する1つのアプローチは、バランスの取れた対比のデータセットのモデル性能を比較することです。テクニックは次のとおりです。
- オーバーサンプリングやアンダーサンプリングなどの再サンプリング方法を適用します。
- SMOTEなどの合成データ生成を併用
- バランスの取れる技術前後のメトリックの評価
- 精度、リコール、F1スコアの変更を分析します。
これらのメトリックを測定することにより、実務者は、モデル予測に影響を与える不均衡の影響をどれだけ評価し、適切な緩和戦略を決定することができます。