データセット内のクラス分布が不均一であるときにデータ不均衡が起こります。これは、監視された学習モデルのパフォーマンスに著しく影響し、偏見予測とマイナーティクラスの精度が低下する可能性があります。

データ・インバランスの理解

多くの現実世界シナリオでは、いくつかのクラスは他のものよりも一般的です。例えば、不正な検出では、不正な取引は正当なものと比較してまれです。この不均衡は、マイナーなクラスを無視して、モデルを大部分のクラスを好む可能性があります。

衝撃を測定する

データ不均衡がモデルにどのように影響するかを評価するために、いくつかのメトリックが使用できる:

  • Accuracy:]は、大部分のクラスを常に予測することで、高精度を達成できるため、不均衡なデータセットで誤解を招くかもしれません。
  • 予測とリコール:[] 肯定的な例を識別するモデルの能力に洞察を提供します。
  • F1 スコア:]] バランスの取れた測定を与えるために精密およびリコールを結合して下さい。
  • [ROC-AUC:]]は、閾値を渡るクラス間で区別するモデルの能力を測定します。

影響を計算する

データ不均衡の影響を定量化する1つのアプローチは、バランスの取れた対比のデータセットのモデル性能を比較することです。テクニックは次のとおりです。

  • オーバーサンプリングやアンダーサンプリングなどの再サンプリング方法を適用します。
  • SMOTEなどの合成データ生成を併用
  • バランスの取れる技術前後のメトリックの評価
  • 精度、リコール、F1スコアの変更を分析します。

これらのメトリックを測定することにより、実務者は、モデル予測に影響を与える不均衡の影響をどれだけ評価し、適切な緩和戦略を決定することができます。