Table of Contents
不均衡なデータセットは、不正検知、医療診断、異常検知などの多くの現実的なアプリケーションで共通しています。不均衡に対処することは、効果的な機械学習モデルの構築に不可欠です。この記事では、バランスの取れたデータを効果的に処理するために数学的な原則によってサポートされている実用的な技術を探ります。
データ・インバランスの理解
一方のクラスのインスタンス数が大きく別のインスタンスを超えたときにデータ不均衡が起こります。この不均衡は、モデルを大部分のクラスに偏すことができ、マイナーなクラスインスタンスを検出する能力を減らすことができます。数学的に、]N[]がサンプルの合計数で、N]]の優先]は、N[FLT:[FLT:]の合計値が、N[FLT:[FLT:]の]の小数が、N[FLT]の]の[[FLT]の]の小数が、N[[[[FLT]の]の小数]の小数]の[[[[[[[[FLT]]]]]の]の]の小数]の小数]の合計値が[[[[[[[[[[[[[[[[[[[[[FLT]]]]]]]]]]]]]]]]]]
バランスの取れる技術
複数の技術は、データの不均衡の影響を緩和することができます。これらの方法は、データレベルとアルゴリズムレベルのアプローチに広く分類することができます。
データレベルのメソッド
- []:[]]]] マイナーなクラスのサンプルを増加させる。既存のマイナーなサンプルに基づいて合成データポイントを生成するSMOTEなどのメソッドを使用することが多い。
- []アンダーサンプリング:]]] 過半数のクラスサンプルを削減し、貴重な情報を失う危険性があります。
- []ハイブリッドアプローチ:[] オーバーサンプリングとアンダーサンプリングを組み合わせて、データバランスを最適化します。
Algorithm レベルメソッド
- 集中学習:] より高誤分類コストを軽微なクラスエラーに割り当て、モデルの焦点に影響を与える。
- メソッドを組み立てる:[]]]) マイナーなクラス検出を改善するためにブーストのような技術を使用して。
- 決定しきい値を調整する:[ 少数民族クラスの予測を好むために確率の締切りを修正する。
数学基礎
統計的および数学的概念で多くの技術が整っています。例えば、SMOTEは、少数点間の補間によって合成サンプルを作成します。
xnew[]] = x]i] + ラムダ(x]]]j[]] - x[[[]]]i]]) ]
x]iと]x]jは、マイナーなクラスサンプルであり、[は0と1の間のランダムな数字です。 このアプローチは、合成データは、整合性空間の分布内のオブジェクトにあることを確認します。