Table of Contents
クラス不均衡は、一流が他の数を著しくアウト数する機械学習の共通の課題です。この不均衡は、少数のクラスで不公平な実行を偏ったモデルにつながることができます。効果的な技術を実行することで、予測精度とモデルフェアネスを向上させることができます。
クラス・インバランスの理解
データセット内のクラスを配布しても不均衡が発生します。例えば、不正検知では、不正な取引は正当なものよりもはるかに少ないです。この不均衡は、モデルが過半数のクラスを好むようにし、少数のクラスのインスタンスの検出を減らすことができます。
クラス・インバランスの接客テクニック
いくつかのメソッドは、クラス不均衡の問題を軽減するのに役立ちます。
- []:[]] をリサンプリングするマイナーティクラスまたは過半数クラスをオーバーサンプリングすることにより、データセットを調整します。
- 合成データ生成:[] マウスの合成例を作成するためにSMOTEのような技術を使用してください。
- アルゴリズムのアプローチ:[アンサンブルメソッドなどの不均衡に強いモデルを雇用する。
- 集中学習:] より高値な誤分類コストを少数のクラスに割り当てます。
クラスバランスを評価するための計算
メトリックは、不均衡とモデルのパフォーマンスの程度を定量化するのに役立ちます。 一般的な計算には、次のものが含まれます。
- [] バランス比:]] 過半数の比率は、小数のクラスインスタンスに分類されます。
- [] 予測とリコール:[ 正の予測の精度とすべての正のインスタンスを見つける能力を測定します。
- F1 スコア:]] 高精度とリコールの調和的な意味、両方のメトリックのバランス。