Table of Contents
コスト感度学習とは、さまざまなタイプのエラーが異なる結果をもたらす状況を処理するための、超推奨機械学習モデルで使用される技術です。 誤った速度ではなく、全体的なコストを最小限にするために学習プロセスを調整することを含みます。 このアプローチは、ヘルスケア、不正検出、および不正分類のコストが著しく変化するクレジットスコアリングなどのドメインで特に有用です。
コストのマトリックスを理解する
コストマトリクスは、コスト感度学習における基本的なコンポーネントです。真のポジティブ、偽陽性、偽陰性、真の負など、各タイプの予測結果に関連するコストを定義します。異なるコストを割り当てることで、モデルは最も高価なエラーを最小限に抑える優先順位を上げることができます。
例えば、医療診断シナリオでは、病気(偽の負)を欠落させることは、誤った警報(偽の正)よりも高価である可能性があります。 コスト行列は、これらの優先順位を訓練プロセスに符号化するのに役立ちます。
コスト感度学習における計算
計算は、モデルの目的関数にコスト行列を統合することを含みます。誤差率を最小化する代わりに、モデルは、その確率で重くされた個々の予測コストの合計である合計コストを最小化します。
バイナリの分類では、合計コスト(C)を次のように表現できます。
C = CFP[]]] * FP + C]FN] * FN + CTP[] * TP + CTN]] * TN[]
CXYは、各予測結果に関連するコストを表し、FP、FN、TP、TNはそれぞれ偽陽性、偽陰性、真正性、真の負のカウントです。
導入戦略
コスト感度学習の実装は、さまざまな方法で実現できます。
- クラスの重量を調整する:[]]]は、トレーニング中に高価なクラスにより高い重量を割り当てます。
- 決定しきい値の修正:[]] 確率しきい値が少ないコストのエラーを支持する変更。
- ]コスト感度アルゴリズムの使用:[コストの倍率を直接組み込むように設計されたアルゴリズムを雇用する。
- [] 再サンプルデータ:[] 関連するコストに基づいて、オーバーサンプルまたはアンダーサンプルクラス。
ほとんどの機械学習ライブラリ、scikit-learn、サポートクラスの体重、およびしきい値の調整など、コスト感度の高い学習を容易にします。