導入事例

信用リスク評価は、健全な銀行業務の礎です。 貸し手は、時間に返済する借り手と、デフォルトで可能な人の間で区別しなければなりません。 歴史的に、銀行は人間の判断と簡単なスコアリングモデルに依存していますが、現代のポートフォリオの複雑さは、より洗練されたツールを必要とします。 決定の木は、透明性が高く直観的かつ強力な方法を提供し、一連の論理規則として決定することで、金融機関は損失を減らし、資本調達の最適化、規制当局および規制当局の決定を適切に行うのに役立ちます。 そのような決定は、IIRSおよびIIRS法に準拠するリスクを判断する、およびIIRS法に準拠するリスクを適切に管理します。

決定の木は何ですか?

決定ツリーは、フローチャートのような構造を使用して予測を行う超想定された機械学習アルゴリズムです。 これは、ルートノード(データセット全体)、内部ノード(機能に基づいて決定ポイント)、ブランチ(テストの推奨)、およびリーフノード(最終予測)で構成されています。 クレジットリスクについては、目標は、借り手を「デフォルト」または「デフォルトでない」として分類することです(またはリスク層)。

コアコンポーネント

  • [] ルートノード:]] は、最も有益な属性に初期分割されます。
  • ] 分割基準:[ Gini不純物や情報ゲインなどの対策は、各ノードで均質性を最大化するためにデータを分割する方法を決定します。
  • ]:]の実行:増殖枝を除去して、一般化を改善します。

決定の木は非パラメトリックで、データ分布について無前提にでき、機能工学なしで非線形関係をキャプチャできます。 彼らの解釈は規制された業界の主な利点です。銀行のリスク役員は、融資申請が拒否された理由を正確に監査者に説明することができます。

クレジットリスク決定ツリーの構築手順

1. データ収集

高品質の履歴データは基盤です。一般的なデータソースには以下が含まれます。

  • 申請データ:]所得、雇用時間、年齢、教育。
  • ブローデータ:[]] クレジット履歴、優れた債務、過去の債務の数。
  • []行動データ:[]]トランザクションパターン、アカウント残高。
  • []マクロ経済データ:[]]金利、失業率(ポートフォリオレベルのモデルの場合)。

典型的なデータセットには、10~30の機能と数千のローンレコードが含まれています。 対象変数は、バイナリフラグです。 借受人が定義されたパフォーマンスウィンドウ(例えば、12か月)以内にデフォルトで設定されている場合は、 0。

2.データの処理

生データでは、洗浄が必要です。

  • :]] を処理し、中央値(数値)またはモード(分類)で入力するか、または、潜在的な有益なパターンをキャプチャする別のカテゴリとして欠落した処理。
  • 治療:] 細断された割れを避けるために極端な値をおおうこと。
  • [] 分類変数のエンコード:[ ワンホットエンコーディングまたはエンコーディングのラベルエンコーディング 雇用タイプのような変数。
  • ]正規化:]は決定木のために厳密に要求されませんが、後でアンサンブルメソッドを使用するときにスケールの一貫性が役立ちます。

適切なプリプロセッシングにより、バイアスを削減し、効果的な分割のためのデータの準備が出来ます。

3. 機能選択

機能が均等に寄与するわけではありません。機能選択はモデルのパフォーマンスと解釈性を向上させます。

  • []情報ゲイン/相互情報:[] ターゲットの不確実性を削減する量によるランク機能。
  • 関係解析:] 冗長性を低下させるための高相関機能を削除します。
  • []再帰的機能排除(RFE):[]]])は、決定ツリーを使用して反復的に弱い機能を削除します。

クレジットリスクの一般的な選択機能には、債務対利益比、クレジット利用、オープン取引数、クレジット履歴の期間が含まれます。

4. ツリービル

アルゴリズムは分割基準と複雑性制御の違いです。銀行業で最も広く使用されている:

  • [CART(分類と回帰ツリー):[]]は、分類のためのGini不純物を使用します。 これは、バイナリの分割を生成し、代理分割を介して欠落したデータを処理します。
  • [C4.5/C5.0:[]]]] 情報ゲイン比を使用し、マルチウェイ分割を生成しますが、慎重に剪定せずにオーバーフィットする傾向が高まります。
  • ID3:]] 歴史上司、生産ではほとんど使用していません。

ハイパーパラメータ調整

主変数制御木複雑性:

  • [:過度の不満を防ぐため最大レベルを制限します(一般的な値:5〜15)。
  • [: ノードを分割するために必要な最小サンプル数(例、50)。
  • [:葉ごとの最小サンプル(例、20)。
  • [:各分割(例、総機能の平方)で考慮される機能の数。

パラメータを選択するには、十字検証を使用します。浅い木は、深層ツリーがノイズを記憶する可能性があります。目標は、未公開の借り手に一般化する木です。

5. 剪定

剪定は、それが深さに成長した後、木を減らす。 2つの一般的なアプローチ:

  • [プリプルン(早期停止):[])は、ノードが閾値数よりも少ない場合、または分割が最小限の利益(0.01)を超えた不純物の減少を改善しないとき、分割を停止します。
  • [ポストプルン(コスト複雑性剪定):[]は、完全なツリーを成長させ、反復的に少し予測値を追加するブランチを削除します。最小限の断続的なエラーでサブツリーを選択します。 Scikit-learn's []]]パラメータを介してこれをサポートします。

剪定された木は、よりシンプルで、不適切なものにし、生産に導入しやすいです。

銀行における意思決定ツリーの使用の利点

  • [ 解釈性:]] 決定ツリーは、非技術的な利害関係者に視覚化し、説明することができます。リスクマネージャーは、「債務対利益の>の場合。 45% および最近の債権の>の数。 2、リスクが高い」と言えるでしょう。
  • :[]:数値的および分類的機能は、前処理のステップを減らす、ネイティブに処理されます。
  • :非線形関係の取り扱い:[機能間の相互作用(例えば、収入と融資額)は分割によって自動的に捕獲されます。
  • スピード:] 訓練されたら、予測はツリーの深さに相対的に高速で論理的な時間です。 リアルタイムのクレジット決定に最適です。
  • [] 重要性:] ツリーは、最も影響力のある要因をランク付けするために、組み込みのメトリック(例えば、不純物の減少を意味します)を提供します。

課題と考察

オーバーフィット

決定木は高い分散性を持っています。トレーニングデータの小さな変更は非常に異なる分割を生成することができます。緩和戦略には、剪定、最小葉のサイズの設定、およびアンサンブルメソッド(以下を参照してください)が含まれています。

バランスの取れたデータ

クレジットのデフォルトはまれです。多くの場合、サンプルの5%未満です。標準の樹木は、過半数(デフォルトでない)クラスに向かって偏差される可能性があり、デフォルトでは低リコールを引き起こします。ソリューション:

  • []:]] オーバーサンプルデフォルト(SMOTE)または非デフォルトでアンダーサンプリングします。
  • [] 順にクラスを分類する:[]]] より高いペナルティを割り当て、を介してデフォルトを分類する。
  • [ 閾値チューニング:[ 確率のカットオフを調整します(デフォルトツリーは0/1を予測します。確率を使用し、リスクをフラグリングするためのより高いしきい値を設定)。

不安定性

ツリーは特定の訓練サンプルに敏感であることができます。 1つの救済策は[]]Random Forestsまたは]Gradient Boosting[]]を使用することです。これは、解釈性を維持しながら、さまざまな木を平均的に減少させる(機能重要性)。

練習における決定の木の強化

制作クレジットモデルでは、単数の決定木は単独で使用されていません。代わりに、彼らはアンサンブルメソッドのためのビルディングブロックとして機能します。

ランダムフォレスト

数百本の決定木がアンサンブルで、それぞれがブートストラップのサンプルで訓練され、ランダムな機能のサブセットを使用します。精度と堅牢性が向上しますが、いくつかの解釈能力のコストで。それでも、特徴的な重要性とSHAP値は予測を記述することができます。

勾配ブースティングマシン(GBM)

XGBoost、LightGBM、CatBoostは、信用リスクの業界トップクラスの製品です。 彼らは、ツリーを順次構築し、以前の間違いから学習します。 これらのモデルは、多くの場合、最先端のパフォーマンスを達成しますが、彼らは過度の影響を避けるために慎重に調整する必要があります。

比較比較

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

多くの銀行は、分析と規制説明のための単一のツリーから始まり、実際の融資決定のためのブーストされたモデルを展開します。

規制および解釈性アスペクト

金融規制当局(例、])銀行の監督)の基幹委員会は、モデルの透明性と公平性を必要とします。 決定の木は、これらの原則と一致しているので、それらは本質的に説明可能です。 主な規制要件は次のとおりです。

  • モデルのドキュメント:]の各分割ルールは文書化され、正当化する必要があります。
  • []ビアテスト:]]]ツリーが保護されたグループ(例えば、年齢、性別)に対して差別化されていないことを確認します。
  • []:]]]のチェックを繰り返します。 予測されたデフォルト値と、実際の結果が時間とともに比較します。

[]Scikit-learnの決定ツリー]の実装は、プロトタイピングに広く使用されています。 生産のために、XGBoostの提供組み込みモデルの説明機能などのライブラリ。

コンテンツ

信用リスク評価のための決定の木を建設することは、借り手を評価するための透明性と効果的な方法を提供します。 体系的にデータを収集することにより、, 事前処理, 機能を選択, ツリーを構築し、剪定, 過度の収差や不均衡などの課題に対処する, 銀行は、正確かつ監査可能な両方のモデルを作成することができます. 単一の木は複雑に限られますが、, 彼らは、今、業界標準である強力なエンサンブルモデルの基礎を形成します. マシン学習が継続するにつれて, 彼らが重要な決定ツールと判断のための重要な決定ツールが残っているように.

更に読むには、Breiman et al. (1984) と [] のオリジナルの CART ブックをクレジットスコアリングで検討してください。 実装を探求するには、 ]] scikit-learn ドキュメンテーション は優れたリソースです。