Principi di ingegneria elettrica
Costruisci gli alberi delle decisioni per la valutazione dei rischi di credito in Banking
Table of Contents
Introduzione
I creditori devono distinguere tra i mutuatari che ripagano in tempo e quelli che sono probabili inadempienza.III storicamente, le banche si affidano al giudizio umano e ai modelli di punteggio semplici, ma la complessità dei portafogli moderni richiede strumenti più sofisticati.
Quali sono gli alberi delle decisioni?
Un albero di decisione è un algoritmo di machine learning supervisionato che utilizza una struttura a forma di diagramma di flusso per fare previsioni. Si compone di un nodo di radice (l'intero dataset), nodi interni (punti di decisione basati su una caratteristica), rami (eventi di un test), e nodi foglia (previsioni finali).Per il rischio di credito, l'obiettivo è quello di classificare i mutuatari come "default" o "non-default" (o in livelli di rischio).
Componenti core
- Nodo di rotta:[] La divisione iniziale sull'attributo più informativo.
- Cristo di distribuzione:[] Le misure come l'impurità di Gini o il guadagno di informazioni decidono come partizionare i dati per massimizzare l'omogeneità in ogni nodo.
- Rimozione dei rami sovrastanti per migliorare la generalizzazione.
Gli alberi di decisione non sono parametrici, non fanno ipotesi sulla distribuzione dei dati, e possono catturare relazioni non lineari senza ingegneria caratteristica. La loro interpretazione è un vantaggio fondamentale nelle industrie regolamentate: un responsabile del rischio della banca può spiegare ai revisori esattamente perché una domanda di prestito è stata respinta.
Passi nella costruzione di un albero di decisione di rischio di credito
1. Raccolta dei dati
I dati storici di alta qualità sono la base. Le fonti comuni di dati includono:
- Dati di applicazione:[ Reddito, durata dell'occupazione, età, istruzione.
- Dati di costruzione:[ Storia del credito, debito in sospeso, numero di delinquenze passate.
- Dati comportamentali:[ Modelli di transazione, saldi di account.
- Dati macroeconomici:[[ Tassi di interesse, tassi di disoccupazione (per modelli di portafoglio).
Un tipico set di dati contiene 10-30 caratteristiche e decine di migliaia di record di prestito. La variabile di destinazione è una bandiera binaria: 1 se il mutuatario predefinito all'interno di una finestra di prestazione definita (ad esempio, 12 mesi), altri 0.
2. Preelaborazione dei dati
I dati grezzi richiedono la pulizia:
- Attenga i valori mancanti:[] Imputare con mediana (per numerico) o modalità (per categorico), o trattare mancante come categoria separata per catturare potenziali schemi informativi.
- Trattamento più esterno:[] Capping valori estremi per evitare scissioni.
- Codifica delle variabili categoriche:[] Codifica o codifica delle etichette a un punto per variabili come il tipo di occupazione.
- Normalizzazione:[ Non strettamente necessario per gli alberi di decisione, ma assicurando la coerenza della scala aiuta quando si utilizzano metodi di ensemble in seguito.
Il corretto preprocessing riduce il pregiudizio e prepara i dati per una divisione efficace.
3. Selezione delle caratteristiche
Non tutte le caratteristiche contribuiscono allo stesso modo. La selezione delle caratteristiche migliora le prestazioni del modello e l'interpretabilità:
- Informazione guadagno / informazioni comuni:[] caratteristiche casuali da quanto riducono l'incertezza circa il bersaglio.
- Analisi della correlazione:[] Rimuovere le caratteristiche altamente correlate per ridurre la ridondanza.
- eliminazione delle caratteristiche ricorrenti (RFE):[] Utilizzare un albero di decisione per rimuovere in modo iterativo le caratteristiche deboli.
Le caratteristiche comunemente selezionate per il rischio di credito includono il rapporto debito-conto, l'utilizzo del credito, il numero di scambi aperti e la durata della storia del credito.
4. Costruzione dell'albero
Gli algoritmi differiscono nei criteri di divisione e nel controllo della complessità.
- CART (Classificazione e Regression Trees):[] Utilizza l'impurità di Gini per la classificazione. Produce dividezioni binarie e gestisce i dati mancanti tramite le divisioni surrogate.
- C4.5 / C5.0:[[]] Utilizza il rapporto di guadagno delle informazioni e produce scissioni multidirezionali, ma più inclini a sovrapporsi senza prugnare attenta.
- ID3:[] Predecessore storico, raramente usato nella produzione.
Tuning iperparametrico
La complessità dell'albero di controllo dei parametri chiave:
- : Limita i livelli massimi per evitare l'eccessiva configurazione (valori comuni: 5–15).
- : Numero minimo di campioni necessari per dividere un nodo (ad esempio, 50).
- : Campioni minimi per foglia (ad esempio, 20).
- : Numero di caratteristiche considerate per ogni divisione (ad esempio, sqrt di caratteristiche totali).
Un albero basso può essere intatto; un albero profondo memorizza il rumore. L'obiettivo è un albero che generalizza per sbloccare i mutuatari.
5. Pruning
La prugna riduce l'albero dopo che è stato coltivato a piena profondità.
- Pre-pruning (ancora ferma):[] Smettere di dividersi quando un nodo contiene meno di un numero di soglia di campioni o quando la divisione non migliora la riduzione dell'impurità oltre un guadagno minimo (ad esempio, 0,01).
- Post-pruning (cost-complexity potuning):[] Crescere un albero pieno, quindi rimuovere iterativamente rami che aggiungono poco valore predittivo. Selezionare il sottotetto con il più piccolo errore cross-validated. Scikit-learn supporta questo tramite il parametro .
Gli alberi prugnati sono più semplici, meno inclini a sovraccaricarsi, e più facili da distribuire in produzione.
Vantaggi dell'utilizzo di alberi di decisione in Banking
- Interpretabilità:[] Un albero di decisione può essere visualizzato e spiegato a soggetti non tecnici. Un responsabile del rischio può dire: “Se il debito-a-income > 45% e il numero di recenti delinquenze > 2, la bandiera come alto rischio.”
- Non è necessario scagliare:[ Le caratteristiche numeriche e categoriche vengono gestite in modo nativo, riducendo i passaggi di preelaborazione.
- Racconti non lineari:[[] Le interazioni tra le caratteristiche (ad esempio, il reddito e l'importo del prestito) vengono automaticamente catturate attraverso le scissioni.
- Speed:[]] Una volta addestrato, la previsione è veloce—tempo logaritmico rispetto alla profondità dell'albero.
- L'importanza della struttura:[] Gli alberi forniscono metriche integrate (ad esempio, diminuzione media dell'impurità) per classificare i fattori più influenti.
Sfide e considerazioni
Sovrapposizione
Le piccole variazioni dei dati di formazione possono produrre scissioni molto diverse. Le strategie di mitigazione includono la potatura, la regolazione delle dimensioni minime delle foglie e l'utilizzo di metodi di ensemble (vedi sotto).
Dati imbarazzati
Il default del credito è raro – spesso meno del 5% dei campioni. Gli alberi standard possono diventare biased verso la classe di maggioranza (non-default), portando a un basso richiamo per i defaulters.
- Ricampo:[] Predefinizioni di sovracampione (SMOTE) o non-default sottocampo.
- Classi di usanza:[] Assegnare una penalità più alta per classificare i default tramite .
- Treshold tuning:[]] Regolare la probabilità di taglio (l'albero di default prevede 0/1; utilizzare le probabilità e impostare una soglia più alta per il rischio di flagging).
Instabilità
Gli alberi possono essere sensibili al campione di formazione specifico. Un rimedio è quello di utilizzare []Random Forests[] o [Gradient Boosting[]], che media molti alberi per ridurre la varianza mantenendo l'interpretazione (tramite l'importanza della caratteristica).
Migliorare gli alberi delle decisioni in pratica
Per i modelli di credito di produzione, gli alberi a singola decisione sono raramente utilizzati da soli, mentre invece servono come blocchi per i metodi di costruzione:
Foresta casuale
Un insieme di centinaia di alberi di decisione, ognuno formato su un campione di bootstrap e utilizzando sottoinsiemi casuali di caratteristiche. Migliora l'accuratezza e la robustezza, ma a costo di qualche interpretazione. Ancora, l'importanza della caratteristica e i valori SHAP possono spiegare le previsioni.
Macchine di sollevamento di grado (GBM)
XGBost, LightGBM e CatBoost sono preferiti per il rischio di credito, che costruiscono alberi in modo sequenziale, imparando dagli errori precedenti, spesso ottengono prestazioni all'avanguardia, anche se richiedono un'attenta sintonia per evitare il troppo fisse.
Confronto
| Method | Accuracy | Interpretability | Training Speed |
|---|---|---|---|
| Single Decision Tree | Moderate | Very High | Fast |
| Random Forest | High | Moderate | Medium |
| Gradient Boosting | Very High | Low–Moderate | Slow (with tuning) |
Molte banche iniziano con un unico albero per l'analisi esplorativa e la spiegazione normativa, quindi dispiegare un modello potenziato per le decisioni di prestito reali.
Aspetti regolamentari e di interpretazione
I regolatori finanziari (ad esempio, ]]Comitato di base per la vigilanza bancaria[[]]) richiedono una trasparenza e una correttezza del modello.
- Documentazione della tabella:[ Ogni regola di divisione deve essere documentata e giustificata.
- I test di Bias:[] Assicurare che l'albero non discrimina contro i gruppi protetti (ad esempio, età, genere).
- Richiesta:[] Confronta i tassi predetti di default con i risultati effettivi nel tempo.
L'albero di decisione di Scikit-learn[[]] è ampiamente utilizzato per la prototipazione.Per la produzione, librerie come XGBost offrono funzionalità di spiegazione del modello integrate.
Conclusioni
La costruzione di alberi decisionali per la valutazione del rischio di credito fornisce un metodo trasparente ed efficace per valutare i mutuatari. Raccogliendo sistematicamente dati, preelaborazione, selezionando caratteristiche, costruendo e potatura dell'albero, e affrontando sfide come la sovrafitting e lo squilibrio, le banche possono creare modelli che sono sia precisi che verificabili. Mentre i singoli alberi sono limitati nella complessità, formano la base per i potenti modelli di ensemble che sono ora standard nel settore.
Per ulteriori informazioni, prendere in considerazione il libro originale CART di Breiman et al. (1984) e gli articoli [Risk.net[[]]] sul punteggio di credito. Per esplorare l'implementazione, la documentazione di scikit-learn[]] è una risorsa eccellente.