Elektrotechnische principes
Besluitvormingsbomen voor de beoordeling van kredietrisico's in het bankwezen
Table of Contents
Inleiding
Kredietrisicobeoordeling is een hoeksteen van gezonde bankactiviteiten. Lenders moeten onderscheid maken tussen kredietnemers die op tijd zullen terugbetalen en degenen die waarschijnlijk in gebreke blijven. Historisch gezien hebben banken vertrouwen op menselijk oordeel en eenvoudige scoremodellen, maar de complexiteit van moderne portefeuilles vraagt om meer geavanceerde instrumenten. Beslissingsbomen bieden een transparante, intuïtieve en krachtige methode voor het classificeren van kredietrisico. Door beslissingen te modelleren als een reeks logische regels, helpen ze financiële instellingen verliezen te verminderen, kapitaaltoewijzing te optimaliseren en te voldoen aan wettelijke vereisten zoals Basel II/III en IFRS 9. Dit artikel biedt een diepgaande gids voor het bouwen van beslissingsbomen voor kredietrisicobeoordeling, die betrekking hebben op methodologie, beste praktijken en overwegingen in de realiteit.
Wat zijn Beslissingsbomen?
Een beslissing boom is een onder toezicht machine learning algoritme dat gebruik maakt van een flowchart-achtige structuur om voorspellingen te maken. Het bestaat uit een wortel knooppunt (de hele dataset), interne knooppunten (beslisspunten gebaseerd op een functie), branches (uitkomt van een test), en bladknooppunten (eindvoorspellingen). Voor kredietrisico, het doel is om uitleningen te classificeren als . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Kerncomponenten
- Root knooppunt: De initiële splitsing op het meest informatieve attribuut.
- Stoppencriterium: Maatregelen zoals Gini onzuiverheid of informatiewinst beslissen hoe gegevens te partitioneren om homogeniteit bij elke knoop te maximaliseren.
- Pruning: Overgroeide takken verwijderen om generalisatie te verbeteren.
De beslissing bomen zijn niet-parametrisch, het maken van geen aannames over gegevensdistributie, en kan niet-lineaire relaties vastleggen zonder functie engineering. Hun interpreteerbaarheid is een belangrijk voordeel in gereguleerde industrieën: een bank risico-officier kan accountants precies uitleggen waarom een lening aanvraag werd afgewezen.
Stappen in het opbouwen van een risico-besluitboom
1. Gegevensverzameling
De basis voor historische gegevens van hoge kwaliteit is de basis.
- Toepassingsgegevens: Inkomen, arbeidslengte, leeftijd, onderwijs.
- Buurtengegevens: Kredietgeschiedenis, uitstaande schuld, aantal eerdere delinquenten.
- Gedragsgegevens: Transactiepatronen, rekeningsaldo's.
- Macro-economische gegevens: Rentepercentages, werkloosheidspercentages (voor modellen op portefeuilleniveau).
Een typische dataset bevat 10
2. Voorverwerking van gegevens
Raw data vereist reiniging:
- Verpakt ontbrekende waarden: Imputeren met mediaan (voor numeriek) of modus (voor categorisch), of ontbrekende als een aparte categorie behandelen om potentiële informatieve patronen vast te leggen.
- Uitwendige behandeling: De uiterste waarden om scheef gekromde splitsingen te voorkomen.
- Coding categorische variabelen: Een-hot codering of label codering voor variabelen zoals werkgelegenheid type.
- Normalisatie: Niet strikt vereist voor beslissingsbomen, maar het waarborgen van schaalconsistentie helpt bij het later gebruiken van ensemblemethoden.
Een goede voorbewerking vermindert de vooringenomenheid en bereidt gegevens voor op effectieve splitsing.
3. Functieselectie
Niet alle functies dragen evenveel bij. Functieselectie verbetert de modelprestaties en interpreteerbaarheid:
- Informatiewinst / wederzijdse informatie: Rangkenmerken door hoeveel ze verminderen onzekerheid over het doel.
- Correlation analysis: Verwijder sterk gecorreleerde functies om redundantie te verminderen.
- Recursieve functie eliminatie (RFE): Gebruik een beslissingsboom om iteratief zwakke functies te verwijderen.
Gewoonlijk geselecteerde kenmerken voor kredietrisico omvatten schuld-inkomensverhouding, kredietgebruik, aantal open transacties en lengte van de kredietgeschiedenis.
4. Boomgebouw
Algoritmen verschillen in splitsingscriteria en complexiteitscontrole. De meest gebruikte in het bankwezen:
- CART (Classification and Regression Trees): Gebruikt Gini onzuiverheid voor classificatie. Het produceert binaire splits en verwerkt ontbrekende gegevens via surrogaatsplits.
- C4.5 / C5.0: Gebruikt de informatie winstverhouding en produceert multi-way splits, maar meer vatbaar voor overpassen zonder zorgvuldige snoeien.
- ID3: Historische voorganger, zelden gebruikt in productie.
Hyperparameter Tuning
Sleutelparameters controleren boom complexiteit:
- : Grenswaarden voor overspannen (gemeenschappelijke waarden: 5
- : Minimumaantal monsters dat nodig is om een knoop te splitsen (bv. 50).
- : Minimummonsters per blad (bv. 20).
- : Aantal kenmerken die voor elke splitsing in aanmerking worden genomen (bv. een overzicht van de totale kenmerken).
Gebruik kruisvalidatie om parameters te kiezen. Een ondiepe boom kan underfit zijn; een diepe boom onthoudt lawaai. Het doel is een boom die zich generaliseert tot ongeziene leners.
5. Snoeien
Snoeien vermindert de boom nadat hij volledig is gegroeid. Twee gemeenschappelijke benaderingen:
- Vooraflopend (vroege stopzetting): Stop met splitsen wanneer een knoop minder dan een drempelaantal monsters bevat of wanneer de breuk niet verbetert dat de onzuiverheid minder dan een minimumwinst bedraagt (bv. 0,01).
- Post-prunnen (cost-complexity snoeien): Groei een volledige boom, dan iteratief verwijderen takken die weinig voorspellende waarde toevoegen. Selecteer de subboom met de kleinste kruis-valideerde fout. Scikit-learn. ondersteunt dit via de parameter .
Gesnoeide bomen zijn eenvoudiger, minder gevoelig voor overpassen, en gemakkelijker in productie te zetten.
Voordelen van het gebruik van Beslissingsbomen in het bankwezen
- Interpreteerbaarheid: Een beslissingsboom kan worden gevisualiseerd en uitgelegd aan niet-technische stakeholders. Een risicomanager kan zeggen: . .Als schuld-naar-inkomen > 45% en het aantal recente delinquentes > 2, vlag als hoog risico.
- Geen schalen vereist: Numeriek en categorisch kenmerken worden inheems behandeld, waardoor voorbewerkingsstappen worden verminderd.
- Het hanteren van niet-lineaire relaties: Interacties tussen kenmerken (bijvoorbeeld inkomen en leningsbedrag) worden automatisch vastgelegd door splitsingen.
- Speed: Eenmaal opgeleid, is de voorspelling een snelle logaritmische tijd ten opzichte van de boomdiepte. Ideaal voor real-time kredietbeslissing.
- Kenmerk belang: Bomen bieden ingebouwde metriek (bv. gemiddelde afname van onzuiverheid) om de meest invloedrijke factoren te rangschikken.
Uitdagingen en overwegingen
Overgeschikt
Beslissing bomen hebben een grote variatie. Kleine veranderingen in de training gegevens kunnen zeer verschillende splitsingen produceren. Mitigatie strategieën omvatten snoeien, het instellen van minimale bladgroottes, en het gebruik van ensemble methoden (zie hieronder).
Onevenwichtige gegevens
Credit default is zelden .Vaak minder dan 5% van de monsters . Standaard bomen kunnen worden bevooroordeeld naar de meerderheid (niet-standaard) klasse , wat leidt tot lage terugroep voor defaulters . Oplossingen:
- Resampling: Oversample defaults (SMOTE) of undersample non-defaults.
- Gewogen klassen: Geef hogere straf aan foutieve in gebreke gebleven personen via ].
- Dreigstand tuning: Pas de waarschijnlijkheidsafsluiting aan (standaard boom voorspelt 0/1; gebruik waarschijnlijkheden en stel een hogere drempel in voor het markeren van risico's).
Instabiliteit
Bomen kunnen gevoelig zijn voor het specifieke trainingsmonster.Een remedie is het gebruik van Randombossen of Radient Boosting, die gemiddeld veel bomen om de variatie te verminderen terwijl de interpreteerbaarheid (via functie belangrijk) behouden.
Verbetering van de praktijk van de besluitvormingsbomen
Voor productiekredietmodellen worden afzonderlijke beslissingsbomen zelden alleen gebruikt. In plaats daarvan dienen ze als bouwstenen voor ensemblemethoden:
Willekeurig bos
Een ensemble van honderden beslissing bomen, elk getraind op een bootstrap monster en met behulp van willekeurige subgroepen van functies. Het verbetert de nauwkeurigheid en robuustheid, maar ten koste van een aantal interpretatiebaarheid. Toch, functie belang en SHAP-waarden kunnen voorspellingen verklaren.
Verloopverhoogmachines (GBM)
XGBoost, LightGBM en CatBoost zijn favorieten van de industrie voor kredietrisico. Ze bouwen bomen sequentiële, leren van eerdere fouten. Deze modellen bereiken vaak state-of-the-art prestaties, hoewel ze zorgvuldige afstemming nodig hebben om te voorkomen dat overpassen.
Vergelijking
| Method | Accuracy | Interpretability | Training Speed |
|---|---|---|---|
| Single Decision Tree | Moderate | Very High | Fast |
| Random Forest | High | Moderate | Medium |
| Gradient Boosting | Very High | Low–Moderate | Slow (with tuning) |
Veel banken beginnen met één boom voor verkennende analyse en uitleg van regelgeving, en vervolgens implementeren van een versterkt model voor feitelijke kredietbesluiten.
Regelgevings- en interpretatieaspecten
Financiële toezichthouders (bv. Basel Committee on Banking Supervision) vereisen modeltransparantie en billijkheid. De besluitvormingsbomen stemmen overeen met deze beginselen omdat ze inherent verklaarbaar zijn. De belangrijkste regelgevingsvereisten zijn onder meer:
- Modeldocumentatie: Elke splitregel moet worden gedocumenteerd en gemotiveerd.
- Biastest: Zorg ervoor dat de boom geen onderscheid maakt tussen beschermde groepen (bijv. leeftijd, geslacht).
- Terugtest: Vergelijk voorspelde standaardpercentages met werkelijke uitkomsten in de loop van de tijd.
Conclusie
Het opbouwen van beslissingsbomen voor kredietrisicobeoordeling biedt een transparante en effectieve methode voor het evalueren van leners. Door systematisch gegevens te verzamelen, voorbewerking, functies te selecteren, te bouwen en te snoeien, en uitdagingen zoals overpassen en onbalans aan te pakken, kunnen banken modellen creëren die zowel nauwkeurig als auditeerbaar zijn. Hoewel afzonderlijke bomen beperkt zijn in complexiteit, vormen ze de basis voor krachtige ensemblemodellen die nu standaard zijn in de industrie. Terwijl machine learning blijft evolueren, zorgt het interpreteerbare karakter van beslissingsbomen ervoor dat ze een essentieel instrument blijven voor zowel risicomanagers als regelgevers.
Voor meer informatie, zie het originele CART-boek van Breiman et al. (1984) en de Risk.net artikelen over kredietscores. Om de implementatie te onderzoeken, is de scikit-leerdocumentatie een uitstekende bron.