Aufbau von Entscheidungsbäumen für die Kreditrisikobewertung im Bankwesen
Einleitung
Kreditrisikobewertung ist ein Eckpfeiler solider Bankgeschäfte. Kreditgeber müssen zwischen Kreditnehmern unterscheiden, die pünktlich zurückzahlen, und solchen, die wahrscheinlich ausfallen werden. Historisch gesehen haben sich Banken auf menschliches Urteilsvermögen und einfache Bewertungsmodelle verlassen, aber die Komplexität moderner Portfolios erfordert ausgefeiltere Werkzeuge. Entscheidungsbäume bieten eine transparente, intuitive und leistungsfähige Methode zur Klassifizierung von Kreditrisiken. Durch die Modellierung von Entscheidungen als eine Reihe logischer Regeln helfen sie Finanzinstituten, Verluste zu reduzieren, die Kapitalallokation zu optimieren und regulatorische Anforderungen wie Basel II/III und IFRS 9 zu erfüllen. Dieser Artikel bietet einen ausführlichen Leitfaden zur Erstellung von Entscheidungsbäumen für die Kreditrisikobewertung, einschließlich Methodik, Best Practices und realen Überlegungen.
Was sind Entscheidungsbäume?
Ein Entscheidungsbaum ist ein überwachter Machine-Learning-Algorithmus, der eine Flussdiagramm-ähnliche Struktur verwendet, um Vorhersagen zu treffen. Er besteht aus einem Root-Knoten (der gesamte Datensatz), internen Knoten (Entscheidungspunkte basierend auf einem Feature), Zweigen (Ergebnisse eines Tests) und Blattknoten (endgültige Vorhersagen).
Kernkomponenten
- Root Node: Die erste Aufteilung auf das informativste Attribut.
- Unterteilungskriterium: Maßnahmen wie Gini-Verunreinigung oder Informationsgewinn entscheiden darüber, wie Daten partitioniert werden sollen, um die Homogenität an jedem Knoten zu maximieren.
- Beschneiden: Entfernen von überwachsenen Zweigen, um die Generalisierung zu verbessern.
Entscheidungsbäume sind nicht parametrisch, machen keine Annahmen über die Datenverteilung und können nichtlineare Beziehungen ohne Feature Engineering erfassen. Ihre Interpretierbarkeit ist ein wesentlicher Vorteil in regulierten Branchen: Der Risikobeauftragte einer Bank kann den Wirtschaftsprüfern genau erklären, warum ein Kreditantrag abgelehnt wurde.
Schritte beim Aufbau eines Kreditrisikoentscheidungsbaums
1. Datenerhebung
Die Grundlage bilden qualitativ hochwertige historische Daten.
- Anwendungsdaten: Einkommen, Beschäftigungsdauer, Alter, Bildung.
- Bureau-Daten: Kredit-Geschichte, ausstehende Schulden, Anzahl der vergangenen Zahlungsausfälle.
- Verhaltensdaten: Transaktionsmuster, Kontostände.
- Makroökonomische Daten: Zinssätze, Arbeitslosenquoten (für Modelle auf Portfolioebene).
Ein typischer Datensatz enthält 10–30 Merkmale und Zehntausende von Kreditdatensätzen. Die Zielvariable ist ein binäres Flag: 1 wenn der Kreditnehmer innerhalb eines definierten Leistungsfensters (z. B. 12 Monate) ausgefallen ist, andernfalls 0.
2. Datenaufbereitung
Rohdaten müssen gereinigt werden:
- Verarbeitung fehlender Werte: Imputieren Sie mit dem Median (für numerisch) oder Modus (für kategorisch) oder behandeln Sie das Fehlen als separate Kategorie, um mögliche Informationsmuster zu erfassen.
- Ausreißerbehandlung: Deckelung extremer Werte, um verzerrte Splits zu vermeiden.
- Kategorische Variablen codieren: Eine-Hot-Codierung oder Label-Codierung für Variablen wie Beschäftigungstyp.
- Normalisierung: Nicht unbedingt für Entscheidungsbäume erforderlich, aber die Gewährleistung der Konsistenz der Skala hilft bei der späteren Verwendung von Ensemble-Methoden.
Die richtige Vorverarbeitung reduziert Bias und bereitet Daten für eine effektive Aufteilung vor.
3. Feature-Auswahl
Nicht alle Merkmale tragen gleichermaßen bei. Die Auswahl der Merkmale verbessert die Leistung und Interpretierbarkeit des Modells:
- Informationsgewinn / gegenseitige Information: Rangieren Sie die Merkmale, um wie viel sie die Unsicherheit über das Ziel reduzieren.
- Korrelationsanalyse: Entfernen Sie stark korrelierte Merkmale, um Redundanz zu reduzieren.
- Rekursive Feature Eliminierung (RFE): Verwenden Sie einen Entscheidungsbaum, um schwache Features iterativ zu entfernen.
Häufig ausgewählte Merkmale für das Kreditrisiko umfassen Schulden-Einkommens-Verhältnis, Kreditauslastung, Anzahl der offenen Trades und Länge der Kredit-Geschichte.
4. Baumbildung
Algorithmen unterscheiden sich in Splitting-Kriterien und Komplexitätskontrolle.
- CART (Classification and Regression Trees): Verwendet Gini-Verunreinigungen für die Klassifizierung. Es erzeugt binäre Splits und verarbeitet fehlende Daten über Ersatzsplits.
- C4.5 / C5.0: Verwendet Informationsgewinn-Verhältnis und erzeugt Mehrwege-Splits, aber anfälliger für Überanpassung ohne sorgfältiges Beschneiden.
- ID3: Historischer Vorgänger, selten in der Produktion verwendet.
Hyperparameter-Abstimmung
Schlüsselparameter zur Steuerung der Baumkomplexität:
- : Limitiert maximale Werte, um Überanpassungen zu verhindern (gemeinsame Werte: 5-15).
- : Mindestanzahl von Samples, die erforderlich sind, um einen Knoten aufzuteilen (z. B. 50).
- : Mindestproben pro Blatt (z. B. 20).
- : Anzahl der Features, die für jede Aufteilung betrachtet werden (z. B. sqrt der Gesamtfunktionen).
Wenn man die Parameter mithilfe von Cross-Validation auswählt, kann ein flacher Baum unterlegen sein, ein tiefer Baum merkt sich das Rauschen. Das Ziel ist ein Baum, der sich auf unsichtbare Kreditnehmer verallgemeinert.
5. Beschneiden
Der Schnitt reduziert den Baum nach dem Anbau bis zur vollen Tiefe.
- Pre-Pruning (frühes Stoppen): Stoppen Sie die Aufteilung, wenn ein Knoten weniger als eine Schwellenwertzahl von Samples enthält oder wenn die Aufteilung die Verunreinigungsreduktion nicht über einen Mindestgewinn hinaus verbessert (z. B. 0,01).
- Post-Pruning (Kostenkomplexitäts-Pruning): Wachsen Sie einen vollen Baum und entfernen Sie dann iterativ Zweige, die wenig prädiktiven Wert hinzufügen. Wählen Sie den Teilbaum mit dem kleinsten Kreuzvalidierungsfehler. Scikit-learns unterstützt dies über den Parameter.
Beschnittene Bäume sind einfacher, weniger anfällig für Überanpassungen und leichter in der Produktion einzusetzen.
Vorteile der Verwendung von Entscheidungsbäumen im Bankwesen
- Interpretierbarkeit: Ein Entscheidungsbaum kann visualisiert und nicht-technischen Stakeholdern erklärt werden. Ein Risikomanager kann sagen: “Wenn Schulden zu Einkommen > 45% und die Anzahl der jüngsten Zahlungsausfälle > 2, als hohes Risiko kennzeichnen.”
- Keine Skalierung erforderlich: Numerische und kategorische Merkmale werden nativ behandelt, wodurch die Vorverarbeitungsschritte reduziert werden.
- Handling nichtlinearer Beziehungen: Interaktionen zwischen Merkmalen (z.B. Einkommen und Kreditbetrag) werden automatisch durch Splits erfasst.
- Geschwindigkeit: Einmal trainiert, ist die Vorhersage schnell - logarithmische Zeit relativ zur Baumtiefe. Ideal für Echtzeit-Kreditentscheidungen.
- Feature-Bedeutung: Bäume bieten eingebaute Metriken (z. B. mittlere Abnahme der Verunreinigung), um die einflussreichsten Faktoren zu ranken.
Herausforderungen und Überlegungen
Überholung
Entscheidungsbäume haben eine hohe Varianz. Kleine Änderungen der Trainingsdaten können sehr unterschiedliche Splits erzeugen. Zu den Minderungsstrategien gehören das Beschneiden, die Festlegung von Mindestblattgrößen und die Verwendung von Ensemble-Methoden (siehe unten).
Unausgewogene Daten
Kreditausfall ist selten – oft weniger als 5% der Stichproben. Standardbäume können sich in Richtung der Mehrheitsklasse (nicht standardmäßig) verzerren, was zu einem geringen Rückruf für Ausfallende führt.
- Resampling: Oversample defaults (SMOTE) oder Undersample non-defaults.
- Gewichtete Klassen: weisen höhere Strafen zu, um die Ausfallersatzungen über falsch zu klassifizieren.
- Threshold Tuning: Passen Sie den Wahrscheinlichkeits-Cutoff an (Standardbaum prognostiziert 0/1; Verwenden Sie Wahrscheinlichkeiten und legen Sie einen höheren Schwellenwert für das Flagging-Risiko fest).
Instabilität
Bäume können empfindlich auf die spezifische Trainingsprobe reagieren.Ein Mittel ist die Verwendung von Random Forests oder Gradient Boosting, die im Durchschnitt viele Bäume zur Verringerung der Varianz bei gleichzeitiger Aufrechterhaltung der Interpretierbarkeit (über die Bedeutung von Merkmalen) verwenden.
Verbesserung der Entscheidungsbäume in der Praxis
Für Produktionskreditmodelle werden einzelne Entscheidungsbäume selten allein verwendet, sondern dienen als Bausteine für Ensemble-Methoden:
Random Forest
Ein Ensemble von Hunderten von Entscheidungsbäumen, die jeweils auf einer Bootstrap-Probe trainiert werden und zufällige Teilmengen von Merkmalen verwenden. Es verbessert die Genauigkeit und Robustheit, aber auf Kosten einer gewissen Interpretierbarkeit. Dennoch können die Bedeutung von Merkmalen und SHAP-Werte Vorhersagen erklären.
Gradientenverstärkungsmaschinen (GBM)
XGBoost, LightGBM und CatBoost sind Industriefavoriten für Kreditrisiken. Sie bauen Bäume nacheinander, lernen aus früheren Fehlern. Diese Modelle erreichen oft eine hochmoderne Leistung, obwohl sie sorgfältig abgestimmt werden müssen, um Überanpassungen zu vermeiden.
Vergleichsvergleich
| Method | Accuracy | Interpretability | Training Speed |
|---|---|---|---|
| Single Decision Tree | Moderate | Very High | Fast |
| Random Forest | High | Moderate | Medium |
| Gradient Boosting | Very High | Low–Moderate | Slow (with tuning) |
Viele Banken beginnen mit einem einzigen Baum für die Sondierungsanalyse und regulatorische Erklärung, dann setzen Sie ein verstärktes Modell für die tatsächliche Kreditvergabe Entscheidungen.
Aspekte der Regulierung und Interpretierbarkeit
Finanzaufsichtsbehörden (z. B. Basel-Ausschuss für Bankenaufsicht) verlangen Modelltransparenz und Fairness. Entscheidungsbäume stimmen mit diesen Grundsätzen überein, da sie von Natur aus erklärbar sind.
- Modelldokumentation: Jede Split-Regel muss dokumentiert und begründet werden.
- Bias-Tests: Stellen Sie sicher, dass der Baum geschützte Gruppen nicht diskriminiert (z. B. Alter, Geschlecht).
- Backtesting: Vergleichen Sie die vorhergesagten Standardraten mit den tatsächlichen Ergebnissen im Laufe der Zeit.
Scikit-learns Entscheidungsbaum wird häufig für Prototyping verwendet. Für die Produktion bieten Bibliotheken wie XGBoost integrierte Modellerklärungsmöglichkeiten.
Schlussfolgerung
Die Erstellung von Entscheidungsbäumen für die Kreditrisikobewertung bietet eine transparente und effektive Methode zur Bewertung von Kreditnehmern. Durch die systematische Erhebung von Daten, Vorverarbeitung, Auswahl von Funktionen, Erstellung und Beschneidung des Baums und die Bewältigung von Herausforderungen wie Überanpassung und Ungleichgewicht können Banken Modelle erstellen, die sowohl genau als auch überprüfbar sind. Während einzelne Bäume in ihrer Komplexität begrenzt sind, bilden sie die Grundlage für leistungsfähige Ensemblemodelle, die heute in der Branche Standard sind. Da sich das maschinelle Lernen weiterentwickelt, wird durch die Interpretationsfähigkeit von Entscheidungsbäumen sichergestellt, dass sie ein wichtiges Werkzeug für Risikomanager und Regulierungsbehörden bleiben.
Für weitere Lektüre, betrachten Sie das Original CART Buch von Breiman et al. (1984) und die Risk.net ] Artikel über Kredit-Scoring. Um die Umsetzung zu erkunden, ist die scikit-learn Dokumentation eine ausgezeichnete Ressource.