Présentation

Les prêteurs doivent distinguer entre les emprunteurs qui rembourseront à temps et ceux qui risquent de défaut. Historiquement, les banques se sont fondées sur le jugement humain et des modèles de notation simples, mais la complexité des portefeuilles modernes exige des outils plus sophistiqués. Les arbres de décision offrent une méthode transparente, intuitive et puissante pour classer le risque de crédit. En modélisant les décisions en une série de règles logiques, elles aident les institutions financières à réduire les pertes, à optimiser l'allocation de capital et à se conformer aux exigences réglementaires telles que Bâle II/III et IFRS 9. Cet article fournit un guide approfondi pour construire des arbres de décision pour l'évaluation du risque de crédit, couvrant la méthodologie, les meilleures pratiques et les considérations du monde réel.

Qu'est-ce que les arbres de décision?

Un arbre de décision est un algorithme d'apprentissage automatique supervisé qui utilise une structure de diagramme de flux pour faire des prédictions. Il se compose d'un noeud racine (l'ensemble de données), des nœuds internes (points de décision basés sur une caractéristique), des branches (résultats d'un test) et des noeuds foliaires (prédictions finales).

Composantes essentielles

  • Noeud de roulis: La fraction initiale sur l'attribut le plus informatif.
  • Critère de partage: Des mesures comme l'impureté de Gini ou le gain d'information décident comment partitionner les données pour maximiser l'homogénéité à chaque noeud.
  • Prédaction: Suppression des branches cultivées pour améliorer la généralisation.

Les arbres décisionnels ne sont pas paramétriques, ne font aucune hypothèse sur la distribution des données et peuvent saisir les relations non linéaires sans ingénierie des caractéristiques. Leur interprétabilité est un avantage clé dans les industries réglementées: un agent de risque bancaire peut expliquer aux vérificateurs exactement pourquoi une demande de prêt a été rejetée.

Étapes de la construction d'un arbre décisionnel sur le risque de crédit

1. Collecte de données

Les données historiques de haute qualité sont le fondement de la recherche.

  • Données sur la demande:[ Revenu, durée de l'emploi, âge, scolarité.
  • Données du bureau : Historique du crédit, encours de la dette, nombre de manquements passés.
  • Données comportementales:[ Modèles de transactions, soldes de comptes.
  • [Données macroéconomiques: Taux d'intérêt, taux de chômage (pour les modèles de portefeuille).

Un ensemble de données typique contient 10 à 30 fonctionnalités et des dizaines de milliers d'enregistrements de prêts. La variable cible est un drapeau binaire : 1 si l'emprunteur a manqué à une fenêtre de performance définie (p. ex., 12 mois), sinon 0.

2. Prétraitement des données

Les données brutes nécessitent un nettoyage:

  • Taille des valeurs manquantes :[ Imputer avec la médiane (pour le numérique) ou le mode (pour le catégorisme), ou traiter le manquant comme une catégorie distincte pour saisir les profils d'information potentiels.
  • Traitement plus important: Cappage des valeurs extrêmes pour éviter les scissions asymétriques.
  • Encodage des variables catégoricales:[ Encodage ou encodage d'étiquettes à une seule chaleur pour des variables comme le type d'emploi.
  • Normalisation:[ Non strictement nécessaire pour les arbres de décision, mais assurer la cohérence de l'échelle aide lorsque l'utilisation des méthodes d'ensemble plus tard.

Le prétraitement approprié réduit les biais et prépare les données pour une séparation efficace.

3. Sélection des caractéristiques

Toutes les caractéristiques ne contribuent pas de la même façon. La sélection des caractéristiques améliore la performance et l'interprétation du modèle :

  • Régime d'information / information mutuelle:[ Caractéristiques de classement par la mesure dans laquelle elles réduisent l'incertitude au sujet de la cible.
  • Analyse de la correction:[ Supprimer les caractéristiques fortement corrélées pour réduire la redondance.
  • Élimination des caractéristiques récursives (RFE):[ Utilisez un arbre de décision pour supprimer les caractéristiques faibles.

Les caractéristiques couramment choisies pour le risque de crédit comprennent le ratio dette/revenu, l'utilisation du crédit, le nombre de transactions ouvertes et la durée des antécédents de crédit.

4. Bâtiment d'arbres

Les algorithmes diffèrent en termes de critères de fractionnement et de contrôle de la complexité.

  • CART (Classification and Regression Trees):[ Utilise l'impureté de Gini pour la classification. Il produit des fractions binaires et gère les données manquantes via des fractions de substitution.
  • C4.5 / C5.0:[ Utilise le rapport de gain d'information et produit des fractionnements multi-directionnels, mais plus enclins à s'adapter de façon excessive sans élagage soigneux.
  • ID3: Précédent historique, rarement utilisé dans la production.

Tuning hyperparamétrique

Principaux paramètres contrôlent la complexité de l'arbre:

  • : Limite les teneurs maximales pour éviter une suradaptation (valeurs communes: 5-15).
  • : nombre minimal d'échantillons requis pour diviser un noeud (p. ex. 50).
  • : Échantillons minimaux par feuille (p. ex., 20).
  • : Nombre de caractéristiques considérées pour chaque fraction (p. ex., sqrt de caractéristiques totales).

Utilisez la validation croisée pour choisir les paramètres. Un arbre peu profond peut ne pas correspondre; un arbre profond mémorise le bruit. L'objectif est un arbre qui généralise aux emprunteurs invisibles.

5. Ébauche

La taille réduit l'arbre après sa croissance à pleine profondeur.

  • Pré-élagage (arrêt précoce):[ Arrêter le fractionnement lorsqu'un nœud contient moins d'un nombre seuil d'échantillons ou lorsque le fractionnement n'améliore pas la réduction des impuretés au-delà d'un gain minimum (p. ex. 0,01).
  • Post-prunning (coast-complexity tailler):[ Grow a full tree, puis itératively supprimer des branches qui ajoutent peu de valeur prédictive. Sélectionnez le sous-arbre avec la plus petite erreur validée croisée. Scikit-learn=s supporte cela via le paramètre .

Les arbres taillés sont plus simples, moins sujets à l'embouteillage et plus faciles à déployer dans la production.

Avantages de l'utilisation des arbres de décision dans les banques

  • Interprétabilité:[ Un arbre de décision peut être visualisé et expliqué aux intervenants non techniques. Un gestionnaire de risque peut dire: -Si la dette au revenu > 45% et le nombre de récentes déficiences > 2, drapeau comme risque élevé.
  • Aucune échelle requise: Les caractéristiques numériques et catégoriques sont manipulées nativement, réduisant les étapes de prétraitement.
  • Relations non linéaires à la main:[ Les interactions entre les caractéristiques (p. ex., le revenu et le montant du prêt) sont automatiquement saisies par des fractionnements.
  • Speed: Une fois formé, la prédiction est rapide – temps logarithmique par rapport à la profondeur de l'arbre. Idéal pour la décision de crédit en temps réel.
  • Importance caractéristique: Les arbres fournissent des mesures intégrées (p. ex., diminution moyenne des impuretés) pour classer les facteurs les plus influents.

Défis et considérations

Sur-mesure

Les arbres décisionnels présentent de fortes variations.Les petites modifications des données de formation peuvent produire des fractions très différentes. Les stratégies d'atténuation comprennent la taille, la fixation de tailles minimales de feuilles et l'utilisation de méthodes d'ensemble (voir ci-dessous).

Données déséquilibrées

Les arbres standard peuvent devenir biaisés vers la classe majoritaire (non par défaut), ce qui entraîne un faible rappel pour les personnes défaillantes.

  • Resample: Suréchantillon par défaut (SMOTE) ou sous-échantillon par défaut.
  • Classes pondérées:[ Assigner une pénalité plus élevée aux par défaut de classification par .
  • Taille de seuil:[Ajustez la limite de probabilité (l'arbre par défaut prédit 0/1; utilisez les probabilités et fixez un seuil plus élevé pour le risque de braquage).

Instabilité

Les arbres peuvent être sensibles à l'échantillon d'entraînement spécifique. Un remède est d'utiliser Random Forests[ ou Gradient Boosting[, qui moyennent de nombreux arbres pour réduire la variance tout en maintenant l'interpretation (via l'importance de la caractéristique).

Améliorer les arbres décisionnels dans la pratique

Pour les modèles de crédit de production, les arbres à décision unique sont rarement utilisés seuls.

Forêt aléatoire

Un ensemble de centaines d'arbres de décision, chacun formé sur un échantillon de bootstrap et utilisant des sous-ensembles aléatoires de caractéristiques. Il améliore la précision et la robustesse, mais au coût de certaines interprétabilité.

Machines à stimuler les gradients (GBM)

XGBoost, LightGBM et CatBoost sont des produits préférés de l'industrie pour le risque de crédit. Ils construisent des arbres séquentiellement, en tirant des leçons d'erreurs antérieures.

Comparaison

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

De nombreuses banques commencent par un seul arbre pour l'analyse exploratoire et l'explication réglementaire, puis mettent en place un modèle renforcé pour les décisions de prêt réelles.

Aspects réglementaires et d'interprétation

Les organismes de réglementation financière (p. ex. Comité de Bâle sur la surveillance bancaire) exigent la transparence et l'équité des modèles.

  • documentation modèle:[ Chaque règle de fractionnement doit être documentée et justifiée.
  • Essais de bios:[ S'assurer que l'arbre ne fait pas de discrimination à l'égard des groupes protégés (p. ex., âge, sexe).
  • Comparer les taux par défaut prévus avec les résultats réels au fil du temps.

L'arborescence de décision est largement utilisée pour le prototypage. Pour la production, les bibliothèques comme XGBoost offrent des capacités d'explication de modèle intégrées.

Conclusion

La construction d'arbres décisionnels pour l'évaluation des risques de crédit constitue une méthode transparente et efficace pour évaluer les emprunteurs. En recueillant systématiquement des données, en prétraitement, en sélectionnant les caractéristiques, en construisant et en élagant l'arbre et en s'attaquant à des défis comme l'aménagement excessif et le déséquilibre, les banques peuvent créer des modèles à la fois précis et vérifiables.

Pour plus de détails, veuillez consulter le carnet original de CART de Breiman et al. (1984) et les articles Risk.net sur la notation de crédit. Pour explorer la mise en oeuvre, la documentation scikit-learn est une excellente ressource.