Introducción

La evaluación del riesgo de crédito es una piedra angular de operaciones bancarias sólidas. Los prestatarios deben distinguir entre los prestatarios que pagarán a tiempo y los que probablemente se desprevengan. Históricamente, los bancos se basaron en el juicio humano y los modelos de puntuación simples, pero la complejidad de las carteras modernas exige herramientas más sofisticadas. Los árboles de decisiones ofrecen un método transparente, intuitivo y poderoso para la construcción de la mejor manera de la estructuración de Basilea.

¿Qué son los árboles de decisión?

Un árbol de decisión es un algoritmo de aprendizaje automático supervisado que utiliza una estructura similar al diagrama de flujo para hacer predicciones. Se compone de un nodo raíz (el conjunto de datos completo), nodos internos (puntos de decisión basados en una característica), ramas (resultados de una prueba), y nodos de hoja (predicciones finales). Para el riesgo de crédito, el objetivo es clasificar a los prestatarios como “default” o “no-default” (o en los tigresores de riesgo).

Componentes básicos

  • Nodo de arranque: La división inicial en el atributo más informativo.
  • Proyecto de distribución: Medidas como la impureza Gini o la ganancia de información deciden cómo dividir los datos para maximizar la homogeneidad en cada nodo.
  • Pruning: Removing overgrown branches to improve generalization.

Los árboles de decisiones no son paramétricos, sin tener en cuenta la distribución de datos, y pueden captar relaciones no lineales sin ingeniería de características. Su interpretación es una ventaja clave en las industrias reguladas: el agente de riesgo de un banco puede explicar a los auditores exactamente por qué se rechazó una solicitud de préstamo.

Pasos para la construcción de un árbol de decisiones sobre riesgo de crédito

1. Recopilación de datos

Los datos históricos de alta calidad son la base. Fuentes de datos comunes incluyen:

  • Datos de aplicación: Ingresos, duración del empleo, edad, educación.
  • Datos comerciales:] Historia del crédito, deuda pendiente, número de deinquietencias pasadas.
  • Datos conductuales:] Pautas de transacción, balances de cuentas.
  • Datos macroeconómicos: Tasas de interés, tasas de desempleo (para modelos de cartera).

Un conjunto de datos típico contiene 10–30 características y decenas de miles de registros de préstamos. La variable objetivo es una bandera binaria: 1 si el prestatario se predeterminó dentro de una ventana de rendimiento definida (por ejemplo, 12 meses), más 0.

2. Preprocesamiento de datos

Los datos brutos requieren limpieza:

  • Valores perdidos: Imputar con mediana (para numérica) o modo (para categórica), o tratar a desaparecidos como una categoría separada para capturar patrones informativos potenciales.
  • Tratamiento más amplio: Capping extreme values to avoid skewed splits.
  • Definición de variables categóricas: Codificación de etiquetas o codificación de etiquetas de un solo toque para variables como el tipo de empleo.
  • Normalización: No se requiere estrictamente para los árboles de decisión, pero garantizar la consistencia de la escala ayuda al usar métodos de conjunto más adelante.

El procesamiento adecuado reduce el sesgo y prepara datos para una división efectiva.

3. Selección de características

No todas las características contribuyen por igual. La selección de características mejora el rendimiento y la interpretación del modelo:

  • Ganancia de información / información mutua: Ranke características por cuánto reducen la incertidumbre sobre el objetivo.
  • Análisis de la correlación: Eliminar las características altamente correlativas para reducir la redundancia.
  • Recuerdo de la eliminación de características (RFE): Usar un árbol de decisión para eliminar iterativamente las características débiles.

Las características seleccionadas comúnmente para el riesgo de crédito incluyen la relación entre deuda y ingresos, la utilización del crédito, el número de comercios abiertos y la duración del historial de crédito.

4. Edificio de árboles

Los algoritmos difieren en los criterios de división y el control de complejidad.

  • CART (Arboles de Clasificación y Regresividad): Usa la impureza Gini para la clasificación. Produce divisiones binarias y maneja datos perdidos a través de divisiones de surrogado.
  • C4.5 / C5.0: Usa la relación de ganancia de información y produce divisiones multi-way, pero más proclive a sobreajustarse sin una poda cuidadosa.
  • ID3: Antecesor histórico, raramente utilizado en la producción.

Tuning hiperparametro

Complejidad de los árboles de control de parámetros clave:

  • : Limita los niveles máximos para prevenir la sobreajuste (valores comunes: 5–15).
  • : Número mínimo de muestras necesarias para dividir un nodo (por ejemplo, 50).
  • : Muestras mínimas por hoja (por ejemplo, 20).
  • : Número de características consideradas para cada división (por ejemplo, el tamaño de las características totales).

Usar la validación cruzada para elegir parámetros. Un árbol poco profundo puede subconfigurarse; un árbol profundo memoriza el ruido. El objetivo es un árbol que generaliza a los prestatarios invisibles.

5. Pruning

El pruning reduce el árbol después de que se haya cultivado a plena profundidad.

  • Pre-corrimiento (detenido casi): Deja de dividir cuando un nodo contiene menos de un número de umbral de muestras o cuando la división no mejora la reducción de la impureza más allá de un mínimo de ganancia (por ejemplo, 0,01).
  • Post-pruning (costo-complexity pruning):] Crece un árbol completo, luego elimina iterativamente las ramas que añaden poco valor predictivo. Seleccione el subárbol con el error más pequeño de validación cruzada. Scikit-learn soporta esto a través del parámetro .

Los árboles podados son más simples, menos propensos a la sobreajuste y más fáciles de implementar en la producción.

Ventajas de utilizar los árboles de decisión en la banca

  • Interpretabilidad: Un árbol de decisión puede ser visualizado y explicado a los actores no técnicos. Un gestor de riesgo puede decir: "Si la deuda a los ingresos > 45% y número de deincuencias recientes > 2, bandera como alto riesgo".
  • No se requiere escalar: Las características numéricas y categóricas se manejan de manera nativa, reduciendo los pasos de preprocesamiento.
  • Relaciones no lineales: Las interacciones entre características (por ejemplo, la cantidad de ingresos y préstamos) se capturan automáticamente a través de divisiones.
  • Hablado: Una vez entrenado, la predicción es un tiempo rápido-logarítmico relativo a la profundidad del árbol. Ideal para la decisión de crédito en tiempo real.
  • Importancia de la naturaleza: Los árboles proporcionan métricas integradas (por ejemplo, disminución de la impureza) para clasificar los factores más influyentes.

Retos y consideraciones

Superficie

Los árboles de decisión tienen una gran varianza. Los pequeños cambios en los datos de capacitación pueden producir divisiones muy diferentes. Las estrategias de mitigación incluyen la poda, el establecimiento de tamaños mínimos de hojas y el uso de métodos de conjunto (ver más abajo).

Datos infrarrojos

El defecto de crédito es raro, a menudo menos del 5% de las muestras. Los árboles estándar pueden ser sesgados hacia la clase mayoritaria (no por defecto), lo que conduce a la baja recuperación para los predeterminados.

  • Resampling: Sobresample defaults (SMOTE) o undersample non-defaults.
  • Clases ponderadas: Asignar una pena superior a los predeterminados desclasificación por .
  • Treshold afinación: Ajustar el corte de probabilidad (predicciones de árbol predeterminado 0/1; usar probabilidades y establecer un umbral más alto para el riesgo de insignia).

Instalabilidad

Los árboles pueden ser sensibles a la muestra de entrenamiento específica. Un remedio es usar Bosques de borde o ] Boosting de gran relevancia, que promedio muchos árboles reducen la variabilidad manteniendo la interpretabilidad (por ejemplo, la importancia).

Mejorar los árboles de decisión en la práctica

Para los modelos de crédito de producción, los árboles de decisión individuales rara vez se utilizan solos. En lugar de ello, sirven como bloques de construcción para los métodos de ensemble:

Bosque aleatorio

Un conjunto de cientos de árboles de decisión, cada uno entrenado en una muestra de arranque y utilizando subconjuntos aleatorios de características. Mejora la precisión y la robustez, pero a costa de alguna interpretación. Aún así, característica importancia y los valores SHAP pueden explicar las predicciones.

Máquinas de Boosting de Gradient (GBM)

XGBoost, LightGBM y CatBoost son los favoritos de la industria por riesgo de crédito. Construen árboles secuencialmente, aprendiendo de errores anteriores. Estos modelos a menudo logran el rendimiento de última generación, aunque requieren un ajuste cuidadoso para evitar sobreajustar.

Comparación

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

Muchos bancos comienzan con un solo árbol para el análisis exploratorio y la explicación reglamentaria, luego implementan un modelo impulsado para decisiones de préstamos reales.

Aspectos de regulación e interpretación

Los reguladores financieros (por ejemplo, ]El Comité de Bases de Supervisión Bancaria]) requieren transparencia y equidad modelo. Los árboles de decisión se alinean con estos principios porque son inherentemente explicables.

  • Documentación modelo: Cada regla de división debe ser documentada y justificada.
  • Bias testing:] Garantizar que el árbol no discrimine a los grupos protegidos (por ejemplo, edad, género).
  • Backtesting: Compara las tasas predefinidas por defecto con los resultados reales con el tiempo.

La aplicación del árbol de decisiones de la cuerda de Sicilia es ampliamente utilizada para prototipar. Para la producción, las bibliotecas como XGBoost ofrecen capacidades de explicación de modelo integradas.

Conclusión

La construcción de árboles de decisión para la evaluación del riesgo de crédito proporciona un método transparente y eficaz para evaluar a los prestatarios. Al recopilar sistemáticamente datos, preprocesar, seleccionar características, construir y podar el árbol, y abordar retos como el sobreajuste y el desequilibrio, los bancos pueden crear modelos que sean tanto exactos como auditables. Mientras que los árboles individuales son limitados en la complejidad, forman la base para modelos de conjuntos vitales que son ahora estándar en la industria.

Para más lectura, considere el libro original de CART de Breiman et al. (1984) y los Risk.net] artículos sobre puntuación de crédito. Para explorar la implementación, la documentación de ciencia-aprendizaje es un recurso excelente.