Table of Contents
导言
信用风险评估是健全银行业务的基石。 贷款人必须区分将按时偿还的借款人和可能违约的借款人。 历史上,银行依赖人性判断和简单的评分模式,但现代组合的复杂性需要更复杂的工具。 决策树提供了透明、直观和强大的信用风险分类方法。 通过将决策作为一系列逻辑规则的模式,它们有助于金融机构减少损失、优化资本分配并遵守监管要求,如巴塞尔II/III和IMF 9。 本条为信用风险评估提供了深入的指南,涵盖了方法、最佳做法和现实世界的考虑。
决策树是什么?
决策树是一种使用类似流程图的结构进行预测的受监督的机器学习算法。它包括根节点(整个数据集)、内部节点(基于特性的决定点)、分支(测试结果)和叶节点(最终预测 ) 。 对于信用风险,目标是将借款人分为“违约”或“非违约”级(或分为风险级 ) 。
核心组成部分
- Root节点:[] 在最信息化属性上初始的分拆.
- 分化标准: 吉尼杂质或信息增益等措施决定如何分割数据,在每个节点实现最大同位化.
- 推延:[]去除过度生长的分支,以提高通化性.
决策树是非参数的,不假设数据分布,也可以在没有特征工程的情况下捕捉非线性关系。 决策树的解释性是受监管行业的一个关键优势:银行风险官员可以向审计人员解释贷款申请被拒绝的确切原因。
构建信用风险决策树的步骤
1. 数据收集
高质量的历史数据是基础数据,共同数据来源包括:
- 应用数据:收入,就业年限,年龄,教育.
- 主席团数据: 信用历史,未偿债务,过去债务的数.
- 行为数据:交易模式,账户余额.
- 宏观经济数据: 利率,失业率(用于投资组合级模型).
一个典型的数据集包含10–30个特性和数万个贷款记录. 目标变量是二进制旗: 1 如果借款人在指定的性能窗口内违约(例如12个月),否则为0.
2. 数据处理
原始数据需要清理 :
- 将缺失值: 与中位数(用于数字)或模式(用于断断)相暗示,或将缺失作为一个单独的分类来对待,以捕捉潜在的信息模式.
- 外部处理:[] 挤压极端值以避免扭曲分裂.
- 编码绝对变量: 单热编码或标签编码,用于就业类型等变量.
- 规范化:[ 并非严格要求决策树,但确保比例一致性有助于以后使用综艺方法.
适当的预处理会减少偏差,并为有效的分拆准备数据.
3. 特长选择
并非所有特性都做出同等贡献。 特性选择可以改善模型性能和可解释性 :
- 信息增益/相互信息: 排名特征,通过这些特征可以减少目标不确定性的程度.
- 校正分析:删除高度关联的特性以减少冗余.
- 递归特性消除(RFE): 使用决定树来迭代去除弱特性.
信用风险的常见选择特征包括债务与收入的比率,信用利用,开放交易数量,信用历史的长度.
4. 树楼
计算法在分拆标准和复杂度控制上有所不同。
- CART(分类和递归树): 使用基尼杂质进行分类,通过代位分制产生二进制分解并处理缺失数据.
- C4.5 / C5.0: 使用信息增益比并产生多向分流,但更容易在不仔细推敲的情况下过度调整.
- ID3:历史前身,很少用于生产.
超参数调制
关键参数控制树的复杂性 :
- :防止偏差的极限水平(共同值:5-15)。
- : 切分节点所需的最低样品数量(例如50个)。
- :每片叶子的最低样本(如20个)。
- :为每个拆分考虑的特性数量(例如总特性的sqrt).
使用交叉验证来选择参数。 浅树可能不适应; 深树会记住噪音。 目标就是向看不见的借款人概括的树。
5. 挤压
普林在树种到完全深度后减少树种,有两种常见的方法:
- 预推(早期停止): 当节点所含样品数量少于阈值时,或者当分点不会使杂质减少超过最小收益时(如0.01),停止拆分.
- 后推(成本-复杂度的推算): 生长一个完整的树,然后迭代地去掉很少增加预测值的树枝。选择具有最小交叉验证错误的子树。 Scikit-learn 的 通过参数支持此功能。
普鲁士树比较简单,不太容易过度配色,生产中也比较容易部署.
银行业使用决策树的好处
- 可解释性:决策树可以直观地向非技术利益攸关方解释。 风险管理者可以说 : “ 如果债务对收入的>45%和最近债务的>2,旗子为高风险。 ”
- 不需要缩放: 数字和绝对特性是本土处理的,减少了预处理步骤.
- 处理非线性关系:[ 特征之间的相互作用(如收入和贷款金额)通过分割自动捕获.
- 描述: 一旦经过训练,预测相对于树深来说是快速的逻辑时间。理想的办法是实时信用决定。
- 性质重要性: 树提供内置的度量衡(如杂质的减少),以排位最有影响力的因素.
挑战和考虑
超适应
决策树差异很大,培训数据变化小,可产生非常不同的分裂,缓解策略包括:挤压、设定最小叶片大小,以及使用综艺方法(见下文)。
数据不平衡
信用违约是罕见的 — — 通常不到样本的5%。 标准树可能会偏向多数(非违约)类,导致违约者召回率低。 解决方案:
- 复标: 超标默认(SMOTE)或低于标非默认.
- 加权等级:[]通过指定对违约人进行更高级的处罚以错误分类。
- 危险调制: 调整概率截断(默认树预测0/1;使用概率并设定更高的标注风险阈值).
不稳定
树对具体的训练样本可以敏感. 一种补救措施是使用Random Forest 或Gradient Boosting,这些树平均可以减少差异,同时保持可解释性(通过特征重要性).
加强决策树在实践中的作用
对于生产信贷模式,很少单独使用单一决策树。
随机森林
由数百个决策树组成的组合,每个都受过靴子样本培训,并使用随机的特征子集。 它能提高准确性和稳健性,但以某种可解释性为代价。 尽管如此,特征重要性和SHAP值可以解释预测。
渐变助推器( GBM)
XGBoost, LightGBM, 和 CatBoost 是业界最喜爱的信用风险。 它们依次构建树,从先前的错误中吸取教训。 这些模型往往能实现最先进的性能,尽管它们需要仔细的调制以避免过度配齐。
比较
| Method | Accuracy | Interpretability | Training Speed |
|---|---|---|---|
| Single Decision Tree | Moderate | Very High | Fast |
| Random Forest | High | Moderate | Medium |
| Gradient Boosting | Very High | Low–Moderate | Slow (with tuning) |
许多银行首先用一棵树进行探索性分析和监管解释,然后为实际贷款决定采用一个增强模式。
管制和可解释性方面
金融监管机构(例如[]巴塞尔银行监督委员会)要求示范透明和公平。
- 模式文档: 每一分规则必须记录在案和说明。
- Bias测试: 确保树不歧视受保护群体(如年龄,性别).
- 背试:[] 将预测的违约率与时间上的实际结果进行比较.
Scikit-learn的决定树的执行被广泛用于原型化. 用于生产,XGBoost等库提供内置模型解释能力.
结论
构建信用风险评估决策树为评估借款人提供了透明和有效的方法。 通过系统收集数据、预处理、选择特征、建造和挤压树,以及应对过度适应和失衡等挑战,银行可以创建既准确又可审计的模型。 虽然单一树的复杂性有限,但它们构成了强大的组合模型的基础,而这种模型是行业中现在的标准。 随着机器学习的不断发展,决策树的可解释性确保它们仍将是风险管理者和监管者的重要工具。
进一步阅读时,请考虑Breiman等人(1984年)的CART原著和Risk.net关于信用评分的文章,为探索执行,Scikit-learn文档[是一个极佳的资源.