Table of Contents
- 연혁
이 웹 사이트는 귀하가 웹 사이트를 탐색하는 동안 귀하의 경험을 향상시키기 위해 쿠키를 사용합니다. 이 쿠키들 중에서 필요에 따라 분류 된 쿠키는 웹 사이트의 기본적인 기능을 수행하는 데 필수적이므로 브라우저에 저장됩니다. 또한이 웹 사이트의 사용 방식을 분석하고 이해하는 데 도움이되는 제 3 자 쿠키를 사용합니다. 이 쿠키는 귀하의 동의하에 만 브라우저에 저장됩니다. 이러한 쿠키를 거부 할 수도 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다.
왜 결정 트리인가?
결정 트리는 예측을 만들기 위해 Flowchart-like 구조를 사용하는 감독 된 기계 학습 알고리즘입니다. 그것은 루트 노드 (전체 데이터 세트), 내부 노드 (기능에 따라 결정점), 지점 (테스트의 결과) 및 잎 노드 (최종 예측)로 구성됩니다. 신용 위험에 대해서는, 목표는 "기본"또는 "비기본"(또는 위험 계층으로)로 인하여 차용자에게 분류됩니다.
핵심 부품
- Root 노드: 가장 유익한 속성에 초기 분할.
- Splitting criterion: Gini impurity나 information gain와 같은 측정은 각 노드에서 균질을 극대화하기 위해 데이터를 파티션에 결정합니다.
- Pruning: 의 멸균을 제거하여 일반화 개선.
이 웹 사이트는 귀하가 웹 사이트를 탐색하는 동안 귀하의 경험을 향상시키기 위해 쿠키를 사용합니다. 이 쿠키들 중에서 필요에 따라 분류 된 쿠키는 웹 사이트의 기본적인 기능을 수행하는 데 필수적이므로 브라우저에 저장됩니다. 또한이 웹 사이트의 사용 방식을 분석하고 이해하는 데 도움이되는 제 3 자 쿠키를 사용합니다. 이 쿠키는 귀하의 동의하에 만 브라우저에 저장됩니다. 이러한 쿠키를 거부 할 수도 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다.
신용 위험 결정 트리를 구축하는 단계
1. 자료 수집
높은 품질의 역사적인 데이터는 기초입니다. 일반적인 데이터 소스는 다음과 같습니다.
- 응용 자료: 소득, 고용 길이, 연령, 교육.
- Bureau data: 신용 역사, 뛰어난 채무, 과거 탈리쿼터 수.
- Behavioral data: 트랜잭션 패턴, 계정 잔액.
- Macroeconomic data: 이자율, 실업률( 포트폴리오 레벨 모델).
전형적인 데이터 세트에는 10-30 기능과 수천 개의 대출 레코드가 포함되어 있습니다. 대상 변수는 바이너리 플래그입니다. 정의 된 성능 창 (예 : 12 개월) 내에서 기본으로 대여 한 경우 1입니다.
2. 데이터 처리
원료는 청소를 요구합니다:
- Handling missing values:] median (숫자) 또는 모드 (카테고리를 위해)와 함침, 또는 잠재적인 비공식적인 패턴을 캡처하기 위해 별도의 범주로 누락.
- Outlier 처리: 골수 분할을 방지하기 위해 극단적인 값을 매핑.
- 카테고리 변수를 인코딩: 고용형과 같은 변수에 대한 원열 인코딩 또는 라벨 인코딩.
- 정상화:)정상화에 대한 엄격하게 요구되지 않고, 스케일 일관성을 유지하면 ensemble 메서드를 나중에 사용할 수 있습니다.
Proper preprocessing는 bias를 감소시키고 효과적인 나누기를 위한 자료를 준비합니다.
3. 특징 선택
모든 기능에 똑같이 기여하지 않습니다. 기능 선택은 모델 성능과 해석성을 향상시킵니다.
- 정보 이득 / 상호 정보: 대상에 대한 불확실성을 줄이는 방법에 의해 랭크 기능.
- Correlation Analysis: 중복을 줄이기 위해 매우 관련 기능을 제거.
- Recursive feature elimination (RFE): 약한 기능을 제거하기 위해 결정적인 트리를 사용합니다.
신용 위험에 대한 공통 선택된 기능은 채무 - 투 - 소득 비율, 신용 이용, 개방 거래 수 및 신용 역사의 길이를 포함합니다.
4. 나무 건물
Algorithms는 분할 기준과 복잡성 통제에서 다릅니다. 은행 업무에서 널리 이용되는:
- CART (Classification and Regression Trees): 분류에 대한 Gini 불순을 사용합니다. 그것은 바이너리 분할을 생산하고 surrogate 분할을 통해 누락 된 데이터를 처리합니다.
- C4.5 / C5.0: 정보 이득 비율을 사용 하 고 멀티 웨이 분할을 생산, 하지만 더 조심 하 고 번개 하지 않고 초과에 대 한 머리.
- ID3: 역사상 전임자, 거의 생산에 사용.
Hyperparameter 조정
중요한 모수 통제 나무 complexity:
- : 과잉을 방지하기 위해 최대 레벨을 제한합니다 (일반값: 5–15).
- : 노드를 분할해야 하는 최소 샘플 수(예: 50).
- : 잎 당 최소 샘플 (예를들면, 20).
- : 각 분할에 고려된 기능 수 (예: 총 특징의 sqrt).
매개 변수를 선택하기 위해 교차 유효성을 사용합니다. 얕은 나무는 부족할 수 있습니다. 깊은 나무는 소음을 memorizes. 목표는 맹세하지 않는 나무입니다.
5. 펀딩
Pruning은 나무를 전체 깊이로 재배 한 후 감소시킵니다. 두 가지 일반적인 접근법 :
- Pre-pruning (early stopping): 노드가 샘플의 임계값보다 약간 적거나, 분할이 최소 이득을 초과하지 않는 경우 (예를 들어, 0.01).
- Post-pruning (cost-complexity pruning):] 전체 트리를 성장, 그 후 약간의 예측 가치를 추가하는 지점을 제거. 가장 작은 크로스 유효 오류와 하위 트리를 선택. Scikit-learn의 ] 매개 변수를 통해 이것을 지원합니다.
펀딩 된 나무는 단순하고, 더 적은 prone을 overfitting, 그리고 생산에 배포하는 것이 더 쉽습니다.
은행나무의 Decision Trees 사용의 장점
- Interpretability: 결정 트리는 비 기술적인 이해관계자에 대해 시각화하고 설명할 수 있습니다. 위험 관리자는 다음과 같이 말합니다: “부채-to-income > 최근 결정체 > 45% 및 숫자; 2, 높은 위험으로 깃발.”
- 필수: 숫자와 카카오를 특징으로 하는 수식은 기본적으로 처리되며, 사전 처리 단계가 줄어듭니다.
- 안드 비선형 관계: 기능간 상호 작용(예: 소득 및 대출 금액)은 분할을 통해 자동으로 캡처됩니다.
- Speed: 일단 훈련되면, 예측은 나무 깊이에 관계되는 빠른 논리 시간입니다. 실시간 신용 결정에 이상적.
- 특성: 트리는 가장 영향력 있는 요인을 평가하기 위해 내장된 메트릭(예:, 불순)을 제공합니다.
도전과 생각
뚱 베어
Decision 나무는 높은 차이가 있습니다. 훈련 데이터의 작은 변화는 매우 다른 분할을 생산할 수 있습니다. 부흥 전략은 최소 잎 크기를 조정하고, ensemble 방법을 사용하여 (아래 참조).
Imbalanced 자료
기본 신용은 드물게 - 샘플의 5 % 미만입니다. 표준 나무는 기본에 대한 낮은 리콜을 선도하는 대부분의 (비 기본) 클래스에 입찰 될 수 있습니다. 솔루션 :
- Resampling: Oversample defaults (SMOTE) 또는 undersample 비과태.
- 무도한 클래스:]]을 통해 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도한 과도
- Threshold tuning: 확률 차단을 조정한다 (기본 나무는 0/1을 예측한다; 확률을 사용 하 고 기치 위험에 대 한 높은 임계값을 설정).
사용성
트리는 특정 훈련 샘플에 민감 할 수 있습니다. 하나의 치료법은 ]Random Forests 또는 Gradient Boosting를 사용하기위한 것입니다. 이는 평균 많은 나무가 가변성을 유지하면서 해석성을 감소시킵니다 (기능 중요성을 통해).
연습의 Decision Tree 강화
생산 신용 모델에 대 한 단일 결정 나무는 거의 혼자 사용 됩니다. 대신, 그들은 ensemble 방법 건물 블록으로 봉사:
무작위 숲
수백 가지의 결정 나무의 앙상블, 각은 부츠 스트랩 샘플에 훈련하고 기능의 무작위 하위 세트를 사용하여. 그것은 정확성과 견고성을 향상, 하지만 일부 해석의 비용. 여전히, 기능 중요성과 SHAP 값은 예측을 설명 할 수 있습니다.
중력 부스트 기계 (GBM)
XGBoost, LightGBM 및 CatBoost는 신용 위험에 대한 업계를 선호합니다. 그들은 나무를 순차적으로 구축하고 이전 실수로부터 학습합니다. 이 모델은 종종 최첨단 성능을 달성하지만 과잉을 피하기 위해주의적 조정을 요구합니다.
의 특징
| Method | Accuracy | Interpretability | Training Speed |
|---|---|---|---|
| Single Decision Tree | Moderate | Very High | Fast |
| Random Forest | High | Moderate | Medium |
| Gradient Boosting | Very High | Low–Moderate | Slow (with tuning) |
많은 은행은 탐험 분석 및 규제 설명을위한 단일 트리와 함께 시작, 다음 실제 대출 결정에 대한 부스트 모델을 배치.
규제 및 상호 운용성 측면
금융 규제 기관 (예 :, ] Banking Supervision])의 기본위원회는 모델 투명성 및 공정성을 요구합니다. 그들은 불행히 설명하기 때문에 이러한 원칙에 따라 결정되는 데스티언 나무. 중요한 규제 요구 사항은 다음과 같습니다.
- 모델 문서: 각 분할 규칙은 문서화 및 단화되어야 합니다.
- Bias 테스트: 트리는 보호된 그룹에 대해 차별하지 않습니다 (예를들면, 나이, 성별).
- Backtesting:] 시간이 지나면 실제 결과를 가진 기본요금을 예측합니다.
Scikit-learn의 결정 트리 구현은 프로토 타이핑에 널리 사용됩니다. 생산에 대해서는 XGBoost 제안 내장 모델 설명 기능과 같은 라이브러리를 포함합니다.
관련 기사
이 웹 사이트는 귀하가 웹 사이트를 탐색하는 동안 귀하의 경험을 향상시키기 위해 쿠키를 사용합니다. 이 쿠키들 중에서 필요에 따라 분류 된 쿠키는 웹 사이트의 기본적인 기능을 수행하는 데 필수적이므로 브라우저에 저장됩니다. 또한이 웹 사이트의 사용 방식을 분석하고 이해하는 데 도움이되는 제 3 자 쿠키를 사용합니다. 이 쿠키는 귀하의 동의하에 만 브라우저에 저장됩니다. 이러한 쿠키를 거부 할 수도 있습니다. 이러한 쿠키 중 일부를 선택 해제하면 검색 환경에 영향을 미칠 수 있습니다.
더 읽기를 위해 Breiman et al. (1984)과 Risk.net] 크레딧 득점에 기사를 고려하십시오. 구현을 탐구하기 위해 scikit-learn documentation]는 훌륭한 자원입니다.