परिचय

क्रेडिट जोखिम आकलन ध्वनि बैंकिंग परिचालन का एक आधारशिला है। ऋणदाताओं को उन उधारकर्ताओं के बीच अंतर करना चाहिए जो समय पर पुनर्भुगतान करेंगे और जो डिफ़ॉल्ट होने की संभावना रखते हैं। ऐतिहासिक रूप से, बैंक मानव निर्णय और सरल स्कोरिंग मॉडल पर निर्भर थे, लेकिन आधुनिक पोर्टफोलियो की जटिलता अधिक परिष्कृत उपकरण की मांग करती है। निर्णय पेड़ ऋण जोखिम को वर्गीकृत करने के लिए एक पारदर्शी, सहज और शक्तिशाली विधि प्रदान करते हैं। तार्किक नियमों की एक श्रृंखला के रूप में निर्णयों को मॉडल करके, वे वित्तीय संस्थानों को नुकसान को कम करने, पूंजी आवंटन को अनुकूलित करने और बेसल II / III और IFRS 9 जैसी नियामक आवश्यकताओं का पालन करने में मदद करते हैं। यह लेख क्रेडिट जोखिम मूल्यांकन के लिए निर्णय पेड़ों का निर्माण करने के लिए एक गहन गाइड प्रदान करता है, विधि विज्ञान, सर्वोत्तम प्रथाओं और वास्तविक दुनिया के लिए।

क्या निर्णय पेड़ हैं?

एक निर्णय पेड़ एक निगरानी मशीन लर्निंग एल्गोरिदम है जो भविष्यवाणियों को बनाने के लिए एक फ्लोचार्ट जैसी संरचना का उपयोग करता है। इसमें एक रूट नोड (पूरे डेटासेट), आंतरिक नोड्स (एक विशेषता के आधार पर बिंदु), शाखाएं (एक परीक्षण के बाहर) और पत्ती नोड्स (अंतिम भविष्यवाणियां) शामिल हैं। क्रेडिट जोखिम के लिए, लक्ष्य उधारकर्ताओं को "डिफ़ॉल्ट" या "गैर-डिफ़ॉल्ट" (या जोखिम स्तरों में) के रूप में वर्गीकृत करना है।

कोर अवयव

  • Root node:] सबसे अधिक जानकारीपूर्ण विशेषता पर प्रारंभिक विभाजन।
  • ]Splitting criterion: Gini impurity या सूचना लाभ जैसे उपाय यह तय करते हैं कि प्रत्येक नोड पर समरूपता को अधिकतम करने के लिए विभाजन डेटा कैसे किया जाए।
  • Pruning: सामान्यीकरण में सुधार के लिए अतिव्यापी शाखाओं को हटा रहा है।

निर्णय पेड़ गैर-पर्मेट्रिक होते हैं, जो डेटा वितरण के बारे में कोई धारणा नहीं बनाती हैं, और सुविधा इंजीनियरिंग के बिना गैर-रैखिक संबंधों को कैप्चर कर सकते हैं। उनकी व्याख्या विनियमित उद्योगों में एक महत्वपूर्ण लाभ है: एक बैंक का जोखिम अधिकारी ऑडिटर को वास्तव में समझा सकता है कि ऋण आवेदन अस्वीकार क्यों किया गया था।

क्रेडिट जोखिम निर्णय वृक्ष के निर्माण में कदम

1. डेटा संग्रह

उच्च गुणवत्ता वाले ऐतिहासिक डेटा नींव है। आम डेटा स्रोतों में शामिल हैं:

  • Application data:] आय, रोजगार की लंबाई, आयु, शिक्षा।
  • Bureau डेटा: क्रेडिट इतिहास, बकाया ऋण, पिछली delinquency की संख्या.
  • Behavioral डेटा: लेनदेन पैटर्न, खाता शेष।
  • ]Macro Economic data: ब्याज दरें, बेरोजगारी दर (फ़ोलॉप्लो पोर्टफोलियो स्तर के मॉडल के लिए)।

एक विशिष्ट डेटासेट में 10-30 विशेषताएं और हजारों ऋण रिकॉर्ड हैं। लक्ष्य चर एक द्विआधारी ध्वज है: 1 यदि उधारकर्ता एक परिभाषित प्रदर्शन विंडो (जैसे 12 महीने), और 0 के भीतर डिफ़ॉल्ट हो जाता है।

2. डेटा प्रीप्रोसेसिंग

कच्चे डेटा को सफाई की आवश्यकता होती है:

  • Handling लापता मान: मध्यस्थ के साथ (सामान्य के लिए) या मोड (श्रेणीबद्ध के लिए) का अर्थ, या संभावित जानकारीपूर्ण पैटर्न को कैप्चर करने के लिए एक अलग श्रेणी के रूप में लापता इलाज.
  • ]Outlier treatment: अत्यधिक मूल्यों का दोहन करने के लिए कटा हुआ विभाजन से बचने के लिए।
  • Encoding categoricalvaris: रोजगार के प्रकार जैसे चरों के लिए एक गर्म एन्कोडिंग या लेबल एन्कोडिंग।
  • ]Normalization: निर्णय पेड़ों के लिए सख्ती से आवश्यक नहीं है, लेकिन स्केल स्थिरता सुनिश्चित करने के बाद से पहना हुआ तरीकों का उपयोग करते समय मदद करता है।

उचित प्रीप्रोसेसिंग पूर्वाग्रह को कम करता है और प्रभावी विभाजन के लिए डेटा तैयार करता है।

3. सुविधा चयन

सभी सुविधाएँ समान रूप से योगदान नहीं करती हैं। फ़ीचर चयन मॉडल प्रदर्शन और व्याख्यात्मकता में सुधार करता है:

  • ]सूचना लाभ / आपसी जानकारी: रैंक की विशेषताएं कितनी हद तक वे लक्ष्य के बारे में अनिश्चितता को कम करते हैं।
  • Correlation विश्लेषण: अति सहसंबंधित सुविधाओं को हटा दें ताकि अतिरेकता को कम किया जा सके।
  • ]Recursive feature elimination (RFE): iteratively कमजोर सुविधाओं को हटाने के लिए एक निर्णय पेड़ का प्रयोग करें।

आम तौर पर क्रेडिट जोखिम के लिए चयनित सुविधाओं में ऋण-से-आयात अनुपात, क्रेडिट उपयोग, खुले व्यापारों की संख्या और क्रेडिट इतिहास की लंबाई शामिल है।

4. वृक्ष भवन

अल्गोरिथम विभाजन मानदंडों और जटिलता नियंत्रण में भिन्न होते हैं। बैंकिंग में व्यापक रूप से उपयोग किया जाता है:

  • CART (Classification and Regression Tree): वर्गीकरण के लिए गिनी अशुद्धता का प्रयोग करता है। यह सरोगेट स्प्लिट्स के माध्यम से द्विआधारी विभाजन और अनुप्रस्थ डेटा का संचालन करता है।
  • C4.5 / C5.0: सूचना लाभ अनुपात का उपयोग करता है और बहु-मार्ग विभाजन पैदा करता है, लेकिन अधिक सावधानीपूर्वक छंटाई के बिना ओवरफिट करने के लिए प्रवणित।
  • ID3: ऐतिहासिक पूर्ववर्ती, शायद ही कभी उत्पादन में इस्तेमाल किया।

हाइपरपरोमीटर ट्यूनिंग

मुख्य पैरामीटर पेड़ जटिलता को नियंत्रित करते हैं:

  • : ओवरफिटिंग को रोकने के लिए अधिकतम स्तर को सीमित करता है (आम मान: 5-15)।
  • : न्यूनतम संख्या में नमूने एक नोड (जैसे, 50) को विभाजित करने के लिए आवश्यक हैं।
  • : प्रति पत्ती न्यूनतम नमूने (उदाहरण के लिए, 20).
  • : प्रत्येक विभाजन के लिए विचार की गई सुविधाओं की संख्या (उदाहरण के लिए, कुल सुविधाओं का वर्ग)।

पैरामीटर चुनने के लिए क्रॉस-वैलिडेशन का उपयोग करें। एक उथले पेड़ को कम किया जा सकता है; एक गहरा पेड़ शोर को याद करता है। लक्ष्य एक ऐसा पेड़ है जो बिना सोचे उधारकर्ताओं को सामान्य करता है।

5. प्रूनिंग

प्रूनिंग पेड़ को कम कर देता है जब इसे पूरी गहराई तक बढ़ाया गया है। दो आम दृष्टिकोण:

  • ]पूर्व-प्रदूषण (पहले रुकने): जब एक नोड में नमूने की एक सीमा से कम संख्या होती है या जब विभाजन न्यूनतम लाभ (जैसे, 0.01) से परे अशुद्धता में कमी में सुधार नहीं करता है तो विभाजन बंद करो।
  • पोस्ट-प्रूनिंग (लागत जटिलता प्रूनिंग): एक पूर्ण पेड़ उगाएं, फिर iteratively उन शाखाओं को हटा दें जो थोड़ा पूर्वानुमानित मूल्य जोड़ते हैं। सबसे छोटी क्रॉस-वैलिड त्रुटि के साथ उप-प्रबंधन का चयन करें। स्किकिट-लर्न का इस का समर्थन पैरामीटर के माध्यम से करता है।

प्रूनेड पेड़ सरल हैं, जो अतिव्यापी हैं, और उत्पादन में तैनात करने में आसान है।

बैंकिंग में निर्णय पेड़ों का उपयोग करने के लाभ

  • ]इंटरप्रेबिलिटी: एक निर्णय पेड़ को दृश्यित किया जा सकता है और गैर-तकनीकी हितधारकों को समझाया जा सकता है। एक जोखिम प्रबंधक कह सकता है: "यदि ऋण-से-आयात और जीटी; 45% और हाल के delinquencys औरgt की संख्या; 2, उच्च जोखिम के रूप में ध्वज।
  • ]नहीं स्केलिंग की आवश्यकता: न्यूमेरिक और श्रेणीबद्ध सुविधाओं को मूल रूप से संभाला जाता है, जिससे प्रीप्रोसेसिंग चरणों को कम किया जाता है।
  • ]]: सुविधाओं के बीच पारस्परिक क्रिया (जैसे, आय और ऋण राशि) स्वचालित रूप से विभाजित के माध्यम से कब्जा कर लिया जाता है।
  • Speed:] एक बार प्रशिक्षित, भविष्यवाणी तेजी से है-अर्थिक समय पेड़ की गहराई के सापेक्ष. वास्तविक समय क्रेडिट निर्णय के लिए आदर्श.
  • ]Feature महत्व: पेड़ सबसे प्रभावशाली कारकों को रैंक करने के लिए अंतर्निहित मीट्रिक (उदाहरण के लिए, मतलब अशुद्धता में कमी) प्रदान करते हैं।

चुनौतियां और विचार

ओवरफिटिंग

निर्णय पेड़ों में उच्च विविधता होती है। प्रशिक्षण डेटा में छोटे बदलाव बहुत अलग विभाजन पैदा कर सकते हैं। शमन रणनीतियों में छंटाई, न्यूनतम पत्ती आकार निर्धारित करना और पहनावा विधियों का उपयोग करना शामिल है (नीचे देखें)।

असंतुलित डेटा

क्रेडिट डिफ़ॉल्ट दुर्लभ है-अक्सर 5% से कम नमूने। मानक पेड़ बहुमत (गैर-डिफ़ॉल्ट) वर्ग की ओर पक्षपातपूर्ण हो सकते हैं, जिससे डिफॉल्टर्स के लिए कम याद आती है। समाधान:

  • Resampling: Oversample चूक (SMOTE) या undersample गैर-defaults.
  • ]Wighted class:] ]]]]Wighted class:]Wighted class:]Wighted class:]Wighted class:]Wighted class:]Wighted class:]Wighted class:Wighted class:]Wighted class:]]Wighted class:[FLT:]]][FLT:[FLT:[FLT:[[FLT:[FLT:[[[[FLT:[[[[[[[[[[]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]Wighted class:[FLT:[FLT:
  • Threshold tuning:: प्रयोज्य कटौती को समायोजित करें (डिफ़ॉल्ट पेड़ 0/1 की भविष्यवाणी करता है; संभावना का उपयोग करें और झंडा जोखिम के लिए एक उच्च सीमा निर्धारित किया है).

अस्थिरता

पेड़ विशिष्ट प्रशिक्षण नमूने के प्रति संवेदनशील हो सकते हैं। एक उपाय का उपयोग करना है Random Forests] या ग्रेडीन्ट बूस्टिंग], जो व्याख्याता बनाए रखने के दौरान विचलन को कम करने के लिए कई पेड़ों की औसत है (विशेष महत्व के माध्यम से)।

अभ्यास में निर्णय पेड़ बढ़ाना

उत्पादन क्रेडिट मॉडल के लिए, एकल निर्णय पेड़ शायद ही कभी अकेले इस्तेमाल किया जाता है। इसके बजाय, वे पहनावा के तरीकों के लिए ब्लॉक के निर्माण के रूप में काम करते हैं:

रैंडम वन

सैकड़ों निर्णय पेड़ों का एक पहनावा, प्रत्येक को बूटस्ट्रैप नमूना पर प्रशिक्षित किया जाता है और सुविधाओं के यादृच्छिक उपसेट का उपयोग किया जाता है। यह सटीकता और मजबूती में सुधार करता है, लेकिन कुछ व्याख्याता की लागत पर। फिर भी, फीचर महत्व और एसएपी मान भविष्यवाणियों की व्याख्या कर सकते हैं।

ग्रेडिएंट बूस्टिंग मशीन (GBM)

XGBoost, LightGBM, और CatBoost क्रेडिट जोखिम के लिए उद्योग पसंदीदा हैं। वे क्रमिक रूप से पेड़ बनाते हैं, पिछली गलतियों से सीखते हैं। ये मॉडल अक्सर अत्याधुनिक प्रदर्शन को प्राप्त करते हैं, हालांकि उन्हें ओवरफिटिंग से बचने के लिए सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।

तुलना

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

कई बैंक एक एकल पेड़ के साथ अन्वेषण विश्लेषण और विनियामक स्पष्टीकरण के लिए शुरू होते हैं, फिर वास्तविक उधार निर्णयों के लिए एक बढ़ाया मॉडल तैनात करते हैं।

नियामक और व्याख्यात्मकता दृष्टि

वित्तीय नियामक (जैसे, ]]बैंकिंग पर्यवेक्षण पर बेसल कमेटी ]] को मॉडल पारदर्शिता और निष्पक्षता की आवश्यकता होती है। निर्णय पेड़ इन सिद्धांतों के साथ गठबंधन करते हैं क्योंकि वे स्वाभाविक रूप से समझा जा सकते हैं। प्रमुख नियामक आवश्यकताओं में शामिल हैं:

  • मॉडल प्रलेखन: प्रत्येक विभाजन नियम को दस्तावेज और उचित ठहराया जाना चाहिए।
  • बायोस परीक्षण:] सुनिश्चित करें कि पेड़ संरक्षित समूहों (जैसे, उम्र, लैंगिक) के खिलाफ भेदभाव नहीं करता है।
  • backtesting: समय के साथ वास्तविक परिणामों के साथ भविष्यवाणी की गई डिफ़ॉल्ट दरों की तुलना करें।

]Scikit-learn के फैसले का पेड़ कार्यान्वयन का व्यापक रूप से प्रोटोटाइपिंग के लिए उपयोग किया जाता है। उत्पादन के लिए, XGBoost जैसे पुस्तकालयों ने निर्मित मॉडल स्पष्टीकरण क्षमताओं की पेशकश की।

निष्कर्ष

क्रेडिट जोखिम मूल्यांकन के लिए निर्णय पेड़ों का निर्माण करने से उधारकर्ताओं को निकालने के लिए एक पारदर्शी और प्रभावी तरीका प्रदान किया जाता है। व्यवस्थित रूप से डेटा एकत्र करके, पूर्व प्रसंस्करण, सुविधाओं का चयन करना, पेड़ को बनाना और छंटनी करना, और चुनौतियों को संबोधित करना जैसे कि ओवरफिटिंग और असंतुलन, बैंक उन मॉडलों को बना सकते हैं जो सटीक और लेखापरीक्षित दोनों हैं। जबकि एकल पेड़ जटिलता में सीमित हैं, वे शक्तिशाली पहनाव मॉडल के लिए आधार बनाते हैं जो अब उद्योग में मानक हैं। चूंकि मशीन लर्निंग विकसित होना जारी है, निर्णय पेड़ों की व्याख्या करने योग्य प्रकृति यह सुनिश्चित करती है कि वे जोखिम प्रबंधकों और नियामकों के लिए एक महत्वपूर्ण उपकरण बने रहेंगे।

आगे पढ़ने के लिए, ब्रेमैन एट अल द्वारा मूल CART पुस्तक पर विचार करें। (1984) और Risk.net] लेख क्रेडिट स्कोरिंग पर। कार्यान्वयन की खोज के लिए, scikit-learn प्रलेखन एक उत्कृष्ट संसाधन है।