مقدمه مقدماتی

ارزیابی ریسک اعتباری یک سنگ بنای عملیات بانکی صدا است. Lenders باید بین وام گیرندگان که به موقع بازپرداخت می کنند و کسانی که احتمالا به طور پیش فرض هستند، بانک ها به قضاوت انسانی و مدل های نمره دهی ساده متکی هستند، اما پیچیدگی سبدهای مدرن و منابع مالی، نیاز به ابزارهای پیچیده تر دارند.

درخت های تصمیم گیری چه هستند؟

یک درخت تصمیم یک الگوریتم یادگیری ماشین نظارت است که از یک ساختار شبیه به Flowchart برای پیش بینی استفاده می کند، شامل یک گره ریشه (تمام مجموعه داده)، گره های داخلی (نماز بر اساس یک ویژگی)، شاخه ها (خارج از یک آزمون)، و گره های برگ (پیش بینی نهایی) برای ریسک اعتباری، هدف این است که قرض گیرندگان را به عنوان "شکست" یا "غیرقانون" (عدم ریسک پذیر) طبقه بندی کنند.

اجزای Core

  • [[۱] [۱۰] [۱۰] [۱] [۱۰] [۱] [۱]] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۲] [۲] [۳] [۱] [۱] [۱] [۳] [۳] [۱] [۳] [۱] [۱] [۳] [۱] [۱] [۳] [۱] [۱] [۱] [۳] [۱] [۱] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۳] [۱] [۱] [۳] [۱] [۱] [۱] [۱] [
  • معیار تقویت کننده: اندازه گیری مانند کمبود جینی یا اطلاعات به دست آوردن تصمیم به تقسیم داده ها برای به حداکثر رساندن همگن در هر گره.
  • [[۱] [۱۰] [۱۰] [[۱۰]] [[۱۰]]]] [[۱۰]]] [[۳]]] [۱]]]] [[۱۰]]]] [۳]] [۱]]] [۱]] [۱۰]] [۱]] [۱]] [۱]] [۳] [۱]] [۱] [۱]] [۳] [۳] [۳] [۳] [۳] [۳] [۱] [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [۱]]]]]]]]]] شاخه های [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [بر [براى]]] شاخه های [براى [براى] [براى] از شاخه های [براى [براى] از شاخه های [براى [براى] از شاخه های [براى [براى] از شاخه های [براى [براى [براى] از [براى [براى

درختان تصمیم غیر پارامتریک هستند، و هیچ فرضیه ای در مورد توزیع داده ها ایجاد نمی کنند و می توانند بدون مهندسی ویژگی روابط غیر خطی را ثبت کنند. تفسیر آنها یک مزیت کلیدی در صنایع تنظیم شده است: یک افسر خطر بانک می تواند به حسابرسان توضیح دهد که چرا یک درخواست وام رد شد.

گام های در ساخت یک درخت تصمیم گیری ریسک اعتباری

مجموعه داده ها

داده های تاریخی با کیفیت بالا پایه و اساس است.

  • اطلاعات کاربردی: درآمد، طول اشتغال، سن، آموزش و پرورش.
  • داده های برسرو: تاریخ اعتباری، بدهی برجسته، تعداد از تخفیف های گذشته.
  • [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱]] [۱] [۱] [۱] [۱]]] [۱]]]]]]]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱]]] [۱] [
  • ] اطلاعات اقتصادی مکرو: نرخ بهره، نرخ بیکاری (برای مدل های سطح نمونه کارها).

مجموعه داده های معمولی شامل 10 تا 30 ویژگی و ده ها هزار پرونده وام است. متغیر هدف یک پرچم دودویی است: 1 اگر قرض گیرنده در یک پنجره عملکرد تعریف شده (به عنوان مثال 12 ماه)، دیگر 0.

۲- پردازش داده ها

داده های خام نیازمند تمیز کردن هستند:

  • با واسطه های عددی (برای عددی) یا حالت (برای categorical) یا درمان از دست رفته به عنوان یک دسته جداگانه برای گرفتن الگوهای بالقوه آموزنده.
  • [[۱] [۱۰] [۱] [۱] [۱] [۱]] [۱]] [۱] [۱] [۱]] [۱] [۱]] [۱] [۱] [۱] [۱]] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱]] [۱] [۱]] [۱]]]] [۱]]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱
  • متغیرهای کاتالیک را رمزگذاری کنید: یک-گرم رمزگذاری یا برچسب گذاری برای متغیرهایی مانند نوع اشتغال.
  • عادی سازی: به شدت برای درختان تصمیم گیری لازم نیست، اما اطمینان از سازگاری مقیاس کمک می کند در هنگام استفاده از روش های گروهی بعد.

پیش پردازش مناسب، سوگیری را کاهش می دهد و داده ها را برای تقسیم موثر آماده می کند.

انتخاب ویژگی

همه ویژگی ها به طور یکسان کمک نمی کنند. انتخاب ویژگی عملکرد مدل و تفسیر پذیری را بهبود می بخشد:

  • کسب اطلاعات / اطلاعات متقابل؛ [FLT 1] ویژگی های رتبه بندی با میزان عدم اطمینان در مورد هدف کاهش می یابد.
  • تجزیه و تحلیل روابط: [FLT 1] ویژگی های بسیار مرتبط را برای کاهش رزودنی حذف کنید.
  • حذف ویژگی های بازگشتی (RFE) از یک درخت تصمیم گیری برای حذف ویژگی های ضعیف استفاده کنید.

ویژگی های رایج انتخاب شده برای ریسک اعتباری شامل نسبت بدهی به درآمد، بهره برداری اعتباری، تعداد معاملات باز و طول تاریخ اعتباری است.

ساختمان درخت

الگوریتم ها در تقسیم معیارها و کنترل پیچیدگی متفاوت هستند.به طور گسترده ای در بانکداری مورد استفاده قرار می گیرند:

  • CART (Classification and Regression Trees: از کمبود Gini برای طبقه بندی استفاده می کند، این تقسیمات باینری را تولید می کند و داده های از دست رفته را از طریق تقسیم بندی سوروگان کنترل می کند.
  • ] C4.5 / C5.0: [FLT 1] از نسبت به کسب اطلاعات استفاده می کند و تقسیم های چند طرفه را تولید می کند، اما بیشتر مستعد بیش از حد بدون احتیاط است.
  • [[۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]] [۱] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۳] [۳] [۳] [۳] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۳] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱۰] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۳] [۱] [۱] [۳] [۱] [۱] [۱] [۱] [۱

Hyperparameter Tuning

پارامترهای کلیدی پیچیدگی درخت را کنترل می کنند:

  • حداکثر سطوح را برای جلوگیری از بیش از حد محدود می کند (ارزش های رایج: 5-15).
  • : حداقل تعداد نمونه های مورد نیاز برای تقسیم یک گره (به عنوان مثال، 50)
  • [در این میان] [در این میان]، [و] [در هر برگ [به صورت]، [و] [و [به عنوان مثال]، ۲۰ [۱] [۵] [۱] [۵] [۶] [۶] [۵] [۶] [۶] [۱] [۵] [۶] [۱] [۱] [۶] [۱] [۵] [۵] [۵] [۱] [۵] [۶] [۵] [۵] [۵] [۶] [۱] [۵] [۵] [۵] [۵] [۵] [۵] [۵] [۶] [۵] [۵] [۵] [۵] [۵] [۱] [۱] [۶] [۶] [۶] [۵] [۵] [۵] [۵] [۶] [۶] [۵] [۵] [۶] [۶] [۵] [۱] [۵] [۵] [۱] [۱] [۱] [۵] [۵] [۵] [۵] [۶] [۶] [۵] [۵] [۶] [۶] [۶] [۶
  • [FLT3]: تعداد ویژگی های مورد توجه برای هر تقسیم (به عنوان مثال، مربع از ویژگی های کلی).

از بین بردن پارامتر ها برای انتخاب یک درخت کم عمق ممکن است کم اهمیت باشد؛ یک درخت عمیق سر و صدا را حفظ می کند.هدف یک درخت است که به طور کلی به قرض گیرندگان دیده نمی شود.

۵- Pruning

دویدن پس از رشد آن به عمق کامل، درخت را کاهش می دهد. دو روش مشترک:

  • پیش از آن (از نظر ناگهانی متوقف می شود): تقسیم زمانی که یک گره حاوی کمتر از یک آستانه نمونه یا زمانی که تقسیم کاهش غیر قابل ملاحظه ای را بیش از حداقل سود (به عنوان مثال 0.01) بهبود نمی بخشد.
  • پس از آن (هزینه پیچیده) : رشد یک درخت کامل، سپس آن را به طور غریزی حذف شاخه هایی که اضافه کردن مقدار پیش بینی کوچک است. زیر درخت با کوچکترین خطای متقابل-validated را انتخاب کنید. Scikit-learn این را از طریق پارامتر FLT5 پشتیبانی می کند.

درختان خشک ساده تر، کمتر مستعد بیش از حد و آسان تر برای استقرار در تولید هستند.

مزایای استفاده از درختان تصمیم گیری در بانکداری

  • پیش بینی: یک درخت تصمیم می تواند تجسم و توضیح به ذینفعان غیر فنی است.یک مدیر ریسک می تواند بگوید: "اگر بدهی به درآمد و وام؛ 45٪ و تعداد از delinquen > های اخیر؛ 2 پرچم به عنوان خطر بالا است. "
  • [در این میان] هیچ گونه اختلافی لازم نیست: [[۱]]] ویژگی های عددی و کاتالیک به صورت بومی انجام می شوند، و مراحل پیش پردازش را کاهش می دهند.
  • و روابط غیر خطی: تعاملات بین ویژگی ها (به عنوان مثال، درآمد و وام) به طور خودکار از طریق تقسیمات گرفته می شوند.
  • Speed: پس از آموزش، پیش بینی سریع است - زمان انتزاعی نسبت به عمق درخت ایده آل برای تصمیم گیری اعتباری در زمان واقعی است.
  • اهمیت باروری: درختان معیارهای داخلی (به عنوان مثال کاهش در کمبود) را برای رتبه بندی موثرترین عوامل فراهم می کنند.

چالش ها و ملاحظات

Over

درختان تصمیم دارای تفاوت های بالا هستند. تغییرات کوچک در داده های آموزشی می تواند تقسیم های بسیار متفاوتی را ایجاد کند.استراتژی های مییگation شامل ⁇ ، تنظیم حداقل اندازه برگ و استفاده از روش های گروهی (نگاه کنید به زیر).

Im Balance Data

پیش فرض اعتبار نادر است – اغلب کمتر از ۵ درصد نمونه ها ممکن است درختان استاندارد نسبت به کلاس اکثریت (غیر رسمی) که منجر به یادآوری پایین برای راه حل های پیش فرض می شود، سوگیری داشته باشند:

  • [[۱] [۱۰] [۱] [۱۰] [۱۰] [۱]] [۱۰] [۱]] [۱۰] [۱]] [۱] [۱۰]] [۱] [۱] [۱۰] [۱]] [۱] [۱] [۱۰] [۱]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۲] [۱]]]]] [۱]]]]] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۲] [۲] [۱] [۱]]] [۲] [۱] [۲] [۱] [۱
  • [در این باره] [و] [از روی زمین] [از روی زمین] [[[[۱]]] [[۱۰]]] [[۱۰]]] [۱]] [۱]] [۶] [۶] [۶] [براى [براى] [براى [براى] [براى] [براى [براى] [براى [براى [براى] [براى [براى] [براى [براى] [براى [براى [براى] [براى] [براى [براى] [براى] [براى] [براى] [براى [براى] [براى] [براى] [براى [براى [براى [براى [براى [براى [براى] [براى] [براى] [براى] [براى] [براى] [براى [براى [براى] [براى] [براى] [براى] [براى] [براى] [براى] [براى [براى] [براى] [براى] [براى] [براى] [براى] [
  • تنظیم مجدد: برش احتمال را تنظیم کنید (درخت خطا پیش بینی 0/1؛ استفاده از احتمالات و تعیین آستانه بالاتر برای کاهش خطر.

قابلیت های

درختان می توانند به نمونه آموزش خاص حساس باشند.یک روش درمانی استفاده از جنگل های Random یا Gradient Boosting است که به طور متوسط بسیاری از درختان برای کاهش تفاوت ها در حالی که حفظ قابلیت تفسیر (از طریق اهمیت) است.

افزایش درختان تصمیم در عمل

برای مدل های اعتباری تولید، درختان تصمیم گیری به ندرت به تنهایی استفاده می شوند.

جنگل های تصادفی

یک گروه از صدها درخت تصمیم گیری، هر کدام در نمونه بوت استرپ آموزش داده شده و از زیرمجموعه های تصادفی از ویژگی ها استفاده می کنند، دقت و استحکام را بهبود می بخشد، اما با هزینه برخی از تفسیر، هنوز اهمیت ویژگی و ارزش های SHAP می توانند پیش بینی ها را توضیح دهند.

ماشین های تقویت کننده (GBM)

XGBoost، LightGBM و CatBoost صنعت مورد علاقه برای ریسک اعتباری هستند، آنها درختان را به طور متوالی می سازند، یادگیری از اشتباهات قبلی اغلب به عملکرد پیشرفته دست می یابد، اگرچه آنها نیاز به تنظیم دقیق برای جلوگیری از بیش از حد دارند.

مقایسه مقایسه

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

بسیاری از بانک ها با یک درخت برای تجزیه و تحلیل اکتشافی و توضیح قانونی شروع می شوند، سپس یک مدل تقویت شده برای تصمیم گیری های وام واقعی را به کار می گیرند.

ویژگی های تنظیم و Interpretability

تنظیم کنندگان مالی (به عنوان مثال، کمیته نظارت بانکی نیاز به شفافیت مدل و درختان تصمیم با این اصول مطابقت دارند، زیرا آنها به طور ذاتی قابل توضیح هستند:

  • اسناد مدل: هر قانون تقسیم باید مستند و توجیه شود.
  • [در این باره] آزمایش می کند: [[۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱] [۱۰] [۱]] درخت را در برابر گروه های محافظت شده تبعیض نمی کند (به عنوان مثال، سن، جنسیت).
  • [[۱] [۱۰] [۱۰] [[۱۰]] [[۱۰]]] [[۱۰]]] [[۱۰]]] [۱]] [۱]] [۱]] [۱] [۱۰] [۱]] [۱۰] [۱] [۱۰] [۱] [۱] [۱]] [۱۰] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱]]] [۱] [۱]] [۱] [۱] [۱]]]]]]]]]]] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱] [۱۰] [۱] [۱۰] [۱۰] [۱۰] [۱۰] [۱] [۱] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [۱۰] [۱] [۱] [۱] [۱] [۱] [۱] [۱۰] [

] [دانشگاهی-آمیختن] درخت تصمیم گیری پیاده سازی به طور گسترده ای برای نمونه سازی استفاده می شود، برای تولید، کتابخانه هایی مانند XGBoost ارائه می دهند قابلیت های توضیح مدل داخلی.

نتیجه گیری

ساخت درختان تصمیم برای ارزیابی ریسک اعتباری یک روش شفاف و موثر برای ارزیابی وام گیرندگان فراهم می کند.با جمع آوری منظم داده ها، پیش پردازش، انتخاب ویژگی ها، ساخت و تجزیه و تحلیل درخت و پرداختن به چالش هایی مانند بیش از حد و عدم تعادل، بانک ها می توانند مدل هایی را ایجاد کنند که دقیق و قابل حسابرسی هستند.در حالی که درختان منفرد در پیچیدگی محدود هستند، آنها پایه ای برای مدل های قدرتمند که در حال حاضر ابزار یادگیری استاندارد هستند، همچنان به عنوان یک تصمیم گیری برای مدیران و قابل تنظیم کننده های طبیعی باقی می مانند مدیران، تضمین می شوند.

برای مطالعه بیشتر، کتاب اصلی CART را با Breiman et al. (1984) و Risk.net مقالات در امتیاز اعتباری بررسی پیاده سازی، scikit-learn مستندات یک منبع عالی است.