Johdanto

Luottoriskin arviointi on moitteettoman pankkitoiminnan kulmakivi. Lendersin on erotettava toisistaan lainanottajat, jotka maksavat takaisin ajallaan ja jotka todennäköisesti jäävät maksamatta. Historiallisesti pankit luottavat ihmisen harkintakykyyn ja yksinkertaisiin pisteytysmalleihin, mutta nykyaikaisten salkkujen monimutkaisuus vaatii hienostuneempia työkaluja.Päätöspuiden avulla voidaan luoda avoin, intuitiivinen ja tehokas menetelmä luottoriskin luokittelemiseksi. Mallintamalla päätöksiä loogisina sääntöinä ne auttavat rahoituslaitoksia vähentämään tappioita, optimoimaan pääoman kohdentamista ja noudattamaan sääntelyvaatimuksia, kuten Basel II/III:tä ja IFRS 9:ää. Tämä artikkeli tarjoaa perusteellisen oppaan päätöksentekopuiden rakentamisesta luottoriskien arviointia varten, joka kattaa menetelmät, parhaat käytännöt ja tosielämän näkökohdat.

Mitä ovat päätöksen puut?

Päätöspuu on valvottu koneoppimisen algoritmi, joka käyttää flowchart-tyyppinen rakenne tehdä ennusteita. Se koostuu juurisolmu (koko aineisto), sisäiset solmut (päätöspisteet perustuu ominaisuus), haarat (tulos testi), ja lehtien solmut (lopulliset ennusteet). Luottoriskin, tavoitteena on luokitella lainanottajien .

Ydinkomponentit

  • Root node: Ensimmäinen jako kaikkein informatiivinen ominaisuus.
  • Jakamiskriteeri:[ Mittaukset kuten Gini epäpuhtaus tai tiedon saanti päättävät, miten jakaa tiedot maksimoida homogeenisuus kussakin solmussa.
  • Myönnetään ylikasvaneita oksia yleistyksen parantamiseksi.

Päätöksen puut eivät ole parametrisia, joten ne eivät tee oletuksia tiedon jakelusta, ja ne voivat kaapata epälineaarisia suhteita ilman ominaisuustekniikkaa. Niiden tulkintakelpoisuus on keskeinen etu säännellyllä teollisuudessa: pankki. Riskinvalvoja voi selittää tilintarkastajille täsmälleen, miksi lainahakemus hylättiin.

Vaiheet luottoriskipäätöksen muodostamisessa

1. Tietojen kerääminen

Perustana on korkealaatuinen historiallinen tieto. Yhteisiä tietolähteitä ovat:

  • Hakemuksen tiedot:[ Tulot, työn pituus, ikä, koulutus.
  • Bureau data: [ Luottohistoria, maksamatta oleva velka, aiempien delinquences.
  • Käyttäytymistiedot: [ Transaktiomallit, tilin saldot.
  • Makrotaloudelliset tiedot: Korot, työttömyysasteet (salkkutason mallit).

Tyypillinen aineisto sisältää 10.30 ominaisuuksia ja kymmeniä tuhansia lainatietoja. Tavoitemuuttuja on binäärilippu: 1 jos lainanottaja on laiminlyönyt tietyn suoritusajan (esim. 12 kuukautta), muu 0.

2. Tietojen esikäsittely

Raakatiedot on puhdistettava:

  • Kohta puuttuu arvot:[ Epäpuhdas (numeerinen) tai tila (kategoria), tai käsitellä puuttuvat kuin erillinen luokka kaapata mahdolliset informatiivinen kuvioita.
  • Outlier käsittely:[) capting äärimmäiset arvot välttää vinojakoja.
  • Kategoristen muuttujien koodaus:[] Yhden kuumin koodaus tai etiketin koodaus muun muassa työllisyystyypin muuttujille.
  • Normisointi:[ Ei välttämättä vaadita päätöspuille, mutta mittakaavan johdonmukaisuuden varmistaminen auttaa myöhemmin käytettäessä yhdistelmämenetelmiä.

Oikea esikäsittely vähentää ennakkoluuloja ja valmistelee tietoja tehokasta jakamista varten.

3. Ominaisuuden valinta

Kaikki ominaisuudet eivät ole yhtä tärkeitä. Ominaisuuksien valinta parantaa mallin suorituskykyä ja tulkinnallisuutta:

  • Tiedon voitto / keskinäinen informaatio:[Rankin ominaisuudet vähentämällä epävarmuutta tavoitteesta.
  • Korrelaatioanalyysi:[ Poista erittäin korreloivat ominaisuudet vähentääksesi irtisanomista.
  • Rekursiivinen ominaisuus poistaminen (RFE):[] Käytä päätöspuun iteratiivisesti poistaa heikkoja ominaisuuksia.

Luottoriskin yhteisiä ominaisuuksia ovat velka-tulosuhde, luoton käyttö, avointen kauppojen lukumäärä ja luottohistorian pituus.

4. Puurakennus

Algoritmeissa on eroja jakamiskriteereissä ja monimutkaisuuden hallinnassa.

  • CART (Luokka- ja regressiopuut):[ Käyttää Gini-epäpuhtautta luokituksessa. Se tuottaa binäärijakoja ja käsittelee puuttuvia tietoja sijaissynnyttimien kautta.
  • C4.5 / C5.0:[ Käyttää tiedon hyötysuhde ja tuottaa monitiejakoja, mutta altis asennukselle ilman huolellista leikkaamista.
  • ID3:[] Historiallinen edeltäjä, jota käytetään harvoin tuotannossa.

Hyperparametrin viritys

Keskeiset parametrit puunhallintaan:

  • : Enimmäismäärät yliasennuksen estämiseksi (yhteiset arvot: 5.15).
  • : Vähintään solmun jakamiseen tarvittavien näytteiden määrä (esim. 50).
  • : Vähimmäisnäytteet lehtiä kohti (esim. 20).
  • : Kunkin jaon osalta huomioon otettavien ominaisuuksien määrä (esim. neliömetriä kokonaisominaisuuksia).

Käytä ristivalidointi valita parametreja. Matala puu voi olla sopiva; syvä puu muistaa melua. Tavoitteena on puu, joka yleistyy näkymätön lainanottajille.

5. Karsiminen

Puun karsiminen vähentää puun syvyyttä sen kasvattua täyteen syvyyteen.

  • Ennen leikkausta (ennen pysähdystä):[ Lopeta jako, kun solmussa on vähemmän kuin kynnysnäytteitä tai jos jako ei paranna epäpuhtauden vähenemistä minimihyötyä suuremmaksi (esim. 0,01).
  • Post-pruning (kustannus-kompleksisuus karsiminen):[ Kasvata täysi puu, sitten iteratiivisesti poista oksat, jotka tuovat vähän ennustavaa arvoa. Valitse alipuu pienimmällä ristivalidoidulla virheellä. Scikit-Learn. tukee tätä [-parametrin kautta.

Karsitut puut ovat yksinkertaisempia, vähemmän alttiita yliasennukselle ja helpompi ottaa käyttöön tuotannossa.

Edut käyttämällä päätöksen puu pankkialalla

  • Tärkeys:[ Päätöspuu voidaan visualisoida ja selittää muille kuin teknisille sidosryhmille. Riskinhallinnalla on mahdollisuus sanoa: ...Jos velka-tulo-osuus on > 45% ja viimeaikainen delinquences > 2, lippu suuririskisenä.
  • Skaalausta ei tarvita:[] Numeerinen ja kategoriallinen ominaisuus käsitellään natiivisti, mikä vähentää esikäsittelyvaiheita.
  • Ei-lineaaristen suhteiden hallinta:[] ominaisuuksien väliset vuorovaikutukset (esim. tulot ja lainan määrä) otetaan automaattisesti jakojen kautta.
  • Nopeus:[ Koulutettuna ennuste on nopea ennustusaika suhteessa puun syvyyteen. Ihanteellinen reaaliaikaiseen luottopäätöksentekoon.
  • Ominaisuus:[ Puut tarjoavat sisäänrakennettuja mittareita (esim. epäpuhtauksien keskimääräinen väheneminen) kaikkein vaikutusvaltaisimpien tekijöiden luokittelemiseksi.

Haasteet ja näkökohdat

Ylivarustelu

Pieniä muutoksia koulutusaineistossa voi tuottaa hyvin erilaisia jakoja. Mitoitusstrategioita ovat karsiminen, lehtien vähimmäiskokojen asettaminen ja yhdistelmämenetelmien käyttö (ks. jäljempänä).

Tasapainoiset tiedot

Luottolaiminlyönti on harvinaista.Useimmatkin alle 5% näytteistä. Vakiopuista voi tulla puolueellisia enemmistöluokan (ei-oletus) suhteen, mikä johtaa oletusarvoihin. Ratkaisut:

  • Ottamis:[ Yliotosten oletusarvot (SMOTE) tai näytteen alle jätetty oletukset.
  • Painoluokat:[ Määritetään korkeampi rangaistus olettamuksille, jotka on luokiteltu väärin kautta.
  • Pystyviritys:[ Säädä todennäköisyysrajaa (puiden oletusennusteet 0/1; käytä todennäköisyyksiä ja aseta korkeampi kynnys liputusriskille).

Vakauden puute

Puut voivat olla herkkiä erityiselle koulutusnäytteelle. Yksi korjauskeino on käyttää [Random Forests tai Gradient Boosting[, joka on keskimäärin monia puita vähentää varianssia säilyttäen tulkintakelpoisuus (ominaisuuden merkityksen).

Päätöksentekopuiden lisääminen käytännössä

Tuotantoluottomallien osalta yksittäisiä päätöspuita käytetään harvoin yksin. Sen sijaan ne toimivat rakennuspalikoina kokoomamenetelmille:

Satunnainen metsä

Kokoonpano satoja päätöspuita, jokainen koulutettu bootstrap näyte ja käyttämällä satunnaisia alaryhmiä ominaisuuksia. Se parantaa tarkkuutta ja luotettavuutta, mutta hintaan joitakin tulkkattavuutta. Silti, ominaisuus merkitys ja SHAP arvot voivat selittää ennustuksia.

Gradient Boosting Machines (BBM)

XGBoost, LightGBM ja CatBoost ovat teollisuuden suosikkeja luottoriskille. He rakentavat puita peräkkäin, oppien aiemmista virheistä. Nämä mallit usein saavuttaa huippuluokan suorituskykyä, vaikka ne vaativat huolellista virittämistä välttääkseen ylivarustelua.

Vertailu

MethodAccuracyInterpretabilityTraining Speed
Single Decision TreeModerateVery HighFast
Random ForestHighModerateMedium
Gradient BoostingVery HighLow–ModerateSlow (with tuning)

Monet pankit aloittavat yhdellä puulla, joka on tarkoitettu kartoitukseen ja sääntelyyn, ja ottavat sitten käyttöön tehostetun mallin varsinaisia lainapäätöksiä varten.

Sääntelyyn ja tulkkaukseen liittyvät näkökohdat

Rahoitusalan sääntelyviranomaiset (esim. ]Basel-pankkivalvontakomitea) vaativat mallien avoimuutta ja oikeudenmukaisuutta.Päätöspuiden on oltava näiden periaatteiden mukaisia, koska ne ovat luonteeltaan selitettävissä.

  • Kaikki jaetut säännöt on dokumentoitava ja perusteltava.
  • Kiinnikkeiden testaus:[ Varmista, ettei puu syrji suojeltuja ryhmiä (esim. ikä, sukupuoli).
  • Takatarkastus:[ Vertaa ennustettuja oletusarvoja todellisiin tuloksiin ajan mittaan.

Scikit-oppiipäätelmäpuu[ toteutus käytetään laajalti prototyyppien. Tuotannossa kirjastot kuten XGBoost tarjoavat sisäänrakennettu mallin selitys ominaisuuksia.

Päätelmät

Pankkien päätöksentekopuiden rakentaminen luottoriskien arviointia varten tarjoaa avoimen ja tehokkaan menetelmän lainanottajien arviointiin. Keräämällä järjestelmällisesti tietoja, esikäsittelyjä, valitsemalla ominaisuuksia, rakentamalla ja leikkaamalla puuta sekä puuhun liittyviä haasteita, kuten ylivarustelua ja epätasapainoa, pankit voivat luoda malleja, jotka ovat sekä tarkkoja että tarkastettavia. Vaikka yksittäiset puut ovat monimutkaisia, ne muodostavat perustan tehokkaille kokoomamalleille, jotka ovat tällä hetkellä alan standardia. Koneoppimisen kehittyessä, päätöspuiden tulkitseva luonne varmistaa, että ne ovat jatkossakin tärkeä väline sekä riskienhallinnalle että sääntelyviranomaisille.

Lisätietoja saat tarkastelemalla alkuperäistä CART-kirjaa, jonka Breiman et al. (1984) ja Risk.net -artikkelia luottopisteistä. Toteutuksen tutkimiseksi scikit-oppii dokumentaatio[] on erinomainen resurssi.