Table of Contents
Beslissingsbomen zijn een nietje van machine learning workflows, gewaardeerd om hun intuïtieve structuur en eenvoudige interpretatie. Ze geven alles van kredietrisicobeoordelingen tot medische diagnose, vaak dienend als het go-to-algoritme voor data wetenschappers die voorspellingen moeten uitleggen aan niet-technische stakeholders. Toch zijn beslissingsbomen niet immuun voor een subtiel maar hardnekkig probleem: multicollineairiteit. Wanneer voorspellers variabelen sterk met elkaar worden gecorreleerd, kunnen beslissingsboommodellen onstabiel worden, vatbaar voor overfitting en moeilijker te interpreteren zijn. Begrijpen hoe multicolelinearity van invloed is op boommodellen en weten hoe ze te behandelen is cruciaal voor iedereen die betrouwbare voorspellende systemen bouwt.
In dit artikel zullen we onderzoeken wat multicollineairheid is, waarom het specifiek belangrijk is voor beslissingsbomen, en een reeks van actieerbare strategieën om de impact ervan te beperken. Of u nu een datawetenschapper bent die een cursus of een beoefenaar leert om een productiemodel te verfijnen, deze technieken zullen u helpen schonere, meer algemene beslissingsbomen te bouwen.
Wat is Multicollineairheid?
Multicollineairiteit verwijst naar een situatie waarin twee of meer voorspellers variabelen in een regressie- of classificatieprobleem lineair gerelateerd zijn aan een hoge graad. Wanneer correlatie tussen variabelen sterk is, bevat de onderliggende gegevens overlappende informatie die vele statistische en machine learning modellen kan verwarren. In lineaire modellen, multicollineairheid inflats standaard fouten en maakt coëfficiënt schattingen onstabiel. In beslissing bomen, de effecten zijn minder duidelijk, maar even schadelijk: het model kan splitsen op redundante kenmerken, het toewijzen van belang willekeurig onder gecorreleerde voorspellers, en de resulterende boom kan worden over complex zonder toevoeging van echte voorspellende kracht.
Er zijn twee primaire types van multicollineairheid om bewust van te zijn:
- Perfecte multicollineairiteit . . . Een voorspeller is een lineaire combinatie van anderen. Dit is zeldzaam in echte gegevens tenzij een functie per ongeluk is gedupliceerd.
- Hoge (imperfect) multicollineairiteit . . Voorspellers zijn sterk, maar niet perfect, gecorreleerd. Dit is veel vaker voorgekomen en is de focus van de meeste mitigatiestrategieën.
Waarom Multicollineairheid nog steeds belangrijk is in beslissingsbomen
Beslissingsbomen zijn niet parametrisch en worden vaak als immuun voor multicollineairheid beschreven. Hoewel bomen niet dezelfde onafhankelijkheidshypothesen vereisen als lineaire modellen, brengen de kenmerken van de bomen praktische problemen met zich mee:
- Split selectie bias
- Overbouw .. redundante functies bieden meerdere mogelijkheden voor de boom om zich te splitsen op in wezen dezelfde informatie, toenemende diepte en complexiteit zonder verbetering van generalisatie.
- Misleidende functie belang .. belang scores zijn verdeeld onder gecorreleerde voorspellers, het verdunnen van de schijnbare bijdrage van elk en het moeilijker maken om te identificeren welke variabelen echt rijden voorspellingen.
- Verbeterde interpreteerbaarheid . . . een boom die zich op beide en (die bijna identiek zijn) splijt is verwarrender en moeilijker te snoeien dan een boom die is gebouwd met schonere, onafhankelijke kenmerken.
For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.
Multicollineairheid in uw gegevens detecteren
Voordat u beslist hoe u multicollineairheid kunt repareren, moet u eerst identificeren. Twee van de meest voorkomende detectietools zijn de correlatiematrix en de Variance Inflatie Factor (VIF).
Gebruik van een concordantietabel
De eenvoudigste benadering is het berekenen van de correlatiecoëfficiënten van Pearson met het paar tussen alle numerieke kenmerken. Een warmtekaart van de correlatiematrix onthult snel clusters van sterk gecorreleerde variabelen. Een gemeenschappelijke vuistregel is om paren te markeren met ] voor verder onderzoek, hoewel de drempel kan worden aangepast op basis van domeinkennis.
Inflatiefactor voor de variatie
De VIF meet hoeveel de variantie van een regressiecoëfficiënt wordt opgepompt door multicollineairheid. Voor elke eigenschap wordt VIF berekend door die eigenschap terug te dringen tegen alle anderen en door gebruik te maken van de formule . Een VIF boven 5 of 10 wordt vaak beschouwd als een teken van problematische multicollineairheid, hoewel deze drempels niet absoluut zijn. Veel statistische bibliotheken bieden een VIF-functie buiten de doos; bijvoorbeeld, in Python biedt een snelle manier om elke numerieke voorspeller te evalueren.
Externe bron: De statmodellen VIF documentatie geeft implementatie details en voorbeelden.
Strategieën om multicollineairheid in beslissingsbomen te behandelen
Zodra u multicollineaire functies geïdentificeerd, de volgende stap is om te beslissen hoe om te gaan met hen. De volgende strategieën zijn vooral effectief voor beslissingsboom modellen.
1. Functieselectie
De functieselectie is vaak de eenvoudigste en meest interpreteerbare oplossing. Het doel is om slechts een deelset van voorspellers te behouden die ten hoogste zwak met elkaar zijn gecorreleerd, terwijl het voorspellende signaal nog steeds behouden blijft.
- Correlation drempel . . . Bereken de correlatiematrix en verwijder een functie van elk gecorreleerd paar boven een gekozen drempel (bijv. ). Welke functie u neerzet moet worden geleid door domeinexpertise, functiekosten of gemak van meting.
- VIF-gebaseerde selectie . . . iteratief VIF berekenen voor alle functies, laat de VIF met de hoogste VIF boven een cutoff vallen en herhaal totdat alle resterende functies acceptabele VIF-waarden hebben.
- Wrapper methoden . . . gebruik voorwaartse selectie, achteruit eliminatie, of recursieve functie eliminatie (RFE) specifiek afgestemd op het beslissingsboom algoritme. Hoewel computervergroting duurder, deze methoden direct optimaliseren voor boomprestaties.
Functieselectie heeft het extra voordeel dat de kosten voor gegevensverzameling en opslag in productiesystemen worden verlaagd, en het houdt de boom eenvoudig en eenvoudig uit te leggen.
2. Dimensionaliteitsreductie met PCA
Wanneer vallen functies ongewenst is omdat elke variabele heeft unieke domein betekenis, belangrijkste component analyse (PCA) biedt een alternatief: het transformeert de oorspronkelijke gecorreleerde voorspellers in een kleinere set van niet-correlerende componenten die de meeste van de variantie in de gegevens vastleggen. Deze componenten kunnen dan worden ingevoerd in de beslissing boom.
- Voordelen .. PCA elimineert multicollineairheid volledig, vermindert lawaai, en kan de generalisatie verbeteren wanneer het aantal functies groot is ten opzichte van het aantal monsters.
- Trade-offs .De grootste nadeel is verlies van interpreteerbaarheid. Een component is een gewogen lineaire combinatie van originele kenmerken; het kan moeilijk zijn om uit te leggen wat een splitsing op betekent in zakelijke termen. Daarnaast is PCA niet gecontroleerd en kan informatie die niet door variatie wordt opgevangen, maar belangrijk is voor de doelvariabele weg te gooien.
Ondanks deze afwegingen is PCA een krachtig instrument om gegevens voor beslissingsbomen te bereiden, vooral wanneer deze gecombineerd worden met ensemblemethoden.
3. Regularisatie in boom-gebaseerde modellen
Hoewel regularisatie het vaakst wordt geassocieerd met lineaire modellen (L1/L2 sancties), beslissing bomen hebben hun eigen vormen van regularisatie die de overfitting aangemoedigd door multicollineaire kenmerken kunnen verminderen:
- Minimale monsters per split . . De toenemende dwingt de boom om meer gegevens te vragen voordat ze een split maken, waardoor de kans op splitsing op een overbodige functie puur toeval vermindert.
- Maximale diepte . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
- Minimale onzuiverheidsdaling . . instelling zorgt ervoor dat alleen splits worden gemaakt die onzuiverheid zinvol verminderen, waardoor splits worden uitgefilterd die worden aangedreven door multicollineairheidslawaai.
- Costcomplexiteitssnoei (CCP) .Na het afdrukken met kan de boom na de groei worden teruggeknipt, waardoor takken die afhankelijk zijn van overbodige splits worden verwijderd.
Het toepassen van sterke regularisatie kan helpen een beslissing boom negeren ongewenste correlaties, maar het is niet een zilveren bullet ..het niet de onderliggende kwestie van overbodige functies.
Externe bron: De scikit-leer documentatie over kosten-complexiteit snoeien geeft een duidelijk voorbeeld van hoe boom regularisatie toe te passen.
4. Samenspelmethoden: Willekeurige bossen en kleurverloop verhogen
Ensemble methoden zijn misschien wel de meest robuuste manier om multicollineairheid in boom-gebaseerde modellen te hanteren. Door het combineren van veel bomen, ensembles gemiddelde uit de instabiliteit veroorzaakt door gecorreleerde functies en produceren meer stabiele voorspellingen.
- Random Forests .. Elke boom wordt getraind op een bootstrap-monster van de gegevens en neemt slechts een willekeurige deelset van functies bij elke splitsing in overweging. Deze functie maakt de dominantie van elke enkele gecorreleerde voorspeller kapot, waardoor het bos alternatieve splits moet verkennen. De uiteindelijke voorspelling is een gemiddelde over vele bomen, die glad over de willekeurige functiekeuze.
- Gradient Boosting Machines (GBM's) .Herstel van bouwt bomen sequentiële, elk corrigeren van de fouten van zijn voorganger. Correlated functies kunnen nog steeds worden geselecteerd over bomen, maar de iteratieve verfijning vermindert de impact van multicollineairheid op de totale prestaties. Moderne implementaties zoals XGBoost en LightGBM omvatten ingebouwde regularisatie parameters (bijv. , ) die de kwestie verder beperken.
Ensemble methoden elimineren multicollineairheid niet, maar maken het veel minder schadelijk. Voor veel beoefenaars, het gebruik van een Random Forest of GBM is de eenvoudigste manier om het probleem te negeren zonder expliciete voorbewerking.
Praktische uitvoering: een stapsgewijze gids
Laten we door een representatieve workflow lopen voor het omgaan met multicollineairiteit in een besluitboom project. We zullen een hypothetische behuizing dataset met functies zoals vierkante beelden, aantal slaapkamers, aantal badkamers, groot aantal en jaar gebouwde veel van die natuurlijk zijn gecorreleerd.
Stap 1: Detecteer multicollineairheid
Bereken eerst de correlatiematrix en VIF voor alle numerieke kenmerken. In ons voorbeeld kunnen vierkante voetafbeeldingen en het aantal slaapkamers een correlatie hebben van 0,82, en VIF-waarden voor beide kunnen hoger zijn dan 6. Dit bevestigt problematische multicollineairheid.
Stap 2: Kies een mitigatiestrategie
Omdat interpreteerbaarheid belangrijk is voor een vastgoedmodel, kiezen we voor feature selectie in plaats van PCA. We besluiten om vierkante beelden (die meer korrelig en vaak voorspellender is) en het aantal slaapkamers te laten vallen. We controleren ook op andere gecorreleerde paren en verwijderen de lotgrootte als het VIF boven 10 na de eerste druppel toont. De laatste feature set behoudt alleen onafhankelijke of zwak gecorreleerde voorspellers.
Stap 3: Train de Beslissingsboom
Met de gereduceerde functieset trainen we een beslissingsboom met een redelijke (bijv., 6) en ] (bijv. 20) om overpassen te voorkomen. De resulterende boom is eenvoudiger, met minder knooppunten, en de functie belangscores zijn nu geconcentreerd op echt verschillende variabelen.
Stap 4: Valideren en vergelijken
We vergelijken de boom die op de volledige dataset is getraind met de boom die op de geselecteerde functies is getraind. Hoewel de volledige boom misschien iets minder trainingsfout kan opleveren, moet de geselecteerde boom een betere kruisvalidatiescore tonen en minder variatie tussen plooien. Dit is het kenmerk van verbeterde generalisatie.
Voor een extra laag robuustheid trainen we ook een Willekeurig Bos op de originele dataset. De prestaties van het bos moeten nauw overeenkomen met of overtreffen die van de gesnoeide beslissingsboom, wat bevestigt dat ensemble methoden een haalbaar alternatief zijn wanneer functieselectie niet wenselijk is.
Vaak Pitfalls en hoe ze te vermijden
Zelfs met de beste bedoelingen, fouten kunnen optreden bij het omgaan met multicollineairheid in beslissing bomen. Hier zijn de meest voorkomende valkuilen:
- Over-eager functie verwijdering . . . een variabele laten vallen alleen omdat het is gecorreleerd met een ander kan waardevolle signaal te verspillen. Altijd rekening houden met de voorspellende bijdrage van elke functie en gebruik domeinkennis om verwijdering te begeleiden.
- Ontgaande interactie effecten
- PCA toepassen zonder schalen . . PCA is gevoelig voor de schaal van functies. Altijd standaardiseren numerieke voorspellers naar nul gemiddelde en eenheid variantie voordat PCA.
- Als VIF-drempels universeel zijn .Een VIF van 10 is een gemeenschappelijke cutoff, maar in kleine datasets of domeinen met sterke natuurlijke correlaties, kunnen zelfs lagere drempels passend zijn. Bestudeer de context in plaats van blind regels toe te passen.
- Vergeet na te gaan na functietechniek . . . multicollineairheid kan worden geïntroduceerd bij het creëren van polynomiale functies, ratio's of interactietermen. Herevalueer correlaties na elke functie-engineeringstap.
Conclusie
Multicollineairiteit mag een beslissing boom model niet breken op dezelfde manier het breekt een lineaire regressie, maar het ondermijnt nog steeds stabiliteit, interpreteerbaarheid en generalisatie. Door het detecteren van gecorreleerde functies vroeg, toepassing van attente functie selectie of dimensionaliteit vermindering, en aanvulling van bomen met ensemble methoden zoals Random Forests, kunt u modellen bouwen die zowel nauwkeurig als veerkrachtig zijn. De sleutel is om multicollineairheid niet als een onvermijdelijke overlast, maar als een signaal dat uw gegevens kunnen worden vereenvoudigd en uw model verbeterd.
Externe bron: Voor een diepere duik in VIF en de toepassing ervan op de selectie van functies, zie het Wikipedia artikel over Variance Inflatie Factor. Voor een praktische tutorial over het bouwen van beslissing bomen met scikit-learn, verwijzen naar de officiële scikit-learn beslissing bomen documentatie .