Table of Contents
Gli alberi decisionali sono un punto di forza dei flussi di lavoro di machine learning, premiati per la loro struttura intuitiva e per la loro interpretazione semplice. Essi alimentano tutto, dalle valutazioni dei rischi di credito alla diagnosi medica, spesso servendo come algoritmo di go-to per gli scienziati di dati che devono spiegare le previsioni a stakeholder non tecnici.
In questo articolo, esploreremo ciò che è multicollinearity, perché conta specificamente per gli alberi da decisione, e una serie di strategie attuabili per mitigare il suo impatto. Se sei uno scienziato di dati che insegna un corso o un professionista che rifinanzia un modello di produzione, queste tecniche vi aiuteranno a costruire alberi decisioni più pulite e più generalizzabili.
Cos'è la Multicollinearità?
La multicollinearità si riferisce ad una situazione in cui due o più variabili predittrici in un problema di regressione o di classificazione sono linearmente correlate a un alto grado. Quando la correlazione tra variabili è forte, i dati sottostanti contengono informazioni sovrapposte che possono confondere molti modelli di apprendimento statistico e macchina. Nei modelli lineari, la multicollinearità infiamma gli errori standard e rende le stime di coefficiente instabili.
Ci sono due tipi primari di multicollinearity per essere consapevoli di:
- Perfect multicollinearity[[] — un predittore è una combinazione lineare di altri. Questo è raro in dati reali a meno che una funzione non sia stata inavvertitamente duplicata.
- Alta (imperfetto) multicollinearità[[] – i predittori sono fortemente, ma non perfettamente correlati.
Perché Multicollinearity ancora Matters in alberi decisione
Gli alberi di decisione non sono parametrici e spesso sono descritti come immuni alla multicollinearità, mentre è vero che gli alberi non richiedono le stesse ipotesi di indipendenza dei modelli lineari, le caratteristiche correlate presentano ancora problemi pratici:
- Split selezione bias[[] – quando sono disponibili due caratteristiche altamente correlate, l'albero può scegliere arbitrariamente uno per la prima divisione, ignorando l'altro. Questo rende gli alberi individuali instabile; piccoli cambiamenti nei dati possono causare l'albero a capofitto che caratteristica sceglie.
- Overfitting[[] — le caratteristiche ridondanti offrono molteplici opportunità per l'albero di dividersi su essenzialmente le stesse informazioni, aumentando la profondità e la complessità senza migliorare la generalizzazione.
- Diminuzione dell'importanza della funzione[[] — i punteggi di importanza sono divisi tra i pronotipi correlati, diluindo il contributo apparente di ciascuno e rendendo più difficile identificare quali variabili stanno realmente guidando le previsioni.
- L'interpretabilità ridotta[] — un albero che si divide su entrambi [ e (che sono quasi identici) è più confuso e più difficile da prugna di uno costruito con caratteristiche più pulite e indipendenti.
For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.
Rilevamento della Multicollinearità nei tuoi dati
Prima di decidere come risolvere la multicollinearità, è necessario identificarla prima. Due degli strumenti di rilevamento più comuni sono la matrice di correlazione e il fattore di inflazione di variazione (VIF).
Utilizzo di una Matrice di Correlazione
L'approccio più semplice è quello di calcolare i coefficienti di correlazione di Pearson tra tutte le caratteristiche numeriche. Una mappa di calore della matrice di correlazione rivela rapidamente cluster di variabili altamente correlate. Una regola comune di pollice è quella di coppie di bandiera con per ulteriori indagini, anche se la soglia può essere regolata in base alla conoscenza del dominio.
Fattore di inflazione di variazione
Il VIF misura quanto la varianza di un coefficiente di regressione è gonfiata a causa della multicollinearità. Per ogni caratteristica, VIF è calcolato regressando quella caratteristica contro tutti gli altri e utilizzando la formula [[]. Un VIF sopra 5 o 10 è spesso considerato un segno di multicollinearità problematica, anche se queste soglie non sono assolute. Molte librerie statistiche offrono una funzione VIF fuori dalla scatola; per esempio rapido
Risorsa esterna:[] statsmodels documentazione VIF] fornisce dettagli e esempi di implementazione.
Strategie per la manipolazione della multicollinearità negli alberi della decisione
Una volta individuate le caratteristiche multicollinearie, il passo successivo è decidere come gestirle.Le seguenti strategie sono particolarmente efficaci per i modelli di albero di decisione.
1. Selezione delle caratteristiche
La selezione delle caratteristiche è spesso la soluzione più semplice e interpretabile. L'obiettivo è quello di mantenere solo un sottoinsieme di predittori che sono al massimo strettamente correlati tra loro, pur mantenendo il segnale predittivo.
- Soglia di correlazione[[] — calcola la matrice di correlazione e rimuove una caratteristica da ogni coppia correlata sopra una soglia scelta (ad esempio ). Quale funzione si scende dovrebbe essere guidata da competenze di dominio, costi di funzionalità o facilità di misurazione.
- Selezione basata su VIF[[] — calcola in modo iterativo VIF per tutte le caratteristiche, lascia cadere quello con il più alto VIF sopra un cutoff, e ripeti fino a quando tutte le funzionalità rimanenti hanno valori VIF accettabili.
- Metodi di scorrimento[[] — utilizzare selezione in avanti, eliminazione arretrata, o eliminazione delle caratteristiche ricorsive (RFE) specificatamente su misura per l'algoritmo di albero di decisione.
La selezione delle caratteristiche ha il vantaggio aggiunto di ridurre i costi di raccolta e archiviazione dei dati nei sistemi di produzione, e mantiene l'albero semplice e facile da spiegare.
2. Riduzione della dimensione con PCA
Quando si eliminano le funzionalità non è desiderabile perché ogni variabile porta un significato di dominio unico, l'analisi dei componenti principali (PCA) offre un'alternativa: trasforma i predittori correlati originali in un insieme più piccolo di componenti non corrotti che catturano la maggior parte della varianza dei dati.
- Avantages[[] — PCA elimina completamente la multicollinearità, riduce il rumore e può migliorare la generalizzazione quando il numero di caratteristiche è grande rispetto al numero di campioni.
- Trade-offs[ – il più grande svantaggio è la perdita di interpretabilità. Un componente è una combinazione lineare ponderata di caratteristiche originali; può essere difficile spiegare che cosa una divisione su significa in termini di business. Inoltre, PCA è non supervisionato e può scartare informazioni che non è catturata da varianza ma è importante per la variabile di destinazione.
Nonostante questi trade-off, PCA è uno strumento potente per la preparazione dei dati per gli alberi decisionali, soprattutto quando combinato con i metodi di ensemble.
3. Regolarizzazione in modelli basati sull'albero
Sebbene la regolarizzazione sia più spesso associata a modelli lineari (L1/L2 sanzioni), gli alberi decisionali hanno le loro forme di regolarizzazione che possono ridurre l'overfitting incoraggiato da caratteristiche multicollinee:
- Campioni di micro per split[] — aumentando [] costringe l'albero a richiedere più dati prima di fare una scissione, riducendo la possibilità di dividersi su una caratteristica ridondante puramente per caso.
- La profondità massima[] — la tappatura impedisce all'albero di crescere abbastanza in profondità da sfruttare le caratteristiche correlate.
- L'impurità minima diminuisce[[] – impostando ] assicura che vengano effettuate solo scissioni che riducono significativamente l'impurità, filtrando le scissioni guidate dal rumore multicollineare.
- La potatura della complessità dei costi (CCP) – dopo la sovrapposizione con [] permette all'albero di essere tagliato dopo la crescita, rimuovendo rami che si basano su spaccature ridondanti.
Applicare una forte regolarizzazione può aiutare un albero di decisione a ignorare le correlazioni spurie, ma non è un proiettile d'argento—non affronta il problema sottostante di caratteristiche ridondanti.
Risorsa esterna:[ La documentazione scikit-learn sulla potatura della complessità dei costi[ fornisce un chiaro esempio di come applicare la regolarizzazione degli alberi.
4. Metodi dell'Ensemble: Foreste casuali e Boosting Gradient
I metodi di Ensemble sono forse il modo più robusto per gestire la multicollinearità nei modelli a base di alberi, combinando molti alberi, gli ensemble mediamente fuori le instabilità causate da caratteristiche correlate e producono previsioni più stabili.
- Random Forests[[] – ogni albero è formato su un campione di bootstrap dei dati e considera solo un sottoinsieme casuale di caratteristiche ad ogni divisione. Questa caratteristica casualità rompe il dominio di qualsiasi singolo predittore correlato, costringendo la foresta a esplorare le divisioni alternative. La previsione finale è una media su molti alberi, che si leviga sopra la scelta arbitraria caratteristica.
- Gradient Boosting Machines (GBMs)] — aumentando sequenziale gli alberi, ognuno corregge gli errori del suo predecessore. Le funzioni correlate possono essere ancora selezionate tra gli alberi, ma la raffinatezza iterativa riduce l'impatto della multicollinearità sulle prestazioni generali.
I metodi dell'insieme non eliminano la multicollinearità, ma lo rendono molto meno dannoso. Per molti praticanti, l'utilizzo di una foresta casuale o di un GBM è il modo più semplice per ignorare il problema senza preprocesso esplicito.
Attuazione pratica: una guida passo passo passo passo passo
Passiamo attraverso un flusso di lavoro rappresentativo per la gestione della multicollinearità in un progetto di albero di decisione. Useremo un ipotetico dataset di alloggiamento con caratteristiche come il filmato quadrato, il numero di camere da letto, il numero di bagni, la dimensione del lotto e l'anno costruito - molti dei quali sono naturalmente correlati.
Passo 1: Rileva la Multicollinearity
In primo luogo, calcolare la matrice di correlazione e VIF per tutte le caratteristiche numeriche. Nel nostro esempio, il filmato quadrato e il numero di camere da letto potrebbe avere una correlazione di 0,82, e i valori VIF per entrambi potrebbero superare 6. Ciò conferma la multicollinearity problematica.
Passo 2: Scegli una strategia di migrazione
Poiché l'interpretazione è importante per un modello immobiliare, optiamo per ] selezione delle caratteristiche[]] piuttosto che PCA. Decidiamo di mantenere il filmato quadrato (che è più granulare e spesso più predittivo) e il numero di goccia.
Passo 3: Allena l'albero della decisione
Con il set di funzionalità ridotto, formiamo un albero di decisione utilizzando un ragionevole [[ (ad esempio, 6) e (ad esempio, 20) per evitare l'overfitting. L'albero risultante è più semplice, con meno nodi, e le partiture di importanza caratteristica sono ora concentrate su variabili autenticamente distinte.
Passo 4: Convalida e Confronta
Confrontiamo l'albero formato sul set di dati completo contro l'albero formato sulle caratteristiche selezionate. Sebbene l'albero completo possa raggiungere un errore di allenamento leggermente inferiore, l'albero di idoneità selezionato dovrebbe dimostrare una migliore valutazione trasversale e una minore variazione tra le pieghe.
Per un ulteriore livello di robustezza, forniamo anche una foresta casuale sul set di dati originale. Le prestazioni della foresta dovrebbero essere strettamente abbinate o superiori a quelle dell'albero di decisione indiscusso, confermando che i metodi di ensemble sono un'alternativa praticabile quando la selezione delle caratteristiche non è auspicabile.
Pitfalls comune e come evitare di loro
Anche con le migliori intenzioni, si possono verificare errori quando si tratta di multicollinearità negli alberi delle decisioni.
- Rimozione delle funzioni di Over‐eager[[] — caduta di una variabile solo perché è correlato con un altro può sprecare segnali preziosi.
- Ignorando gli effetti di interazione[[] — in alcuni casi, due caratteristiche correlate insieme portano informazioni che non portano da soli.
- Applicare PCA senza scaling[[] — PCA è sensibile alla scala delle caratteristiche.
- Le soglie di VIF di emissione sono universali[ — un VIF di 10 è un cutoff comune, ma in piccoli set di dati o domini con forti correlazioni naturali, possono essere appropriate anche soglie più basse.
- Perseguire il controllo dopo l'ingegneria delle caratteristiche[[]] – la multicollinearità può essere introdotta quando si creano caratteristiche polinomiali, rapporti o termini di interazione.
Conclusioni
La multicollinea non può rompere un modello di albero di decisione allo stesso modo rompe una regressione lineare, ma mina ancora stabilità, interpretazione e generalizzazione. Rilevando caratteristiche correlate presto, applicando la selezione di caratteristiche riflessive o riduzione di dimensionalità, e completando gli alberi con metodi di ensemble come le foreste casuali, è possibile costruire modelli che sono sia accurati e resilienti.
Risorsa esterna:[] Per un'immersione più profonda in VIF e la sua applicazione per la selezione delle caratteristiche, vedere l'articolo Wikipedia su Variance Inflation Factor. Per un tutorial pratico su alberi decisione costruzione con sci-learn, fare riferimento alla documentazione ufficiale scikit-learn