civil-and-structural-engineering
L'influenza della scala dei dati sulle prestazioni dell'albero della decisione
Table of Contents
Gli alberi di decisione sono un algoritmo di apprendimento automatico fondamentale che rimane ampiamente utilizzato sia per le attività di classificazione e regressione. La loro popolarità deriva da una struttura intuitiva e basata su regole che rispecchia i processi decisionali umani, rendendoli uno dei modelli più interpretabili in un toolkit di data science.
Quali sono gli alberi delle decisioni?
Un albero di decisione divide in modo ricorsivo lo spazio delle caratteristiche in regioni, ciascuna ha assegnato una previsione — per la regressione, il valore medio di destinazione in quella regione, e per la classificazione, la classe di maggioranza. Il processo di divisione seleziona caratteristiche e soglie che minimizzano una misura di impurità, come l'impurità di Gini o l'entropia per la classificazione, o l'errore quadrato per la regressione.
Una caratteristica fondamentale è che gli alberi di decisione non si basano su metriche di distanza o distanze geometriche tra i punti di dati. Invece, essi utilizzano confronti basati su soglia: per una data caratteristica X]j], l'albero chiede se ]X
Tecniche di scalazione dei dati comuni
La scalatura dei dati, o la scalabilità delle caratteristiche, trasforma i valori delle caratteristiche numeriche in una gamma o distribuzione comune.
- [LT][LT]][[[FLT]]]] – anche conosciuto come normalizzazione, ridimensiona le caratteristiche ad un intervallo fisso, tipicamente [0, 1]. Ogni valore viene trasformato sottraendo il minimo e dividendo dalla gamma: X' = (X − Xmin[]]]]] / (X[FLT][
- Standardization (Z-score Normalization) — trasforma le caratteristiche per avere un mezzo di zero e una deviazione standard di uno: X' = (X − μ) / σ]. A differenza di scalare min-max, la standardizzazione non lega i valori a una gamma specifica, rendendo più robusta a outlier.
- Robust Scaling[[] — utilizza la gamma mediana e interquartile (IQR) invece di deviazione media e standard, fornendo resilienza contro gli outlier estremi che possono falsare i parametri di scaling.
Mentre queste tecniche sono critiche per algoritmi come le macchine vettoriali di supporto (SVMs) e i vicini di k-nearest (k-NN), che calcolano le distanze tra i campioni, il loro ruolo nelle prestazioni degli alberi di decisione è più sfumato.
Insensibilità teorica alla Scala
Per esempio, le misure di separazione dei punti di scala non sono state modificate, ma la loro struttura è stata completamente separata.
Questo ragionamento teorico sostiene che l'algoritmo di scissione utilizza confronti esatti e che la precisione del punto fluttuante non introduce artefatti. In pratica, le implementazioni moderne - come la scikit-learn e - sono deterministiche e producono alberi identici indipendentemente dal riscaling lineare, a condizione che la riscaling non causa problemi numerici.
Dove Scala può influenzare le prestazioni
Nonostante l'insensibilità teorica, diversi scenari pratici rivelano che la scalatura può influenzare i risultati degli alberi delle decisioni, in particolare quando lo spazio delle caratteristiche è altamente dimensionale, i dati sono sbilanciati, o quando gli alberi sono utilizzati come componenti in sistemi più complessi.
Dati altamente dimensionali
Le caratteristiche con più ampie gamme numeriche possono inavvertitamente dominare il processo di selezione di scissioni, perché le loro soglie di divisione abbracciano un continuum più ampio, potenzialmente portando a una migliore riduzione dell'impurità puramente casuale.
Inoltre, negli spazi ad alta dimensione, l'albero è incline a sovraccaricarsi perché può sfruttare molte soglie. La scala non impedisce direttamente la sovraccaricatura, ma rimuovendo il vantaggio basato sulla gamma di determinate caratteristiche, può portare a spaccature più stabili e generalizzabili quando combinato con tecniche di potatura o regolarizzazione.
Gamma di funzionalità imbalanced
Quando le caratteristiche hanno unità o magnitudine molto diverse, l'albero può assegnare maggiore importanza alle caratteristiche con intervalli più grandi, anche se queste caratteristiche non sono in realtà più discriminanti. Ciò è particolarmente problematico nei set di dati che combinano misurazioni fisiche (ad esempio, la temperatura in Kelvin vs. pressione in caso di calcoli) o dati finanziari (ad esempio, i candidati in milioni e il tasso di crescita in decimali).
Applicando scaling min-max a [0,1] equalizza la gamma numerica ma non cambia il numero di valori unici per caratteristica. Tuttavia, cambia la granularità delle scissioni - dopo la scala, i midpoint di soglia per entrambe le caratteristiche diventano più paragonabili in termini di proporzione della gamma coperta. In pratica, la standardizzazione può anche aiutare con il centraggio dei dati, che possono migliorare il comportamento delle implementazioni interne dell'albero euristica.
Metodi di Ensemble
Gli alberi di decisione spesso ottengono le loro migliori prestazioni quando sono aggregati in gruppi come le foreste casuali, gli alberi potenziati di grado, o XGBost. Mentre gli alberi individuali sono invarianti di scala, la formazione di ensemble può introdurre dipendenze sulla scalatura attraverso meccanismi come il sottocampo di interagiscono, il campionamento di colonne o la gestione dei valori mancanti.
I metodi di miglioramento graduale (ad esempio, XGBost, LightGBM, CatBoost) incorporano ulteriori termini di regolarizzazione e tassi di apprendimento che possono essere sensibili alla scala delle previsioni e dei residui. Sebbene l'albero si scindesse rimane invariante, gli aggiornamenti di gradiente durante la formazione dipendono dalla grandezza degli errori.
Importanza della caratteristica e l'interpretabilità
Una metrica di importanza ampiamente utilizzata è l'importanza di Gini (o diminuzione media dell'impurità), che riassume le riduzioni di impurità ponderate attribuibili a ciascuna caratteristica. Poiché le caratteristiche di più grande gamma possono essere selezionate più spesso, possono gonfiare artificialmente i loro punteggi di importanza.
Pruning e regolarizzazione
Gli alberi di decisione possono essere potuti essere potuti da potatura di complessità dei costi (ccp alpha in scikit-learn), che commercia la profondità dell'albero contro la disgregazione. Il processo di potatura utilizza la misura di impurità di sottotree; la scalatura non altera queste misure direttamente, ma può influenzare quali sottoti sono formati quando le caratteristiche hanno intervalli diversi.
Raccomandazioni pratiche ed esempi
Sulla base dei modelli discussi, ecco le linee guida per gli scienziati di dati e i professionisti dell'apprendimento automatico che utilizzano alberi di decisione:
- Inizi senza scaglie per caratteristiche omogenee e di dimensioni ridotte. Se hai meno di 10 caratteristiche, tutte su scale simili (ad esempio, risposte di indagine da 1 a 5), la scalatura non è necessaria. L'albero si esibisce ugualmente bene e saltandolo salva la preelaborazione in testa.
- L'esperienza con la scalatura in dataset ad alta dimensione. Per i dataset con decine o centinaia di caratteristiche, soprattutto quando si mescolano unità come età, stipendio, distanza e conteggi, applicare scaling min-max o standardizzazione e confrontare i punteggi di cross-validazione. Un significativo miglioramento (≥1–2% in accuratezza o un errore inferiore) indica che la scalatura ha aiutato il processo di ricerca.
- Sempre scala quando si utilizzano metodi di ensemble con molte caratteristiche. Sebbene la foresta casuale sia robusta, la scalatura può stabilizzare la diversità degli alberi e rende l'ottimizzazione dell'iperparametro meno sensibile ai range di funzionalità.
- Combinare la scalatura con selezione delle caratteristiche o riduzione della dimensionalità. La scalazione prima di applicare PCA o algoritmi di selezione delle caratteristiche (ad esempio, sulla base delle soglie di variazione) assicura che le caratteristiche siano paragonabili. Le caratteristiche trasformate possono quindi essere alimentate a gruppi di alberi di decisione senza preoccuparsi per i manufatti di gamma.
- Utilizzare robuste scaling quando sono presenti gli outlier. La standardizzazione è sensibile agli outlier; la robusta scaling (utilizzando median e IQR) impedisce a pochi punti estremi di comprimere il resto della gamma. Questo è particolarmente rilevante per gli alberi di decisione perché gli outlier possono creare nodi foglia isolati che danneggiano la generalizzazione.
- Scelte di scaling del documento per la riproducibilità. Se si scala o no, registrare il pipeline di preprocessing. Se viene applicato il ridimensionamento, assicurarsi che gli stessi parametri (min, max, media, std) siano utilizzati al tempo di inferenza.
Come esempio, consideri un dataset di rischio di credito con caratteristiche: età (20–70), reddito ($15k–$2M), numero di dipendenti (0–5), e rapporto debito-a reddito (0.0–1,5). Senza scaling, la caratteristica di reddito domina i candidati splitmax perché ha una vasta gamma (2 milioni vs 50 per età).
Conclusioni
Gli alberi di decisione sono teoricamente insensibili alla scala lineare delle caratteristiche perché la loro logica divisa poggia su confronti di valori, non distanze. Tuttavia, questa invarianza teorica non si estende senza soluzione di continuità a tutte le applicazioni del mondo reale. In spazi ad alta dimensione, quando le caratteristiche hanno vaste distanze diverse, o quando gli alberi sono combinati in ensemble, la scala può migliorare le prestazioni del modello eliminando le biasi nella ricerca divisa, promuovendo meglio la classifica delle caratteristiche generali e migliorando
Per ulteriori informazioni, fare riferimento alla documentazione ufficiale ]Scikit-learn sugli alberi delle decisioni[] e la sezione di elaborazione[[] per le tecniche di scaling.