robotics-and-intelligent-systems
Gestione dei dati mancanti nella decisione Algoritmi albero
Table of Contents
Introduzione
Gli algoritmi degli alberi delle decisioni rimangono un punto di riferimento per l'apprendimento delle macchine sia per le attività di classificazione che di regressione dovute alla loro struttura intuitiva, all'interpretazione e alla capacità di modellare relazioni non lineari. Tuttavia, i dataset reali sono raramente incontabili; spesso contengono valori mancanti causati da errori dei sensori, errori umani, problemi di integrazione dei dati, o di risanamento basato sulla privacy.
Capire i dati mancanti
I dati mancanti non sono un problema uniforme: la strategia di gestione appropriata dipende dal meccanismo che ha generato la mancanza. Gli statisti hanno classificato i dati mancanti in tre tipi distinti, ciascuno con implicazioni diverse per l'analisi.
Mancato completamente a Random (MCAR)
Sotto MCAR, la probabilità che manca un valore è completamente indipendente dai dati osservati e non osservati. Ad esempio, uno strumento di laboratorio non riesce a intervalli casuali non correlati al campione sotto test, o un intervistato di indagine accidentalmente salta una domanda. MCAR è il tipo più semplice da gestire analiticamente perché i dati osservati rimangono un campione casuale rappresentativo del set di dati completo. Tuttavia, il vero MCAR è raro nella pratica; la maggior parte delle carenze reali mostra alcuni.
Manca a Random (MAR)
MAR si verifica quando la mancanza dipende solo da variabili osservate e non dai valori mancanti stessi. Ad esempio, in un dataset di rischio, il reddito potrebbe essere più probabile mancante per i giovani (età osservata) ma, data l'età, il reddito mancante non dipende dal livello di reddito reale. Molti metodi di imputazione standard assumono MAR, e tecniche come l'imputazione multipla o la stima massima probabilità rimangono valide sotto questo presupposto.
Mancando Non a Random (MNAR)
In MNAR, la probabilità di mancare è legata al valore non osservato. Un esempio classico è nelle indagini salariali: gli individui ad alto reddito possono rifiutare di rivelare i loro guadagni, il che significa che la mancanza è direttamente correlata al valore mancante (income). MNAR è lo scenario più impegnativo perché i valori mancanti non possono essere stimati in modo affidabile senza informazioni esterne o tecniche di modellazione speciali (ad esempio, modelli di selezione o modelli di bi-mixing).
Identificare i modelli di dati mancanti
Prima di scegliere un metodo di trattamento, i professionisti dovrebbero esplorare il modello di scomparsa nel loro set di dati.
- Mappa di calore di mancanza[] – visualizza la percentuale di valori mancanti per caratteristica e per campione.
- Il test MCAR di Little[] – un test statistico formale che indica se MCAR è plausibile.
- Statistiche di mancanza del gruppo[[]] – calcolate il mezzo delle caratteristiche osservate condizionali sul fatto che mancasse un'altra funzione; le grandi differenze suggeriscono MAR o MNAR.
La comprensione del meccanismo pone le basi per la scelta di una strategia di imputazione o modellazione appropriata.
Conseguenze di ignorare i dati mancanti
Molti approcci ingenui – come la cancellazione del senso di lista (semplicemente rimuovere le righe con qualsiasi valore mancante) o la cancellazione di coppia – sono ancora utilizzati in pratica, ma sono dotati di costi sostanziali:
- Dimensioni del campione ridotte[[] – la cancellazione del senso dell'elenco può scartare una grande frazione dei dati, soprattutto con molte caratteristiche, che portano ad alta varianza e bassa potenza statistica.
- Valutazioni dei parametri Biased[] – se la mancanza non è MCAR, il campione mantenuto non è più rappresentativo, questo bias si propaga direttamente nelle divisioni degli alberi delle decisioni, causando soglie errate e la purezza dei nodi sub-ottimi.
- Loss of information[[] – caratteristiche con valori mancanti possono essere escluse dalla logica di divisione, sprecando segnale predittivo che potrebbe essere stato utilizzato tramite dividezioni surrogate o imputazione.
- La manipolazione costante tra gli alberi[[[] – metodi di ensemble come foreste casuali possono trattare i valori mancanti in modo diverso in ogni albero di base, fornendo previsioni instabili.
Un trattamento dati mancante ben progettato migliora sia l'accuratezza che l'affidabilità, soprattutto nelle applicazioni ad alto consumo come la diagnosi medica, la valutazione dei rischi finanziari e la manutenzione predittiva.
Metodi di Imputazione Tradizionali
L'imputazione – il riempimento dei valori mancanti con valori stimati – è l'approccio più utilizzato. La scelta del metodo di imputazione dipende dal tipo di dati, dal meccanismo di mancanza e dal bilancio computazionale.
Imputazione semplice di univariato
Le tecniche più semplici sostituiscono un valore mancante con il mezzo, mediano o modalità dei valori osservati per tale caratteristica. Mentre veloci, questi metodi ignorano le correlazioni tra le caratteristiche e tendono a ridurre la varianza, gonfiando artificialmente la fiducia del modello. L'imputazione mediana è appropriata solo sotto MCAR e per caratteristiche con distribuzioni approssimativamente simmetriche; l'imputazione mediana è più robusta agli outlier.
Imputazione della regressione
Un regressione lineare si adatta alle voci osservate e quindi utilizzata per predire quelle mancanti. Questo preserva le relazioni tra variabili ma assume linearità e può portare a un over-fitting se gli stessi dati vengono utilizzati sia per l'imputazione che per la formazione dei modelli.
k‐Nearest Quartiere (KNN) Imputazione
L'imputazione KNN trova i campioni completi più simili (a distanza dalle caratteristiche osservate) e le medie (o prende una maggioranza di voti) per i loro valori. Cattura naturalmente dipendenze non lineari e funziona bene con tipi di dati misti. I principali svantaggi sono il costo computazionale per grandi set di dati e la sensibilità alla scelta di k e metrica distanza. KNN assume il meccanismo di scomparsa è MCAR o MAR e che la funzione metrica di distanza è significativa.
Imputazione multipla
L’imputazione multipla (ad esempio, utilizzando l’algoritmo MCMC o MICE) genera diversi set di dati completi impedendo i valori di un modello statistico che incorpora l’incertezza. L’analista quindi si adatta a ciascun dataset imputed e alle pools dei risultati (ad esempio, con probabilità prevedibili o utilizzando le regole di Rubin).
Limitazioni di semplice imputazione
Non è un metodo di imputazione che può falsare la distribuzione congiunta delle caratteristiche, rendendo più difficile per gli alberi decisionali trovare scissioni pulite. Inoltre, l’imputazione è un passo di preelaborazione separato dall’induzione dell’albero; l’algoritmo dell’albero non “sape” che un valore è stato imputto. Questo può portare a stime di performance eccessivamente ottimistiche se l’imputazione non è validata correttamente all’interno di un ciclo di estradivalidazione incrociata.
Surrogate Spacco in alberi decisione
Piuttosto che pretrattare i dati, alcuni algoritmi degli alberi di decisione – in particolare quelli originali CART (Classificazione e Regression Trees) – gestiscono valori mancanti in nativo utilizzando surrogate splits. Questa tecnica è elegante perché sfrutta la struttura dell'albero stesso per trattare le lacune senza modificare i dati grezzi.
Come la Surrogata Spada il Lavoro
Quando si costruisce un albero, l'algoritmo seleziona la migliore divisione in un nodo basato su tutti i valori non-missivi della funzione primaria (ad esempio, "income > $50,000"). Quindi cerca una o più caratteristiche surrogate che meglio si mescolano. Una divisione surrogato è definita da una funzione diversa (ad esempio, "livello di istruzione = diploma") che, quando viene utilizzata sul subset di dati primario
Vantaggi e svantaggi
Le suddivisioni di Surrogate hanno il vantaggio principale di non richiedere alcuna imputazione: l’albero impara da tutti i dati disponibili senza produrre valori. Inoltre, conservano le relazioni condizionali imparate durante la costruzione di alberi. Tuttavia, la tecnica richiede che alcune caratteristiche correlate esistano per servire come surrogate; se la funzione mancante non ha correlazioni forti, le scissioni di surrogato diventano deboli e l’albero potrebbe ancora perdere l’accuratezza per le voci mancanti.
Approcci basati su modelli e algoritmi moderni
Negli ultimi anni si è assistito all'aumento dei quadri di gradiente-boosting che incorporano il trattamento di valore mancante direttamente nell'algoritmo di apprendimento, spesso superando sia le divisioni di imputazione che di surrogato nelle prestazioni predittive.
XGBoooo
XGBost[] (Extreme Gradient Boosting) impara a gestire i valori mancanti durante la formazione trattando la mancanza come un segnale rado. Ad ogni divisione, l'algoritmo valuta sia una direzione predefinita per i dati mancanti (bano sinistro o destro) e il valore di divisione ottimale sulle voci osservate.
Luce GBM
LightGBM[]] prende un percorso diverso: tratta valori zero e mancanti come un singolo gruppo (per impostazione predefinita) e ottimizza la direzione di divisione per quel gruppo. Durante l'allenamento, impara se i campioni mancanti appartengono al bambino sinistro o destro di una divisione.
CatBoost
CatBoost[ (Categorical Boosting) utilizza un meccanismo leggermente diverso: tratta i valori mancanti come categoria separata e lascia decidere quando dividersi in quella categoria. Per le caratteristiche numeriche, i valori mancanti vengono inizialmente assegnati a un segnaposto (ad esempio, −1) e l'albero trova una divisione ottimale basata su tale trattamento.
Implementare la gestione dei dati mancanti nella pratica
La scelta di una strategia dipende dal modello di strumenti, dimensioni dei dati e mancanze.
- Valuta la mancanza[[]] – calcola la percentuale dei valori mancanti per funzione e per campione. Se una caratteristica mancante >90%, considera di lasciarla a meno che la conoscenza del dominio non sia forte.
- Identificare il meccanismo[[] – applicare il test MCAR di Little se il campione è abbastanza grande. Se MCAR è plausibile, la cancellazione listwise può essere accettabile per la piccola mancanza (<5%). Per MAR o MCAR con moderata mancanza, l'imputazione o la gestione basata sul modello è più sicura.
- ]Seleziona un metodo basato sul tuo framework[:
- ] Se si utilizzano alberi a decisione sklearn (senza supporto mancante incorporato), utilizzare un imputer (ad esempio, o ])]) all'interno di una strategia di transizione dall'imputazione dell'imputazione dell'imputazione.
- Se si utilizza XGBoost/LightGBM/CatBoost, non è necessario alcun imputazione – semplicemente passare i dati con i valori [; i quadri li gestiranno.
- Se si utilizza R , abilitare il parametro [ per attivare le scissioni surrogate.
- Iperparametri in toto che influiscono sulla gestione mancante[] – per XGBost, [ e possono influenzare le scelte di ramo mancanti-valore. Per CatBoost, controlla come vengono trattati i valori numerici mancanti (come classe o imputed).
- Validare correttamente[[] – includere sempre la gestione dei dati mancanti all'interno di un loop di valutazione trasversale (ad esempio, l'imputazione prima della divisione treno/test per evitare perdite di dati).
Migliori Pratiche e Pitfalls Comuni
- Non imputare la variabile di destinazione[[[[]] – impedendo l'obiettivo in un contesto supervisionato si contrappone al segnale di apprendimento.
- Usa conoscenza del dominio[[] – in molti campi, la mancanza stessa ha un significato. Ad esempio, un test di laboratorio mancante potrebbe indicare che il medico non ha sospettato una condizione, fornendo informazioni utili. Alcune implementazioni albero consentono di creare una funzione di indicatore mancante esplicitamente per lasciare che l'albero si scinde sulla mancanza come variabile binaria.
- Consapevole dei dati radi ad alta dimensione[[] – se la maggior parte delle caratteristiche hanno frequenti voci mancanti, l'imputazione può diventare altamente incerta. In tali casi, utilizzare metodi a base di albero con gestione integrata (XGBost o LightGBM) che trattano mancanti come direzione separata.
- Insieme dei modelli di imputazione[[[]] – per applicazioni critiche, considerare l'utilizzo di più alberi di imputazione e la mediazione di alberi di decisione attraverso i dataset imputed (cioè, l'imputazione multipla + ensemble).
- Le prestazioni di distribuzione del motorino[[[] – il modello di scomparsa può passare nel tempo (concept drift).
Conclusioni
Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainlibrerie. Moderni framework di gradient-boosting – XGBost, LightGBM e CatBoost – hanno stabilito un nuovo standard imparando le direzioni ottimali di valore mancante end-to-end, spesso fornendo una precisione predittiva superiore senza alcun preprocessing.
]Altri dati di lettura: ]] Dati di errore – Wikipedia[] copre la teoria statistica; [ La documentazione di imputazione di fanciulle] fornisce dettagli di implementazione; e il XGBoost valore mancante offre un esempio di gestione nativo[7][7][FLT:[7][