Table of Contents
La valutazione più intuitiva e ampiamente utilizzata degli algoritmi di apprendimento automatico, che sono stati premiati per la loro trasparenza e facilità d'interpretazione. Se applicata alle attività di classificazione o regressione, questi modelli distinguono le decisioni in una serie di semplici regole di esplorazione che rispecchiano il ragionamento umano.
Che cosa è la Valutazione Cross?
La valutazione incrociata è una procedura di risampamento utilizzata per valutare la capacità di un modello di machine learning di generalizzare ad un dataset indipendente. Invece di fare affidamento su un singolo test di formazione, cross-validation divide il dataset in diversi sottoset complementari, chiamati pieghe. Il modello è formato su una combinazione di tutti ma una piega, e poi testato sulla piega rimanente.
La più semplice variante, la validazione di detentori, mette da parte una parte fissa dei dati per la prova. Tuttavia, Holdout può produrre stime di alta varianza che dipendono pesantemente da quali campioni specifici atterrare nel set di test.
Perché gli alberi della decisione sono soggetti a sovrapposti
La formazione continua è un'esperienza di lavoro che si svolge in modo più semplice, ma che può essere utilizzata come una forma di formazione più complessa, che può essere utilizzata come una forma di addestramento più semplice, ma che può essere utilizzata come una forma di addestramento più semplice.
Considerare un albero di decisione formato su un piccolo set di dati con 100 campioni e molte caratteristiche. Se l'albero cresce a 50 foglie, ogni foglia può contenere solo un paio di campioni. Sul set di formazione, l'albero otterrà una precisione quasi perfetta perché ha essenzialmente memorizzato ogni campione. Tuttavia, quando presentato con nuovi dati, l'albero si esibirà male perché i modelli specifici che ha imparato non sono generali.
Il ruolo della Valutazione Cross in Selezione Modelli e Tuning Hyperparameter
Oltre alla semplice valutazione, la valutazione incrociata gioca un ruolo centrale nella selezione dei modelli e nell'ottimizzazione dei parametri generali. Quando si costruisce un albero di decisione, è necessario scegliere i parametri iper-parametri come la profondità massima, il numero minimo di campioni necessari per dividere un nodo interno, e i campioni minimi per foglia. Queste scelte controllano direttamente la complessità del modello e la sua tendenza a sovraccaricarsi.
Per valutare l'errore di ogni tipo, è possibile scegliere tra un albero di decisione o un albero di riflessione, e per valutare ogni modello con la stessa procedura di valutazione incrociata, si ottiene un confronto di mele-apples che si riferisce alla variazione di precisione.
Tipi di tecniche di valutazione incrociata
Esistono diverse tecniche di valutazione incrociata, ognuna con i propri punti di forza e trade-off, che dipendono dalla dimensione del dataset, dal tipo di problema e dal budget computazionale.
K-Fold Validazione trasversale
In k-fold cross-validation, il dataset è diviso casualmente in [[LT:0]k] pieghe di dimensioni uguali. Il modello è formato su [[LT:2]k-1 piega e testato sulla piega rimanente. Questo processo è ripetuto k volte, con ogni piega usata
Valutazione incrociata K-Fold
Le classi di sbilanciamento standard k-fold possono produrre pieghe con distribuzioni di classe squilibrata, soprattutto quando la variabile di destinazione è rara. Se una piega finisce senza campioni da una classe di minoranza, le prestazioni del modello su quella piega potrebbero essere fuorvianti.
Valutazione trasversale a un'unica uscita (LOOCV)
LOOCV è un caso estremo di k-fold cross-validation dove k] uguale il numero di campioni nel dataset. Ogni campione è usato come un singolo set di test una volta, mentre i campioni rimanenti formano il set di formazione. LOOCV è computazionalmente costoso perché richiede formazione come molti modelli come ci sono campioni.
Valutazione trasversale ripetuta K-Fold
La valutazione trasversale ripetuta di k-fold ripete più volte il processo k-fold, ogni volta con diverse spaccature casuali dei dati in pieghe. Questo riduce ulteriormente la variazione nella stima delle prestazioni. Ad esempio, si potrebbe eseguire 5 volte cross-validation ripetuto 3 volte, con conseguente 15 valutazioni. La metrica finale è la media di tutte le ripetizioni.
Validazione di attesa vs. Validation
La valutazione di un campione medio è più semplice e veloce, ma è molto più semplice, ma è molto più facile. Il calcolo delle prestazioni dipende fortemente da quale campione è il terreno del test. Per gli alberi di decisione, un singolo detenuto può essere sovrastimato o sottovalutato le prestazioni reali, che porta a decisioni di modello più scarse.
Implementazione della Valutazione Cross: una guida pratica
In Python, la libreria [LT:0] è lo standard de facto per i modelli di alberi di decisione. La funzione automatizza il processo di divisione, formazione e punteggio.
Per ogni fase di elaborazione dei dati, le trasformazioni che imparano i parametri dai dati, come la scalatura o la codifica, devono essere eseguite all'interno di ogni piega di formazione per evitare perdite di dati. Per gli alberi di decisione, la scalatura è di solito inutile perché gli alberi sono invarianti alle trasformazioni monotoniche, ma la codifica di un punto di riferimento delle variabili di categoria deve essere effettuata costantemente attraverso le pieghe.
Pitfalls e migliori pratiche comuni
Se si selezionano le caratteristiche basate sull'intero set di dati, si stanno perdendo informazioni dal set di test, che porta a prestazioni eccessivamente ottimistiche. La selezione delle caratteristiche deve essere eseguita all'interno del loop di valutazione trasversale, utilizzando solo i dati di formazione da ogni piega.
La scelta del valore di k] è importante. Per la maggior parte dei set di dati, k=5] o k=10] funziona bene. Con i dati molto grandi, si potrebbe usare k=3[FLT]
Un'altra migliore pratica è quella di utilizzare la valutazione trasversale per il confronto dei modelli con i test statistici di significato. Anche se il modello A ha un punteggio più alto medio travalidato rispetto al modello B, la differenza potrebbe essere dovuta al caso.
Infine, ricorda che la valutazione trasversale non à ̈ una panacea. Si stima che le prestazioni sui dati prelevati dalla stessa distribuzione dei dati di formazione. Se i dati di distribuzione sono da una distribuzione diversa (sposta di distribuzione), la valutazione trasversale non lo rivelÃ2. In tali casi, à ̈ necessario un ulteriore convalida sui dati che rappresentano il dominio di destinazione.
Valutazione trasversale nel contesto degli ensemble decisionali
Gli alberi di decisione sono spesso utilizzati come studenti di base in metodi di insieme come foreste casuali e aumento di gradienti. Mentre gli ensemble riducono il overfitting rispetto a un singolo albero, la vallazione trasversale rimane importante per la regolazione di iperparametri di ensemble (numero di alberi, la profondità massima, il tasso di apprendimento, ecc.).
Conclusioni
La sua capacità di fornire una stima robusta e a bassa variazione delle prestazioni del modello aiuta a rilevare la sovrapposizione, guida l'ottimizzazione dell'iperparametro e supporta la selezione del modello informato.