La selezione delle caratteristiche è un processo utilizzato nell'apprendimento automatico per identificare le variabili più rilevanti per la formazione dei modelli. Aiuta a migliorare le prestazioni del modello, ridurre i costi di calcolo e ridurre i costi di calcolo.

Metodi di filtrazione

I metodi di filtraggio valutano la rilevanza delle caratteristiche basate su misure statistiche, veloci e adatti a dati di alta dimensione, le tecniche comuni includono coefficienti di correlazione, test chi-square e informazioni reciproche.

Ad esempio, utilizzando la correlazione, vengono selezionate caratteristiche con un'alta correlazione con la variabile di destinazione, mentre quelle con bassa correlazione vengono scartate.

Metodi di tramoggia

I metodi Wrapper valutano i sottoset delle caratteristiche formando un modello e selezionando la combinazione che produce le migliori prestazioni, più accurate ma computazionalmente intensive.

Le tecniche includono l'eliminazione delle caratteristiche ricorrenti (RFE) e la selezione in avanti o indietro. Ad esempio, RFE forma ripetutamente un modello, rimuove le caratteristiche meno importanti e affina il sottoinsieme fino a raggiungere le prestazioni ottimali.

Metodi incorporati

I metodi incorporati eseguono la selezione delle caratteristiche durante il processo di formazione del modello, che incorporano tecniche di regolarizzazione che penalizzano le caratteristiche meno importanti.

Esempi includono la regolarizzazione di Lasso (L1) e algoritmi basati su alberi come le foreste casuali, che forniscono punteggi di importanza caratteristica.

Esempio pratico

Supponiamo che si disponga di un set di dati con numerose caratteristiche che prevedono i prezzi della casa. Utilizzando un metodo di filtro, è possibile selezionare le caratteristiche con la massima correlazione al prezzo. Quindi, applicare RFE per affinare il sottoinsieme con un metodo wrapper. Infine, formare un modello con caratteristiche embedded punti di importanza per finalizzare la selezione.