La sélection et l'ingénierie des fonctions sont des étapes essentielles de l'apprentissage supervisé. Elles aident à améliorer la performance du modèle, à réduire les surajustements et à réduire le temps de formation.

Techniques de sélection des caractéristiques

La sélection des caractéristiques implique le choix des caractéristiques les plus pertinentes dans l'ensemble de données. Les techniques courantes comprennent les méthodes de filtrage, les méthodes d'emballage et les méthodes intégrées.

Méthodes de filtrage

Les méthodes de filtrage évaluent les caractéristiques basées sur des mesures statistiques telles que la corrélation, le chi carré ou l'information mutuelle.

Méthodes d'emballage

Les méthodes de Wrapper sélectionnent les caractéristiques par des modèles de formation sur différents sous-ensembles et évaluent leur performance. Les techniques comprennent l'élimination des caractéristiques récursives et la sélection avant/arrière.

Méthodes intégrées

Les méthodes intégrées intègrent la sélection des caractéristiques lors de la formation des modèles.

Stratégies techniques de la fonction

L'ingénierie des caractéristiques transforme les données brutes en caractéristiques significatives qui améliorent l'apprentissage des modèles. Elle comprend la création de nouvelles fonctionnalités, l'encodage des variables catégoriques et l'échelle des données numériques.

Création de nouvelles fonctionnalités

La création de nouvelles fonctionnalités peut impliquer des combinaisons mathématiques, des regroupements ou des transformations spécifiques à un domaine.

Encodage des variables catégoriques

La conversion des données catégorisées en format numérique est cruciale. Les méthodes courantes comprennent l'encodage à une seule chaleur, l'encodage des étiquettes et l'encodage des cibles.

Écaillage des données numériques

L'échelle permet de garantir que les caractéristiques sont à des échelles comparables, ce qui profite à de nombreux algorithmes.