Génie chimique & Matériaux
Méthodes pratiques pour la sélection des éléments et l'ingénierie dans l'apprentissage supervisé
Table of Contents
La sélection et l'ingénierie des fonctions sont des étapes essentielles de l'apprentissage supervisé. Elles aident à améliorer la performance du modèle, à réduire les surajustements et à réduire le temps de formation.
Techniques de sélection des caractéristiques
La sélection des caractéristiques implique le choix des caractéristiques les plus pertinentes dans l'ensemble de données. Les techniques courantes comprennent les méthodes de filtrage, les méthodes d'emballage et les méthodes intégrées.
Méthodes de filtrage
Les méthodes de filtrage évaluent les caractéristiques basées sur des mesures statistiques telles que la corrélation, le chi carré ou l'information mutuelle.
Méthodes d'emballage
Les méthodes de Wrapper sélectionnent les caractéristiques par des modèles de formation sur différents sous-ensembles et évaluent leur performance. Les techniques comprennent l'élimination des caractéristiques récursives et la sélection avant/arrière.
Méthodes intégrées
Les méthodes intégrées intègrent la sélection des caractéristiques lors de la formation des modèles.
Stratégies techniques de la fonction
L'ingénierie des caractéristiques transforme les données brutes en caractéristiques significatives qui améliorent l'apprentissage des modèles. Elle comprend la création de nouvelles fonctionnalités, l'encodage des variables catégoriques et l'échelle des données numériques.
Création de nouvelles fonctionnalités
La création de nouvelles fonctionnalités peut impliquer des combinaisons mathématiques, des regroupements ou des transformations spécifiques à un domaine.
Encodage des variables catégoriques
La conversion des données catégorisées en format numérique est cruciale. Les méthodes courantes comprennent l'encodage à une seule chaleur, l'encodage des étiquettes et l'encodage des cibles.
Écaillage des données numériques
L'échelle permet de garantir que les caractéristiques sont à des échelles comparables, ce qui profite à de nombreux algorithmes.