Calcul étape par étape de l'erreur de validation croisée dans le model Tuning
La validation croisée est une technique utilisée pour évaluer les performances d'un modèle d'apprentissage automatique. Elle aide à ajuster les paramètres du modèle en estimant la performance du modèle sur des données invisibles. Le processus consiste à diviser l'ensemble de données en plusieurs parties, à former le modèle sur certaines parties et à le tester sur d'autres.
Étape 1: Partage des données
Le jeu de données est divisé en parties égales k, appelées plis. Les choix communs pour 'k' sont de 5 ou 10. Chaque plis agit comme un ensemble de validation une fois, tandis que les plis restants forment le jeu de formation. Ce processus assure que chaque point de données est utilisé à la fois pour la formation et la validation.
Étape 2 : Formation et validation des modèles
Pour chaque pli, le modèle est formé sur les pliages restants de «k-1». Il est ensuite validé sur le pli actuel. L'erreur est calculée sur la base des prédictions du modèle par rapport aux valeurs réelles du pli de validation. Cette étape est répétée pour tous les pliages.
Étape 3: Calcul d'erreur
Les erreurs de chaque pli sont enregistrées. Les paramètres d'erreur communs comprennent l'erreur carrée moyenne (ESM) ou l'erreur absolue moyenne (EAM). L'erreur de validation croisée est la moyenne de ces erreurs dans tous les pli, fournissant une estimation de la performance du modèle.
Étape 4: Estimation finale de l'erreur
L'erreur moyenne obtenue lors de la validation croisée sert à estimer comment le modèle fonctionnera sur de nouvelles données invisibles. Cette valeur guide la sélection des paramètres optimaux du modèle pendant le réglage.