Le surajustement se produit lorsqu'un modèle d'apprentissage automatique apprend trop bien les données de formation, y compris le bruit et les aberrations, ce qui réduit sa capacité à bien fonctionner sur de nouvelles données invisibles. Le surajustement est essentiel pour créer des modèles qui généralisent efficacement.

Identification des surajustements

Si le modèle fonctionne beaucoup mieux sur les données de formation que sur les données de validation, il est probable que le modèle se comporte de manière excessive. Les indicateurs clés comprennent une précision élevée de formation et une faible précision de validation.

Techniques pour réduire le surajustement

Plusieurs méthodes peuvent aider à prévenir les surajustements, notamment :

  • Regularisation: Ajoute une pénalité à la fonction perte pour décourager les modèles complexes.
  • Épaisseur:[ Aléatoirement, les unités tombent pendant l'entraînement pour réduire la dépendance à l'égard de neurones spécifiques.
  • Stopping précoce:[ Arrête la formation lorsque la performance de validation commence à diminuer.
  • Augmentation des données: Augmente la taille des ensembles de données en créant des versions modifiées des données existantes.
  • Modèle Simplification:[ Utilise moins de paramètres ou des algorithmes plus simples.

Calculs pour l'évaluation du modèle

Des paramètres tels que la perte de validation et la précision sont essentiels pour évaluer le surajustement.

  • Différence dans la précision: Précision de validation moins précision de l'entraînement.
  • Perte de validation:[ Surveillance de la perte sur les données de validation pour détecter la divergence par rapport à la perte de formation.
  • Validation de la corrosion:[ Utiliser la validation croisée du facteur k pour évaluer la stabilité du modèle à travers différentes fractions de données.

Conclusion

La mise en œuvre de ces techniques et calculs peut aider à identifier et à réduire les surajustements, conduisant à des modèles qui généralisent mieux les nouvelles données.