Les modèles d'apprentissage supervisé sont utilisés pour faire des prédictions basées sur des données marquées. Il est essentiel de trouver un équilibre entre le surajustement et le sous-ajustement pour créer des modèles efficaces.

Sur-aménagement dans les modèles supervisés

Le surajustement se produit lorsqu'un modèle apprend trop bien les données de formation, y compris le bruit et les valeurs aberrantes. Il se produit donc de mauvaises performances sur de nouvelles données invisibles.

Sous-titrage dans les modèles supervisés

Il arrive que les modèles ne soient pas assez simples pour saisir les tendances sous-jacentes des données, ce qui entraîne une mauvaise performance sur les ensembles de données d'entraînement et d'essai.

Stratégies visant à prévenir les surajustements

  • Regularisation: Des techniques comme L1 et L2 ajoutent des pénalités à la complexité du modèle.
  • Cross-Validation:[ L'utilisation de jeux de validation aide à régler les hyperparamètres et à détecter les surajustements.
  • Élagage:[ Simplifier des modèles comme les arbres décisionnels réduit la complexité inutile.
  • Stopping précoce:[ Halte à l'entraînement avant que le modèle ne surgisse dans les données.

Stratégies visant à prévenir les sous-ajustements

  • Renforcer la complexité du modèle:[ Utiliser plus de fonctionnalités ou d'algorithmes complexes.
  • Ingénierie des caractéristiques :[ Création de nouvelles fonctionnalités pour mieux représenter les profils de données.
  • Régularisation réduite:[ Réduction des pénalités qui limitent la flexibilité du modèle.