Pièges communs dans l'apprentissage supervisé et comment les traiter avec des calculs
L'apprentissage supervisé est une approche d'apprentissage automatique largement utilisée qui implique la formation de modèles sur les données étiquetées. Cependant, les praticiens rencontrent souvent des pièges communs qui peuvent affecter la performance et la fiabilité de leurs modèles.
Sur-aménagement et sous-aménagement
Le surajustement se produit lorsqu'un modèle apprend trop bien les données de formation, y compris le bruit, ce qui entraîne une mauvaise généralisation des nouvelles données. Le surajustement se produit lorsque le modèle est trop simple pour saisir les modèles sous-jacents.
Par exemple, comparer l'erreur de formation (Etrain) et l'erreur de validation (E[val[) peuvent indiquer un surajustement si Etrain est très faible alors que Eval[ est élevé. Inversement, des erreurs élevées sur les deux suggèrent un sous-ajustement.
Solde de la catégorie
Le déséquilibre des classes survient lorsque certaines classes sont sous-représentées dans l'ensemble de données, ce qui conduit à des modèles biaisés.
Supposons que l'ensemble de données comporte 1000 échantillons, dont 900 appartiennent à la classe A et 100 à la classe B. Les pourcentages de distribution de la classe sont les suivants :
Classe A: (900/1000) * 100 = 90%
Classe B: (100/1000) * 100 = 10 %
Évaluation du rendement du modèle
Des paramètres tels que la précision, la précision, le rappel et le score F1 sont essentiels pour évaluer la performance du modèle.
- Vrai positif (TP)
- Faux positifs (FP)
- Faux négatifs (FN)
Par exemple, la précision est calculée comme suit:
Précision = TP/ (TP + FP)
Manipulation des données sonores
Les données sonores peuvent fausser la formation des modèles. Des calculs comme le rapport bruit-signal aident à quantifier la qualité des données.
Supposons que l'ensemble de données contienne 100 échantillons bruyants sur 1000 échantillons totaux. Le rapport bruit est:
Rapport bruit = (Nombre d'échantillons bruyants) / (Nombre total d'échantillons) = 100 / 1000 = 0,1 ou 10 %