Les arbres de décision sont une pierre angulaire de l'apprentissage par machine, qui offre une structure claire et fondée sur des règles qui reflète la prise de décision humaine. Malgré leur simplicité et leur attrait visuel, ils viennent avec un piège notoire : l'emboutissage. Un arbre de décision qui sur-adapte a essentiellement mémorisé les données de formation, y compris son bruit et ses aberrations, plutôt que d'apprendre les modèles sous-jacents.

Comprendre les sur-ajustements dans les arbres décisionnels

Le surajustement se produit lorsqu'un arbre de décision devient trop profond ou trop complexe, captant des fluctuations aléatoires dans l'ensemble d'entraînement au lieu du vrai signal. En pratique, cela se manifeste comme un arbre avec de nombreux nœuds et feuilles qui contiennent chacun très peu d'échantillons. La précision de l'entraînement du modèle approche à 100%, mais sa validation ou précision de test est loin derrière.

Les symptômes d'un surajustement sont notamment les suivants:

  • Arbres extrêmement profonds avec des dizaines de niveaux.
  • Congés ne contenant qu'une ou deux instances de formation.
  • Haute sensibilité aux petits changements dans les données de formation.
  • Mauvais rendement sur les ensembles de validation, de validation croisée ou d'essai.

Mathématiquement, le surajustement correspond à une variance élevée dans les prédictions du modèle. Un petit changement dans l'entrée conduit à un grand changement dans le résultat prévu. S'attaquer au surajustement consiste donc à réduire la variance sans sacrifier trop de biais. L'objectif est de trouver le point doux où le modèle capture les vrais modèles sans courir le bruit.

Stratégies de base pour prévenir les surajustements

Plusieurs techniques pratiques peuvent freiner l'ajustement excessif des arbres de décision.Ces méthodes se divisent en deux catégories : pré-élagage (arrêt de la croissance précoce des arbres) et post-élagage (croissance complète de l'arbre puis apprêtage).

Tailler l'arbre

La taille est la méthode la plus ancienne et la plus intuitive. Après avoir cultivé un arbre à sa profondeur, vous supprimez sélectivement les branches qui ajoutent peu de valeur prédictive. La technique la plus courante est la taille coûts-complexité, également connue sous le nom de taille faible-lien. Vous calculez un paramètre de complexité (souvent appelé α) qui pénalise l'arbre pour son nombre de feuilles. En variant α, vous pouvez générer une séquence de sous-arbres et sélectionner celui qui minimise l'erreur sur un ensemble de validation.

Par exemple, imaginez un arbre de décision qui se divise sur une fonctionnalité comme «identifiant client». Ce scindé peut parfaitement séparer des exemples d'entraînement, mais sera inutile sur de nouvelles données.

Limiter la profondeur de l'arbre

Une façon simple d'éviter le surajustement est de capter la profondeur maximale de l'arbre. La profondeur contrôle le nombre de fractions successives de la racine à la feuille la plus profonde. Les arbres plus profonds peuvent modéliser des relations plus complexes mais sont également plus enclins à surajustement. La détermination d'une profondeur maximale agit comme une contrainte difficile sur la complexité. Pour de nombreux ensembles de données, une profondeur entre 5 et 15 fonctionne bien, mais vous devriez régler cet hyperparamètre en utilisant la validation croisée.

La profondeur limite est une technique classique de pré-élagage. Elle empêche l'arbre de créer des scissions basées sur de minuscules sous-ensembles bruyants. Une règle de pouce : commencer par une profondeur maximale de 3 à 5, observer les performances de validation, et augmenter progressivement la profondeur tout en surveillant l'écart de performance.

Échantillons minimaux pour les fractions et les feuilles

Une autre méthode de pré-élagage puissante consiste à exiger un nombre minimum d'échantillons dans un noeud interne avant de pouvoir le diviser. De même, vous pouvez définir un nombre minimum d'échantillons par noeud foliaire. Ces paramètres garantissent que les fractions ne sont faites que lorsqu'il y a suffisamment de données pour supporter des partitions statistiquement significatives. Par exemple, le réglage signifie que tout noeud ayant moins de 10 échantillons ne sera pas divisé davantage. Une feuille ayant moins de 5 échantillons peut être trop spécifique et représenter probablement du bruit.

Ces paramètres sont particulièrement utiles dans les ensembles de données de petite à moyenne taille où le surajustement est une menace constante, ce qui réduit la variation au prix d'une légère augmentation de biais, ce qui entraîne souvent un gain net en généralisation.

Sélection des fonctionnalités et réduction de dimensionnalité

Les arbres décisionnels sont relativement robustes à des caractéristiques non pertinentes, mais lorsque le nombre de caractéristiques est important par rapport au nombre d'échantillons, l'arbre peut facilement s'adapter en ramenant des corrélations fallacieuses.

  • Suppression des caractéristiques avec faible variance ou forte corrélation avec les autres.
  • À l'aide de tests statistiques univariés (p. ex., information au carré chi, information mutuelle) pour sélectionner les caractéristiques les plus informatives.
  • Appliquer l'élimination récursive des caractéristiques (RFE) à des caractéristiques moins importantes.

L'analyse des composantes principales (APC) peut également être appliquée pour réduire la dimensionnalité avant de former un arbre de décision, bien que l'interprétation de l'arbre puisse en souffrir puisque les caractéristiques deviennent des combinaisons linéaires d'attributs originaux.

Validation croisée pour le réglage hyperparamétrique

La validation croisée n'est pas une technique de prévention directe, mais elle est essentielle pour trouver les hyperparamètres appropriés. En cloisonnant les données d'entraînement en plusieurs plis, vous pouvez évaluer comment le modèle fonctionne sur des sous-ensembles invisibles. Cela donne une estimation fiable de l'erreur de généralisation. Les stratégies de validation croisée communes incluent le pold k (typiquement 5 ou 10 plis), le pold k stratifié (portions de classe de maintien) et le leave-one-out (pour les très petits ensembles de données).

Lorsque vous accordez des hyperparamètres comme la profondeur maximale, des échantillons minimums se divisent ou que le paramètre de taille α, la validation croisée vous empêche de suradapter l'ensemble de validation lui-même. Par exemple, si vous essayez 100 valeurs de profondeur et choisissez celle avec la plus faible erreur de validation, vous risquez de suradapter cet ensemble de validation unique.

Techniques avancées pour une meilleure généralisation

Au-delà des stratégies de base, plusieurs méthodes avancées peuvent améliorer considérablement la généralisation des modèles d'arbres de décision, souvent au prix d'une certaine interprétabilité.

Méthodes de l'ensemble : Marquage et forêts aléatoires

L'apprentissage de l'ensemble réduit la variance en combinant plusieurs arbres. L'approche la plus célèbre est la Forêt aléatoire, qui construit de nombreux arbres de décision sur des échantillons de données piégés et utilise des sous-ensembles de caractéristiques aléatoires pour chaque scission. Les prédictions de tous les arbres sont moyennes (pour régression) ou votées (pour classification). Comme chaque arbre est formé sur des données et des caractéristiques légèrement différentes, les erreurs ont tendance à s'annuler, ce qui conduit à un modèle qui généralise bien mieux qu'un arbre unique.

Les forêts aléatoires sont robustes et souvent le choix de passer à l'action lorsque l'interprétation n'est pas primordiale. Elles gèrent un grand nombre de fonctionnalités bien et sont moins sensibles aux choix hyperparamétriques. L'échange est une perte du processus décisionnel transparent : vous pouvez voir des caractéristiques importantes mais pas un seul chemin de décision clair.

Renforcement et régularisation

Les algorithmes de stimulation comme les arbres gradués gradués (par exemple XGBoost, LightGBM) construisent les arbres séquentiellement, chaque nouvel arbre se concentrant sur la correction des erreurs des précédentes. Bien que le boosting puisse également sur-adapter si autorisé à cultiver trop d'arbres, les implémentations modernes comprennent des paramètres de régularisation intégrés tels que le taux d'apprentissage, les ratios de sous-échantillon et les pénalités L1/L2 sur les poids des feuilles. Ces régulateurs fonctionnent de la même manière que le taillement dans un arbre unique : ils limitent l'ampleur des corrections et empêchent le modèle de s'adapter au bruit.

Arrêt précoce

Lorsque les modèles d'ensemble d'entraînement (surtout booster), l'arrêt précoce est un moyen pratique d'éviter les surajustements. Vous surveillez l'erreur de validation en ajoutant plus d'arbres, et arrêtez l'entraînement lorsque l'erreur de validation cesse d'améliorer (ou commence à augmenter). Ceci est analogue à limiter le nombre d'itérations dans les réseaux neuronaux. Le nombre optimal d'arbres est atteint juste avant le surajustement commence.

Flux de travail pratique pour la généralisation

Un workflow systématique peut vous aider à construire des modèles d'arbre de décision qui généralisent bien. Suivez ces étapes :

  1. Démarrer simple:[ Former un arbre de décision non contraint pour voir le rendement de base. Cherchez un écart important entre la formation et la précision de la validation – cela confirme l'excès de concordance.
  2. Appliquer les contraintes de pré-élagage:[ Régler une profondeur maximale (p. ex., 5), diviser les échantillons minimums (p. ex., 10) et laisser les échantillons minimums (p. ex., 5). Redoubler. La précision de validation s'améliore-t-elle? Si oui, continuer à l'ajuster.
  3. Effectuer une recherche de grille de validation croisée :[ Utiliser une validation croisée stratifiée à cinq fois pour tester des combinaisons de profondeur, min samples split, min samples leaf et des paramètres de taille.
  4. Consider tailler:[ Si vous avez utilisé un arbre complet initialement, appliquer la taille coût-complexité (avec validation croisée pour sélectionner α). Cela donne souvent un modèle légèrement meilleur que la pré-taille seule.
  5. Essayez les ensembles: Si vous avez besoin de performances maximales, passez à un modèle Random Forest ou Gradient Boosting. Hyperparamètres spécifiques à l'ensemble (nombre d'arbres, profondeur maximale par arbre, taux d'apprentissage, etc.).
  6. Validation sur un ensemble de tests de retenue :[ Après tout réglage, évaluer le modèle final sur un ensemble de tests séparé qui n'a jamais été utilisé pendant le développement.

Tout au long de ce processus, gardez toujours un œil sur le compromis variance-bias. Le modèle le plus simple avec la plus faible erreur de validation est généralement le meilleur généralisateur pour les données données données.

Diagnostic de la suradaptation avec les courbes d'apprentissage

Les courbes d'apprentissage sont un excellent outil de diagnostic. La formation et la validation par parcelle (ou validation croisée) se situent en fonction du nombre d'échantillons d'entraînement. Dans un scénario de surajustement, la courbe d'entraînement reste élevée alors que la courbe de validation est significativement plus basse, et l'écart ne diminue pas à mesure que d'autres échantillons sont ajoutés.

Si l'ajout de nouveaux échantillons de formation réduit considérablement l'écart entre la formation et les scores de validation, la collecte de plus de données pourrait être la meilleure solution pour suradapter les données.

Exemple réel-mondial: Prévoir le défaut de prêt

Pour illustrer, considérez un problème de classification lorsqu'une banque veut prédire si un demandeur de prêt fera défaut. L'ensemble de données comporte 10 000 exemples et 50 caractéristiques (revenu, cote de crédit, ratio dette-revenu, etc.). Un arbre de décision non contraint atteint 99,8 % de la précision de la formation, mais seulement 78 % sur un ensemble de tests tenu. L'arbre a 35 profondeur et beaucoup de feuilles avec moins de 10 échantillons.

Appliquer les stratégies :

  • Réglez max profondeur à 8 — la précision de validation passe à 85%.
  • Définissez min samples split à 20 — la précision de validation s'améliore à 87%.
  • Appliquer la taille coûts-complexité avec la validation croisée; sélectionné α=0.002 donne la profondeur 10 et la précision de validation 88%.
  • Enfin, une forêt aléatoire de 200 arbres (max profondeur=12) atteint 91 % de précision de test, dépassant ainsi le seul arbre.

Cette progression montre comment les contraintes délibérées transforment un modèle sur-adapté en un prédicteur fiable.

Ressources externes et lectures complémentaires

Pour ceux qui veulent plonger plus profondément, voici des ressources faisant autorité :

Conclusion

Pour une généralisation plus robuste, les méthodes d'ensemble comme les forêts aléatoires et le boosting progressif offrent des garanties plus fortes en mesurant la variance des arbres individuels. En comprenant l'interaction entre la complexité du modèle et le bruit des données, les praticiens peuvent construire des modèles basés sur les arbres décisionnels qui fournissent des prédictions fiables sur des données invisibles. Commencez par des contraintes simples, validez soigneusement et dirigez vers un modèle équilibré qui capture la structure sous-jacente réelle sans mémoriser le bruit.