Les arbres de décision sont un élément essentiel des flux de travail de l'apprentissage automatique, prisés pour leur structure intuitive et leur interprétabilité simple. Ils alimentent tout, de l'évaluation des risques de crédit au diagnostic médical, servant souvent d'algorithme de référence pour les data savants qui doivent expliquer les prédictions aux intervenants non techniques. Pourtant, malgré leur robustesse, les arbres de décision ne sont pas immunisés contre un problème subtil mais persistant : multicolinéarité. Lorsque les variables prédictives sont fortement corrélées les unes avec les autres, les modèles d'arbres de décision peuvent devenir instables, susceptibles de surcoller et plus difficiles à interpréter.

Dans cet article, nous allons explorer ce qu'est la multicolinéarité, pourquoi elle compte spécifiquement pour les arbres de décision, et un ensemble de stratégies actionnables pour atténuer son impact. Que vous soyez un data scientist enseignant un cours ou un praticien peaufinant un modèle de production, ces techniques vous aideront à construire des arbres de décision plus propres et plus généralisables.

Qu'est-ce que la multicolinéarité?

La multicolinéarité désigne une situation dans laquelle deux variables prédictives ou plus dans un problème de régression ou de classification sont linéairement liées à un degré élevé. Lorsque la corrélation entre les variables est forte, les données sous-jacentes contiennent des informations qui peuvent confondre de nombreux modèles statistiques et d'apprentissage automatique. Dans les modèles linéaires, la multicolinéarité gonfle les erreurs standard et rend les estimations de coefficients instables.

Il existe deux types principaux de multicolinéarité à connaître:

  • Parfaite multicolinéarité[ — un prédicteur est une combinaison linéaire d'autres.
  • Multicolinéarité élevée (impréfectible) — Les prédicteurs sont fortement corrélés, mais pas parfaitement, ce qui est beaucoup plus fréquent et est au centre de la plupart des stratégies d'atténuation.

Pourquoi la multicollinéarité est-elle toujours importante dans les arbres décisionnels?

Les arbres décisionnels ne sont pas paramétriques et sont souvent décrits comme immunisés contre la multicolinéarité. S'il est vrai que les arbres n'exigent pas les mêmes hypothèses d'indépendance que les modèles linéaires, les caractéristiques corrélées présentent encore des problèmes pratiques :

  • Brouillon de sélection split — lorsque deux caractéristiques fortement corrélées sont disponibles, l'arbre peut choisir arbitrairement l'une pour la première scission, ignorant l'autre. Cela rend les arbres individuels instables; de petits changements dans les données peuvent faire basculer l'arbre qu'il choisit.
  • Surfitting — les fonctionnalités redondantes offrent de multiples possibilités pour l'arbre de se diviser sur essentiellement les mêmes informations, augmentant la profondeur et la complexité sans améliorer la généralisation.
  • Importance de la fonctionnalité[ — Les scores d'importance sont divisés entre les prédicteurs corrélés, diluant la contribution apparente de chacun et rendant plus difficile l'identification des variables qui conduisent réellement les prédictions.
  • La diminution de l'interpretation — un arbre qui se divise à la fois et (qui sont presque identiques) est plus confus et plus difficile à tailler qu'un arbre construit avec des caractéristiques plus propres et indépendantes.

For these reasons, teaching practitioners to detect and handle multicollinearity before feeding data into a decision tree is a core part of building robust models.

Détecter la multicolinéarité dans vos données

Avant de décider comment fixer la multicolinéarité, vous devez d'abord l'identifier. Deux des outils de détection les plus courants sont la matrice de corrélation et le facteur d'inflation de variance (FIV).

Utilisation d'une matrice de corrélation

La méthode la plus simple consiste à calculer les coefficients de corrélation Pearson par paires entre toutes les caractéristiques numériques. Une carte thermique de la matrice de corrélation révèle rapidement des grappes de variables fortement corrélées. Une règle courante est de marquer des paires avec pour une recherche plus approfondie, bien que le seuil puisse être ajusté en fonction des connaissances du domaine.

Facteur d'inflation des écarts

Pour chaque fonction, le VIF est calculé en régressant cette fonction contre tous les autres et en utilisant la formule . Un VIF supérieur à 5 ou 10 est souvent considéré comme un signe de multicolinéarité problématique, bien que ces seuils ne soient pas absolus. De nombreuses bibliothèques statistiques offrent une fonction VIF hors de la boîte; par exemple, en Python fournit un moyen rapide d'évaluer chaque prédicteur numérique.

Ressource externe: Le statsmodèles documentation VIF fournit des détails et des exemples de mise en œuvre.

Stratégies pour gérer la multicolinéarité dans les arbres décisionnels

Une fois que vous avez identifié des caractéristiques multicollinaires, la prochaine étape est de décider comment les gérer. Les stratégies suivantes sont particulièrement efficaces pour les modèles d'arbres de décision.

1. Sélection des fonctionnalités

La sélection des fonctions est souvent la solution la plus simple et la plus interprétable. L'objectif est de ne retenir qu'un sous-ensemble de prédicteurs qui sont à tout le plus faiblement corrélés les uns aux autres, tout en conservant le signal prédictif.

  • Seuil de correction — calculez la matrice de corrélation et retirez une caractéristique de chaque paire de corrélation au-dessus d'un seuil choisi (p. ex. ). Quelle caractéristique vous baissez devrait être guidée par l'expertise du domaine, le coût de la fonctionnalité ou la facilité de mesure.
  • Sélection fondée sur le VIF[ — calcul itératif du VIF pour toutes les caractéristiques, déposez le VIF le plus élevé au-dessus d'une coupure et répétez jusqu'à ce que toutes les caractéristiques restantes aient des valeurs de VIF acceptables.
  • Méthodes de wrapper — utiliser la sélection en avant, l'élimination en arrière ou l'élimination des fonctionnalités récursives (RFE) spécialement adaptées à l'algorithme de l'arbre de décision.

La sélection des fonctions a l'avantage supplémentaire de réduire les coûts de collecte et de stockage des données dans les systèmes de production, et elle permet de garder l'arbre simple et facile à expliquer.

2. Réduction de dimensionnalité avec PCA

Lorsque les caractéristiques de chute sont indésirables parce que chaque variable a une signification de domaine unique, l'analyse des composantes principales (APC) offre une alternative : elle transforme les prédicteurs corrélés originaux en un plus petit ensemble de composantes non corrélées qui capturent la plupart de la variance dans les données.

  • Avantages — PCA élimine entièrement la multicolinéarité, réduit le bruit et peut améliorer la généralisation lorsque le nombre de caractéristiques est important par rapport au nombre d'échantillons.
  • Les avantages — la plus grande baisse est la perte d'interprétation. Un composant est une combinaison linéaire pondérée des caractéristiques originales; il peut être difficile d'expliquer ce qu'une division sur signifie en termes commerciaux. De plus, PCA n'est pas supervisée et peut rejeter des informations qui ne sont pas saisies par variance mais qui sont importantes pour la variable cible.

Malgré ces compromis, l'APC est un outil puissant pour préparer les données des arbres de décision, surtout lorsqu'il est combiné avec des méthodes d'ensemble.

3. Régularisation dans les modèles fondés sur les arbres

Bien que la régularisation soit le plus souvent associée à des modèles linéaires (pénalités L1/L2), les arbres de décision ont leurs propres formes de régularisation qui peuvent réduire le surajustement encouragé par des caractéristiques multicollinéaires:

  • Des échantillons minimums par fraction — augmentant oblige l'arbre à exiger plus de données avant de faire une fraction, réduisant ainsi le risque de fractionnement sur une caractéristique redondante uniquement par hasard.
  • Profondeur maximale — le recouvrement empêche l'arbre de croître assez profondément pour exploiter les caractéristiques corrélées.
  • La diminution de l'impureté minimale[ — le réglage assure que seules les fractions qui réduisent significativement l'impureté sont faites, filtrant les fractions entraînées par le bruit de multicolinéarité.
  • La taille de complexité des coûts (CCP) — après la taille avec ] permet de couper l'arbre après la croissance, en supprimant les branches qui dépendent de fractions redondantes.

L'application d'une forte régularisation peut aider un arbre de décision à ignorer les corrélations fallacieuses, mais ce n'est pas une balle d'argent – elle ne traite pas de la question sous-jacente des fonctionnalités redondantes.

Ressource externe:[ La documentation scikit-apprendre sur la taille de complexité des coûts[ fournit un exemple clair de la façon d'appliquer la régularisation des arbres.

4. Méthodes de l'ensemble : Forêts aléatoires et amélioration des gradients

Les méthodes d'ensemble sont peut-être la façon la plus robuste de gérer la multicollinéarité dans les modèles basés sur les arbres. En combinant de nombreux arbres, les ensembles ont une moyenne des instabilités causées par les caractéristiques corrélées et produisent des prédictions plus stables.

  • Random Forests — chaque arbre est formé sur un échantillon de bootstrap des données et ne considère qu'un sous-ensemble aléatoire de caractéristiques à chaque fraction. Cette caractéristique aléatoire brise la domination de tout prédicteur corrélé, forçant la forêt à explorer des fractions alternatives. La prédiction finale est une moyenne sur de nombreux arbres, qui se lisse sur le choix arbitraire de caractéristiques.
  • Machines de boosting gradins (GBMs) — booster construit des arbres séquentiellement, chacun corrigeant les erreurs de son prédécesseur. Des fonctionnalités liées peuvent encore être sélectionnées à travers les arbres, mais le raffinement itératif réduit l'impact de la multicolinéarité sur la performance globale.

Les méthodes d'ensemble n'éliminent pas la multicolinéarité, mais elles la rendent beaucoup moins nuisible. Pour de nombreux praticiens, utiliser une forêt aléatoire ou GBM est la façon la plus simple d'ignorer le problème sans prétraitement explicite.

Mise en oeuvre pratique : Guide étape par étape

Nous allons utiliser un ensemble de données hypothétiques sur les logements avec des caractéristiques comme les surfaces carrées, le nombre de chambres, le nombre de salles de bains, la taille du lot et l'année de construction, dont beaucoup sont naturellement corrélés.

Étape 1: Détecter la multicolinéarité

Dans notre exemple, les superficies carrées et le nombre de chambres pourraient avoir une corrélation de 0,82 et les valeurs de la VIF pour les deux pourraient dépasser 6. Cela confirme la multicolinéarité problématique.

Étape 2 : Choisir une stratégie d'atténuation

Parce que l'interprétation est importante pour un modèle immobilier, nous optons pour la sélection des caractéristiques[ plutôt que pour PCA. Nous décidons de conserver des surfaces carrées (qui sont plus granulaires et souvent plus prédictives) et de laisser tomber le nombre de chambres. Nous vérifions également d'autres paires de paires corrélées et supprimons la taille du lot si elle montre VIF au-dessus de 10 après la première chute.

Étape 3 : Former l'arbre de décision

Avec l'ensemble réduit de fonctionnalités, nous formons un arbre de décision en utilisant un raisonnable] (p. ex. 6) et (p. ex., 20) pour éviter les surajustements. L'arbre résultant est plus simple, avec moins de nœuds, et les scores d'importance de la fonctionnalité sont maintenant concentrés sur des variables véritablement distinctes.

Étape 4: Valider et comparer

Nous comparons l'arbre formé sur l'ensemble de données complet à l'arbre formé sur les caractéristiques sélectionnées. Bien que l'arbre complet puisse atteindre une erreur d'entraînement légèrement inférieure, l'arbre de caractéristiques sélectionné devrait démontrer de meilleurs scores de validation croisée et moins de variance entre les plis.

Pour une couche de robustesse supplémentaire, nous formons également une forêt aléatoire sur l'ensemble de données d'origine. La performance de la forêt devrait correspondre étroitement ou dépasser celle de l'arbre de décision taillé, confirmant que les méthodes d'ensemble sont une alternative viable lorsque la sélection des caractéristiques n'est pas souhaitable.

Pièges courants et comment les éviter

Même avec les meilleures intentions, des erreurs peuvent se produire lors de la manipulation de la multicollinéarité dans les arbres de décision. Voici les pièges les plus fréquents:

  • La suppression de la fonction Over-eager — la suppression d'une variable juste parce qu'elle est corrélée avec une autre peut gaspiller un signal précieux.
  • Ignorer les effets d'interaction — dans certains cas, deux caractéristiques corrélées comportent des informations qui ne sont pas transmises seules.
  • Appliquer PCA sans échelle — PCA est sensible à l'échelle des caractéristiques. Toujours normaliser les prédicteurs numériques à zéro moyenne et variance d'unité avant d'effectuer PCA.
  • Si les seuils de la FIV sont universels — un FIV de 10 est une limite commune, mais dans les petits ensembles de données ou domaines avec de fortes corrélations naturelles, des seuils encore plus faibles peuvent être appropriés.
  • Pour obtenir une vérification après l'ingénierie des fonctions — la multicolinéarité peut être introduite lors de la création de caractéristiques polynômes, de rapports ou de termes d'interaction.

Conclusion

La multicollinéarité ne brise pas un modèle d'arbre de décision de la même façon qu'une régression linéaire, mais elle mine encore la stabilité, l'interprétation et la généralisation. En détectant les caractéristiques corrélées tôt, en appliquant une sélection réfléchie des caractéristiques ou une réduction de dimensionnalité, et en complétant les arbres par des méthodes d'ensemble comme les Forêts aléatoires, vous pouvez construire des modèles à la fois précis et résilients.

Ressource externe: Pour une plongée plus profonde dans VIF et son application pour la sélection de fonctionnalités, voir l'article Wikipedia sur le facteur d'inflation de la variation.Pour un tutoriel pratique sur la construction d'arbres de décision avec scikit‐learn, voir la documentation officielle de scikit‐learn de décision.