Table of Contents
Les arbres de décision sont un algorithme fondamental d'apprentissage automatique qui reste largement utilisé pour les tâches de classification et de régression. Leur popularité découle d'une structure intuitive, fondée sur des règles, qui reflète les processus décisionnels humains, en faisant l'un des modèles les plus interprétables dans la trousse d'un data savant. Chaque arbre est composé de nœuds représentant des points de décision basés sur des valeurs de caractéristiques, des branches pour les résultats et laisse des prédictions finales.
Qu'est-ce que les arbres de décision?
Un arbre de décision divise récursivement l'espace de la caractéristique en régions, chacune a attribué une prédiction — pour la régression, la valeur cible moyenne dans cette région et pour la classification, la classe majoritaire. Le processus de division sélectionne les caractéristiques et les seuils qui réduisent au minimum une mesure d'impureté, comme l'impureté de Gini ou l'entropie pour la classification, ou l'erreur carrée moyenne pour la régression. À chaque nœud, l'algorithme évalue toutes les scissions possibles pour chaque caractéristique; la scission qui produit la plus grande réduction de l'impureté devient le nouveau point de branchement. Ce processus se poursuit jusqu'à ce qu'un critère d'arrêt soit rempli — une profondeur maximale, un nombre minimum d'échantillons par feuille, ou aucune amélioration supplémentaire de la réduction de l'impureté.
Une caractéristique clé est que les arbres de décision ne se fondent pas sur des mesures de distance ou des distances géométriques entre les points de données. Ils utilisent plutôt des comparaisons fondées sur le seuil : pour une caractéristique donnée Xj, l'arbre demande si X[j[ ≤ t pour un seuil donné t. Cette propriété est la raison pour laquelle les arbres de décision sont souvent considérés comme invariants.
Techniques communes d'établissement de niveaux de données
L'échelle des données, ou l'échelle des caractéristiques, transforme les valeurs des caractéristiques numériques en une plage ou une distribution commune.
- Scalage Min-Max[ — aussi connu sous le nom de normalisation, rééchelle les caractéristiques à une plage fixe, généralement [0, 1]. Chaque valeur est transformée en soustrayant le minimum et en divisant par la plage: X' = (X − Xmin[ / (Xmax X[min]. Cette méthode préserve la forme de la distribution originale tout en compressant les valeurs dans un intervalle délimité.
- Normement (Normement de l'indice Z) — transforme les caractéristiques pour avoir une moyenne de zéro et une déviation type d'un: X' = (X − μ) / φ. Contrairement à l'échelle min-max, la normalisation ne lie pas les valeurs à une plage spécifique, ce qui rend plus robuste aux valeurs aberrantes.
- Écaillage de la bobine[ — utilise la plage médiane et interquartile (IQR) au lieu de l'écart moyen et standard, fournissant une résilience contre les valeurs extrêmes aberrantes qui peuvent fausser les paramètres de calibrage.
Bien que ces techniques soient critiques pour des algorithmes comme les machines vectorielles de support (SVM) et les voisins k-neareset (k-NN), qui calculent les distances entre les échantillons, leur rôle dans la performance de l'arbre de décision est plus nuancé.
Insensibilité théorique à l'échelle
D'un point de vue purement algorithmique, les arbres de décision présentent une invariance d'échelle parce que le processus de division ne fonde les décisions que sur l'ordre des valeurs de la caractéristique, et non sur leur grandeur absolue. Lorsqu'un arbre recherche le meilleur point de division t le long de la caractéristique X, il évalue les candidats de seuil qui sont des points médians entre des valeurs triées consécutives. Si nous multiplions la caractéristique par une constante — une opération de calibration commune — l'ordre des valeurs demeure inchangé, et l'ensemble des échelles de points de division candidates est proportionnel sans modifier la réduction d'impureté calculée.
Ce raisonnement théorique repose sur l'hypothèse que l'algorithme de fractionnement utilise des comparaisons exactes et que la précision des points flottants n'introduise pas d'artefacts. En pratique, les implémentations modernes, comme les et de scikit-learn, sont déterministes et produisent des arbres identiques, indépendamment de la rééchelle linéaire, à condition que le rééchelonnement ne cause pas de problèmes numériques.
Où l'échelle peut influencer la performance
Malgré l'insensibilité théorique, plusieurs scénarios pratiques révèlent que l'échelle peut affecter les résultats des arbres de décision, en particulier lorsque l'espace des caractéristiques est haute dimension, que les données sont déséquilibrées ou que les arbres sont utilisés comme composants dans des systèmes plus complexes.
Données à haute dimension
À mesure que le nombre de caractéristiques augmente, l'arbre fait face à un nombre croissant de fractions de candidats. Les caractéristiques à plus grandes plages numériques peuvent dominer par inadvertance le processus de sélection de fractions parce que leurs seuils s'étendent sur un continuum plus large, ce qui pourrait conduire à une meilleure réduction de l'impureté uniquement par hasard. Considérez un ensemble de données comportant deux caractéristiques : la caractéristique A varie de 0 à 1, et la caractéristique B varie de 0 à 1000. À tout noeud, l'arbre évalue les seuils le long des deux caractéristiques. La logique interne de l'algorithme normalise les mesures d'impureté par caractéristique, mais le nombre de fractions de candidats possibles est plus élevé pour la caractéristique B en raison de sa plus grande gamme de valeurs uniques.
De plus, dans les espaces haute dimension, l'arbre est sujet à l'ajustement excessif car il peut exploiter de nombreux seuils. L'écaillage n'empêche pas directement l'ajustement excessif, mais en supprimant l'avantage basé sur l'étendue de certaines caractéristiques, il peut conduire à des fractions plus stables et généralisables lorsqu'il est combiné avec des techniques de taille ou de régularisation.
Gammes de fonctionnalités déséquilibrées
Lorsque les caractéristiques ont des unités ou des grandeurs très différentes, l'arbre peut attribuer une importance plus élevée aux caractéristiques à plus grande échelle, même si ces caractéristiques ne sont pas réellement plus discriminantes. Cela est particulièrement problématique dans les ensembles de données combinant des mesures physiques (p. ex. température en Kelvin vs pression en pascals) ou des données financières (p. ex. revenus en millions vs taux de croissance en décimales). Bien que l'algorithme de l'arbre de décision soit fondé uniquement sur des seuils, la recherche de seuils optimaux peut être affectée par la distribution des valeurs de la caractéristique. Par exemple, une caractéristique comme «l'âge du client» de 18 à 90 offre un ensemble fini de candidats de seuil (72 points médians possibles entre les valeurs triées), alors qu'une caractéristique comme «les dépenses annuelles» de 0 à 100 000 offre beaucoup plus.
L'application de la graduation min-max à [0,1] égalise la plage numérique mais ne modifie pas le nombre de valeurs uniques par fonction. Cependant, elle change la granularité des fractions — après la graduation, les points médians de seuil pour les deux fonctions deviennent plus comparables en termes de proportion de la plage couverte. En pratique, la normalisation peut également aider en centrant les données, ce qui peut améliorer le comportement de l'heuristique de recherche interne de l'arbre dans certaines implémentations.
Méthodes de l'ensemble
Les arbres décisionnels obtiennent souvent leur meilleure performance lorsqu'ils sont regroupés en ensembles tels que les forêts aléatoires, les arbres gradués ou les arbres XGBoost. Bien que les arbres individuels soient invariants à l'échelle, la formation d'ensemble peut introduire des dépendances sur l'échelle par des mécanismes tels que le sous-échantillonnage, l'échantillonnage en colonne ou la manipulation de valeurs manquantes. Par exemple, dans les forêts aléatoires, chaque arbre est formé sur un échantillon de lignes de bootstrap et un sous-ensemble aléatoire de caractéristiques.
Les méthodes de stimulation progressive (par exemple XGBoost, LightGBM, CatBoost) intègrent des termes de régularisation supplémentaires et des taux d'apprentissage qui peuvent être sensibles à l'échelle des prédictions et des résidus. Bien que les scissions de l'arbre restent invariantes, les mises à jour de gradients pendant l'entraînement dépendent de l'ampleur des erreurs. L'échelle de la variable cible (pour la régression) ou l'utilisation de fonctions de perte robustes peuvent interagir indirectement avec l'échelle de caractéristiques.
Importance et interprétabilité des éléments
L'échelle des données influe également sur la façon dont les praticiens interprètent les résultats des arbres de décision, en particulier les scores d'importance des caractéristiques. Une mesure d'importance largement utilisée est l'importance de Gini (ou la diminution moyenne des impuretés), qui résume les réductions pondérées d'impuretés attribuables à chaque caractéristique. Parce que les caractéristiques à plus grande portée peuvent être sélectionnées plus souvent, elles peuvent gonfler artificiellement leurs scores d'importance.
Ébauche et régularisation
Les arbres de décision peuvent être taillés par élagage coût-complexité (ccp alpha in scikit-learn), qui troît la profondeur des arbres contre une classification erronée. Le processus de élagage utilise la mesure de l'impureté des sous-arbres; l'élagage ne modifie pas ces mesures directement, mais il peut affecter les sous-arbres qui sont formés lorsque les caractéristiques ont des plages différentes. En pratique, l'élagage peut réduire la taille de l'arbre optimal parce qu'il empêche le modèle de s'adapter sur des caractéristiques à large portée riches en fractions. Inversement, si l'élagage fausse la distribution d'une caractéristique très informative (par exemple, compresser les aberrations dans un petit intervalle), l'arbre pourrait manquer de scissions précieuses.
Recommandations pratiques et exemples
Selon les modèles discutés, voici des lignes directrices applicables aux chercheurs en données et aux praticiens de l'apprentissage automatique utilisant des arbres décisionnels :
- Commencez sans échelle pour des caractéristiques homogènes à faible dimension. Si vous avez moins de 10 caractéristiques, toutes sur des échelles semblables (p. ex., réponses de 1 à 5), l'échelle est inutile. L'arbre fonctionnera également bien et il évite le prétraitement des frais généraux.
- Expérience avec échelle dans les ensembles de données haute dimension. Pour les ensembles de données avec des dizaines ou des centaines de caractéristiques, surtout lorsqu'ils mélangent des unités comme l'âge, le salaire, la distance et le nombre, appliquent l'échelle ou la standardisation min-max et comparent les scores de validation croisée.
- Toujours, l'échelle est plus grande lorsque l'on utilise des méthodes d'ensemble avec de nombreuses caractéristiques. Bien que Random Forest soit robuste, l'échelle peut stabiliser la diversité des arbres et rendre l'accord hyperparamétrique moins sensible aux plages de caractéristiques.
- ]]]][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:]][FLT:]][FLT:][FLT:][FLT:][FACT:][FACT:][FACT:][FLT:][FLT:]][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:]][FACT:][FACT][FACTIVITÉ][F][F][F][F
- Utiliser une échelle robuste lorsque des valeurs aberrantes sont présentes. La normalisation est sensible aux valeurs aberrantes; une échelle robuste (en utilisant la médiane et la RQI) empêche quelques points extrêmes de compresser le reste de la gamme.
- Les choix de reproductibilité des documents Que vous échafaudiez ou non, enregistrez le pipeline de prétraitement. Si l'écaille est appliquée, assurez-vous que les mêmes paramètres (min, max, moyenne, std) sont utilisés au moment de l'inférence.
Par exemple, il faut considérer un ensemble de données sur le risque de crédit comportant des caractéristiques : l'âge (20-70 ans), le revenu (15k–2M$), le nombre de personnes à charge (0–5) et le ratio dette-revenu (0,0–1,5 ans). Sans échelle, le facteur de revenu domine les candidats divisés parce qu'il a une fourchette énorme (2 millions contre 50 ans). Un arbre de décision peut donner la priorité aux fractionnements sur le revenu et juger que d'autres caractéristiques ne sont pas pertinentes, même si elles contiennent des signaux complémentaires.
Conclusion
Les arbres de décision sont théoriquement insensibles à l'échelle linéaire des caractéristiques parce que leur logique de division repose sur des comparaisons de valeurs et non sur des distances. Cependant, cette invariance théorique ne s'étend pas de façon transparente à toutes les applications du monde réel. Dans les espaces à haute dimension, lorsque les caractéristiques ont des plages de grandeurs très différentes, ou lorsque les arbres sont combinés en ensembles, l'échelle peut améliorer la performance du modèle en éliminant les biais dans la recherche fractionnée, en favorisant un meilleur classement de l'importance des caractéristiques et en améliorant la généralisation à travers des arbres plus stables et diversifiés. Inversement, sur des ensembles de données simples et à faible dimension avec des échelles de caractéristique uniformes, l'échelle n'apporte aucun avantage et peut être omise.
Pour plus de détails, voir la documentation officielle scikit-apprendre sur les arbres de décision et la section de prétraitement[ pour les techniques de graduation. Une discussion académique approfondie peut être trouvée dans .