Présentation

Les algorithmes des arbres de décision demeurent une pierre angulaire de l'apprentissage automatique pour les tâches de classification et de régression en raison de leur structure intuitive, de leur interprétabilité et de leur capacité à modéliser des relations non linéaires. Cependant, les ensembles de données du monde réel sont rarement vierges; ils contiennent souvent des valeurs manquantes causées par les défaillances des capteurs, les erreurs humaines, les problèmes d'intégration des données ou les redactions motivées par la vie privée.

Comprendre les données manquantes

Les données manquantes ne constituent pas un problème uniforme, mais la stratégie de traitement appropriée dépend du mécanisme qui a créé le manque de données. Les statisticiens ont classé les données manquantes en trois types distincts, chacun ayant des implications différentes pour l'analyse.

Manquant complètement au hasard (MCAR)

Dans le cadre du MCAR, la probabilité qu'une valeur soit manquante est entièrement indépendante des données observées et non observées. Par exemple, un instrument de laboratoire échoue parfois à des intervalles aléatoires sans rapport avec l'échantillon examiné, ou un répondant de l'enquête saute accidentellement une question. Le MCAR est le type le plus facile à traiter analytiquement parce que les données observées restent un échantillon aléatoire représentatif de l'ensemble de données complet.

Manquant au hasard (MAR)

Par exemple, dans un ensemble de données sur les risques de crédit, le revenu peut être plus vraisemblablement manquant pour les jeunes demandeurs (âge observé) mais, compte tenu de l'âge, le revenu manquant ne dépend pas du niveau de revenu réel. De nombreuses méthodes d'imputation standard supposent que le revenu est un revenu, et des techniques comme l'imputation multiple ou l'estimation maximale de la probabilité demeurent valides dans cette hypothèse.

Non-aléatoire (MNAR)

Dans le cas du MNAR, la probabilité de manque est liée à la valeur non observée elle-même. Un exemple classique est dans les enquêtes salariales : les personnes à revenu élevé peuvent refuser de divulguer leurs gains, ce qui signifie que la déficience est directement liée à la valeur manquante (revenu). Le MNAR est le scénario le plus difficile car les valeurs manquantes ne peuvent être estimées de façon fiable sans des informations externes ou des techniques de modélisation spéciales (p. ex. modèles de sélection ou modèles de mélange de motifs).

Identification des modèles de données manquants

Avant de choisir une méthode de manipulation, les praticiens devraient explorer le modèle de manque dans leur ensemble de données.

  • – Visualiser la proportion de valeurs manquantes par fonction et par échantillon.
  • Essais MCAR de faible durée – test statistique formel qui indique si le MCAR est plausible.
  • Statistiques de manque de groupe[ – calculer la moyenne des caractéristiques observées selon qu'une autre caractéristique est manquante; de grandes différences suggèrent une MR ou une MNAR.

Comprendre le mécanisme jette les bases pour choisir une stratégie d'imputation ou de modélisation appropriée.

Conséquences de l'ignorance des données manquantes

De nombreuses approches naïves – comme la suppression listwise (simplement supprimer les lignes avec une valeur manquante) ou la suppression pair- sont toujours utilisées dans la pratique, mais elles comportent des coûts considérables:

  • Taille réduite de l'échantillon[ – la suppression par liste peut jeter une grande fraction des données, en particulier avec de nombreuses fonctionnalités, conduisant à une variance élevée et une faible puissance statistique.
  • – Si la non-disponibilité n'est pas MCAR, l'échantillon retenu n'est plus représentatif. Ce biais se propage directement en divisions d'arbres décisionnels, provoquant des seuils incorrects et une pureté sous-optimale des nœuds.
  • Perte d'information[ – les caractéristiques avec des valeurs manquantes peuvent être exclues de la logique de fractionnement, gaspillant le signal prédictif qui aurait pu être utilisé par des fractions de substitution ou par imputation.
  • Manipulation incohérente à travers les arbres – des méthodes d'ensemble comme des forêts aléatoires peuvent traiter les valeurs manquantes différemment dans chaque arbre de base, donnant des prédictions instables.

Un traitement de données manquant bien conçu améliore à la fois l'exactitude et la fiabilité, en particulier dans les applications à forte consommation telles que le diagnostic médical, l'évaluation des risques financiers et l'entretien prédictif.

Méthodes traditionnelles d'imputation

L'imputation – en remplissant les valeurs manquantes avec des valeurs estimées – est l'approche la plus utilisée. Le choix de la méthode d'imputation dépend du type de données, du mécanisme de manque et du budget de calcul.

Imputation simple Univariée

Les techniques les plus simples remplacent une valeur manquante par la moyenne, la médiane ou le mode des valeurs observées pour cette caractéristique. Bien que rapides, ces méthodes ignorent les corrélations entre les caractéristiques et tendent à réduire la variance, gonfler artificiellement la confiance du modèle. L'imputation moyenne n'est appropriée que sous MCAR et pour les caractéristiques avec des distributions à peu près symétriques; l'imputation médiane est plus robuste aux valeurs aberrantes. L'imputation du mode est utilisée pour les caractéristiques catégoriques mais peut introduire un biais si la catégorie dominante n'est pas représentative.

Imputation de régression

Une régression linéaire est adaptée aux entrées observées et utilisée pour prédire les dernières. Cela préserve les relations entre les variables mais suppose une linéarité et peut conduire à une sur-adaptation si les mêmes données sont utilisées pour l'imputation et la formation des modèles. Des versions plus avancées utilisent des méthodes itératives comme les équations enchaînées (MICE) qui passent par les caractéristiques jusqu'à la convergence.

k‐Les voisins les plus proches (KNN) Imputation

L'imputation KNN trouve les k les plus similaires échantillons complets (par distance sur les caractéristiques observées) et les moyennes (ou prend un vote majoritaire pour) leurs valeurs. Il capture naturellement les dépendances non linéaires et fonctionne bien avec des types de données mixtes. Les principaux inconvénients sont le coût de calcul pour les ensembles de données volumineux et la sensibilité au choix de k et de la métrique de distance.

Imputation multiple

Plusieurs imputations (p. ex., utilisant l'algorithme MCMC ou MICE) génèrent plusieurs ensembles de données complets en imputant des valeurs d'un modèle statistique qui incorpore l'incertitude. L'analyste adapte ensuite un arbre de décision à chaque ensemble de données imputé et regroupe les résultats (p. ex., en calculant les probabilités prévues ou en utilisant les règles Rubin). Cette approche reflète bien l'incertitude d'imputation et est robuste en vertu du MAR.

Limitations de l'imputation simple

Aucune méthode d'imputation n'est une panacée. L'imputation simple peut fausser la distribution conjointe des caractéristiques, ce qui rend plus difficile pour les arbres de décision de trouver des fractions propres. De plus, l'imputation est une étape de prétraitement séparée de l'induction des arbres; l'algorithme de l'arbre ne sait pas qu'une valeur a été imputée. Cela peut conduire à des estimations de performance trop optimistes si l'imputation n'est pas validée de façon appropriée dans une boucle de validation croisée.

Les fractions de substitution dans les arbres décisionnels

Plutôt que de pré-traitement des données, certains algorithmes d'arbre de décision – notamment le CART original (Classification et Arbres de régression) – gèrent les valeurs manquantes nativement en utilisant scissions de substitution.Cette technique est élégante parce qu'elle tire parti de la structure de l'arbre elle-même pour traiter les lacunes sans modifier les données brutes.

Comment fonctionne la séparation de substitution

Lorsqu'il s'agit de construire un arbre, l'algorithme sélectionne le meilleur partage à un nœud en fonction de toutes les valeurs non manquantes de la fonction primaire (p. ex., = revenu > $50 000). Il recherche alors une ou plusieurs caractéristiques de substitution qui imite le mieux cette division. Une fraction de substitution est définie par une caractéristique différente (p. ex., =niveau d'éducation = diplômé du collège) qui, lorsqu'elle est utilisée sur le sous-ensemble de données où le revenu est observé, produit une partition aussi semblable que possible à la fraction primaire.

Avantages et inconvénients

Les scissions de substitution ont l'avantage majeur de ne pas exiger d'imputation – l'arbre apprend de toutes les données disponibles sans fabriquer de valeurs. Elles préservent également les relations conditionnelles apprises pendant la construction de l'arbre. Cependant, la technique exige que certaines caractéristiques corrélées existent pour servir de substituts; si la caractéristique manquante n'a pas de corrélation forte, les scissions de substitution deviennent faibles et l'arbre peut encore perdre de la précision pour les entrées manquantes. De plus, de nombreuses implémentations modernes (p. ex. scikit‐learn=s ) ne prennent pas supportent les scissions de substitution hors de la boîte – elles sont principalement présentes dans le paquet R=s et dans certains logiciels commerciaux.

Approches fondées sur le modèle et algorithmes modernes

Ces dernières années, on a assisté à l'augmentation des cadres de stimulation des gradients qui intègrent directement le traitement de la valeur manquante dans l'algorithme d'apprentissage, ce qui surpasse souvent les fractions d'imputation et de substitution dans les performances prédictives.

XGBoost

XGBoost (Extreme Gradient Boosting) apprend à gérer les valeurs manquantes pendant l'entraînement en traitant la perte comme un signal clairsemé. À chaque fraction, l'algorithme évalue à la fois une direction par défaut pour les données manquantes (enfant gauche ou droit) et la valeur par division optimale sur les entrées observées. La direction par défaut est choisie pour minimiser la fonction de perte, en apprenant efficacement si les échantillons manquants ont tendance à aller à gauche ou à droite. Cette approche n'exige aucune imputation et est très efficace parce que les valeurs manquantes sont représentées comme des matrices clairsemées, en sauvegardant la mémoire.

LumièreGBM

LightGBM prend une autre voie : il traite les valeurs zéro et manquantes comme un seul groupe (par défaut) et optimise la direction de fractionnement pour ce groupe. Pendant l'entraînement, il apprend si les échantillons manquants appartiennent à l'enfant gauche ou droit d'une fraction. Comme XGBoost, il ne nécessite pas d'imputation et gère efficacement les données peu abondantes.

Booste de chat

CatBoost (Categorical Boosting) utilise un mécanisme légèrement différent : il traite les valeurs manquantes comme une catégorie distincte et permet à l'arbre de décider quand se diviser sur cette catégorie. Pour les caractéristiques numériques, les valeurs manquantes sont initialement assignées à un détenteur de place (p. ex. −1) et l'arbre trouve une division optimale basée sur ce traitement. CatBoost est particulièrement fort pour les ensembles de données avec des caractéristiques catégoriques et peut gérer des motifs semblables à MNAR en créant une logique séparée de chemin de feuille pour la disparition.

Mise en œuvre de la gestion des données manquante dans la pratique

Le choix d'une stratégie dépend de l'outillage, de la taille des données et du modèle de manque. Voici un workflow structuré qui intègre les techniques discutées.

  1. Évaluer la non-disponibilité – calculer le pourcentage de valeurs manquantes par fonction et par échantillon. Si une fonction a >90% manquant, envisager de la laisser tomber à moins que la connaissance du domaine ne soit forte. Visualiser les corrélations entre les indicateurs de non-disponibilité et les caractéristiques observées à l'aide d'un test de carte thermique ou d'un test χ2.
  2. Identifier le mécanisme – appliquer le test MCAR Little=S si l'échantillon est suffisamment grand. Si le MCAR est plausible, la suppression par liste peut être acceptable pour les petites lacunes (<5 %). Pour le MCAR ou le MCAR avec une absence modérée, une imputation ou une manipulation basée sur le modèle est plus sûre.
  3. Sélectionnez une méthode basée sur votre cadre:
    • Si vous utilisez des arbres de décision de sklearn (aucun support manquant intégré), utilisez un ordinateur (p. ex. ou ) à l'intérieur d'un et accordez la stratégie d'imputation par validation croisée.
    • Si vous utilisez XGBoost/LightGBM/CatBoost, aucune imputation n'est nécessaire – passez simplement les données avec des valeurs ; les cadres les géreront. C'est souvent l'approche la plus simple et la plus efficace.
    • Si vous utilisez R-S , activez le paramètre pour activer les fractions de substitution.
  4. Les hyperparamètres Tune qui affectent la manipulation manquante – pour XGBoost, les et peuvent influencer les choix de branches de valeur manquante. Pour CatBoost, contrôle la façon dont les valeurs numériques manquantes sont traitées (comme une classe ou une estimation).
  5. Valider correctement – inclure toujours la manipulation des données manquantes dans une boucle de validation croisée (p. ex., imputation avant la fraction train/essai pour éviter les fuites de données). Comparez les performances des différentes méthodes sur les mêmes plis pour assurer une signification statistique.

Meilleures pratiques et pièges communs

  • N'imputez pas la variable cible – l'imputation de la cible dans un contexte supervisé biaise le signal d'apprentissage. Au lieu de cela, exclure ou traiter la non-utilisation de la cible comme un problème de modélisation distinct (p. ex. traiter comme une classe supplémentaire).
  • Utiliser les connaissances du domaine – dans de nombreux domaines, la disparition elle-même a un sens. Par exemple, un test de laboratoire manquant pourrait indiquer que le médecin ne suspectait pas une condition, fournissant des informations utiles.
  • Attention aux données peu nombreuses à haute dimension – si la plupart des caractéristiques ont des entrées manquantes fréquentes, l'imputation peut devenir très incertaine.Dans de tels cas, utiliser des méthodes basées sur les arbres avec une manipulation intégrée (XGBoost ou LightGBM) qui traitent le manquant comme une direction distincte.
  • emble de modèles d'imputation – pour les applications critiques, envisager d'utiliser plusieurs imputations et de calculer des arbres de décision sur des ensembles de données imputés (c.-à-d. plusieurs imputations + ensemble).
  • – le profil de manque peut changer au fil du temps (dérision de concept).

Conclusion

Missing data is an inevitable reality in machine learning, and decision tree algorithms are no exception. The appropriate handling strategy depends on the missingness mechanism, the chosen tooling, and the performance requirements. Basic imputation (mean, median, KNN, MICE) remains widely applicable but must be integrated carefully into the modeling pipeline to avoid leakage. Surrogate splits offer a principled, model‑based alternative, though their availability is limited to certainLes cadres modernes de boostage des gradients – XGBoost, LightGBM et CatBoost – ont établi une nouvelle norme en apprenant des directions optimales de valeur manquante de bout en bout, donnant souvent une précision prédictive supérieure sans prétraitement. Finalement, la meilleure pratique est d'évaluer systématiquement plusieurs méthodes sur un ensemble de validation, en utilisant les connaissances du domaine pour affiner le choix. En traitant les données manquantes comme une source d'information précieuse plutôt que comme une nuisance, les praticiens peuvent construire des modèles d'arbre de décision à la fois précis et fiables.

Pour plus de détails : Les données manquantes – Wikipedia couvrent la théorie statistique ; scikit-learn documentation d'imputation fournit des détails de mise en œuvre ; et le tutoriel XGBoost manque value offre un exemple de code de manipulation native