Table of Contents
Comprendre les modèles d'arbres décisionnels
Les arbres de décision sont une classe fondamentale d'algorithmes d'apprentissage supervisés utilisés pour les tâches de classification et de régression. Leur structure intuitive, un graphique semblable à celui des arbres de décisions et leurs conséquences possibles, les rend très interprétables. Chaque noeud interne représente un test sur une caractéristique, chaque branche correspond à un résultat du test, et chaque noeud de feuille détient un label de classe ou une prédiction numérique.
Cependant, malgré leur simplicité, les arbres de décision sont très sensibles à leur configuration. Les petits changements dans les hyperparamètres peuvent modifier considérablement la profondeur, la complexité et la capacité de généralisation de l'arbre. Sans un réglage attentif, un arbre peut sur-adapter les données de formation – mémoriser le bruit plutôt que les modèles d'apprentissage – ou être sous-adapté en étant trop peu profond pour saisir des relations significatives.
La complexité de l'accord hyperparamétrique
Les algorithmes des arbres de décision exposent plusieurs hyperparamètres qui contrôlent la façon dont l'arbre est construit.
- Profondeur maximale: Limite le nombre de niveaux dans l'arbre. Un arbre plus profond peut modéliser des interactions plus complexes mais risque de surcoller.
- Samples minimums par feuille:[ Spécifie le nombre minimum d'instances de formation nécessaires pour former un noeud foliaire.
- Échantillons minimums par fraction:[ Le nombre minimum d'échantillons nécessaires pour effectuer une fraction. Comme la contrainte foliaire, cela empêche les fractions trop granulaires.
- Maximum features:[ Contrôle le nombre de fonctionnalités considérées lors de la recherche de la meilleure division.
- Critère:[ La fonction de mesure de la qualité fractionnée, comme l'impureté ou l'entropie de Gini pour la classification, et l'erreur carrée moyenne (ESM) pour la régression.
- Splitter: Stratégie pour choisir la division à chaque nœud. La stratégie standard -Best-de évalue toutes les scissions possibles, tandis que -random-de-marée sélectionne un sous-ensemble aléatoire.
- Dérivation de l'impureté minimale :[ Un seuil de réduction de l'impureté nécessaire pour justifier une scission. Aide à tailler des branches non pertinentes.
- Équilibre la sensibilité aux déséquilibres des classes en attribuant des pénalités plus élevées aux classes minoritaires mal classées.
L'exploration manuelle de combinaisons de ces paramètres est peu pratique, surtout à mesure que les ensembles de données grandissent en taille et en dimensionnalité. Les data savants comptent souvent sur l'expérience ou l'intuition pour réduire l'espace de recherche, mais même alors, la configuration optimale peut être manquée. Le réglage manuel prend également du temps.Une seule expérience peut prendre des minutes à des heures, et des dizaines de parcours peuvent être nécessaires pour converger sur un bon modèle.
Qu'est-ce que AutoML?
Automated Machine Learning (AutoML) fait référence à un ensemble de techniques et d'outils qui automatisent le processus de bout en bout d'application de l'apprentissage automatique aux problèmes réels. Bien que la portée de AutoML puisse inclure le prétraitement des données, l'ingénierie des fonctionnalités, la sélection des algorithmes et le déploiement des modèles, son application la plus pertinente est l'optimisation des hyperparamètres et la sélection des modèles.
AutoML démocratise l'apprentissage automatique en réduisant le besoin d'expertise profonde. Les non-experts peuvent télécharger un jeu de données et recevoir un modèle de haute qualité sans paramètres d'accordage manuel. Pour les experts, AutoML accélère l'expérimentation et libère du temps pour des tâches de niveau supérieur comme l'ingénierie et l'interprétation des fonctionnalités.
Recherche de grille
La recherche par grille est la méthode de recherche la plus simple et exhaustive. L'utilisateur spécifie un ensemble de valeurs possibles pour chaque hyperparamètre, et l'outil évalue chaque combinaison. Par exemple, si nous voulons régler des échantillons de profondeur et de minimum par feuille, avec 5 valeurs chacune, la recherche par grille évalue 25 combinaisons. Bien que la recherche par grille soit simple, la recherche par grille souffre de la malédiction de dimensionnalité : à mesure que le nombre d'hyperparamètres augmente, le nombre d'évaluations explose.
Recherche aléatoire
La recherche aléatoire, introduite par Bergstra et Bengio (2012), permet d'échantillonner les valeurs d'hyperparamètre à partir de distributions définies. Plutôt que de tester toutes les combinaisons, elle sélectionne un nombre fixe de configurations aléatoires.
Optimisation bayésienne
L'optimisation bayésienne est une approche plus sophistiquée qui construit un modèle probabiliste de la fonction objective (performance du modèle) et l'utilise pour sélectionner les hyperparamètres suivants à évaluer. Les modèles de substitution communs comprennent les processus gaussiens, les forêts aléatoires et les estimateurs Parzen structurés par arbres (TPE). L'optimisation bayésienne équilibre l'exploration (test de régions inconnues) et l'exploitation (raffinage à proximité des bons points connus).
Autres méthodes avancées
Au-delà de ces techniques de base, les outils AutoML intègrent :
- Algorithmes évolutionnaires (p. ex., programmation génétique) qui évoluent une population de modèles au fil des générations.
- Hyperband et Successive Halving[, qui allouent dynamiquement des ressources aux configurations prometteuses et aux configurations pauvres à terme précoce.
- Recherche d'architectures neurales (NAS)[ pour l'apprentissage profond, bien que moins pertinent pour les arbres décisionnels.
- Sélection dans laquelle AutoML combine automatiquement plusieurs modèles pour améliorer les performances.
Cadres populaires pour les arbres décisionnels
Plusieurs plateformes ouvertes et commerciales AutoML incluent des algorithmes d'arborescence de décision dans leur espace de recherche. Voici les plus importants:
Fermeture automatique
Auto-sklearn est un substitut de l'apprentissage scikit. Il utilise l'optimisation bayésienne avec méta-apprentissage pour réchauffer la recherche. Il évalue une large gamme de classificateurs et de régresseurs, y compris les arbres de décision, les forêts aléatoires, les machines de stimulation de gradient, et plus encore. Pour les arbres de décision en particulier, Auto-sklearn accorde profondeur, critère de division, scintilles minimums, et d'autres paramètres. Il effectue également le prétraitement des caractéristiques et construit un ensemble des meilleurs modèles. L'outil est bien documenté et s'intègre parfaitement à l'écosystème Python.
H2O AutoML
La plateforme H2O=S AutoML est conçue pour l'évolutivité et l'utilisation par les entreprises. Elle gère une série d'algorithmes comprenant des arbres de décision, des forêts aléatoires, XGBoost, LightGBM et un apprentissage profond, puis forme un modèle Stacked Ensemble pour les combiner. L'accordage hyperparamétrique est effectué par recherche aléatoire et recherche de grille sur des plages de paramètres prédéfinies.
TPOT
TPOT (Tree-based Pipeline Optimization Tool) est un système AutoML basé sur la programmation génétique. Il évolue sur des pipelines d'apprentissage automatique entiers, y compris la sélection des fonctionnalités, le prétraitement et le choix de modèles. Les arbres de décision sont l'un des apprenants de base que TPOT peut sélectionner. Sa recherche évolutive produit de nouvelles combinaisons qui surpassent souvent les pipelines conçus manuellement. TPOT est disponible en Python package et est particulièrement populaire dans les milieux éducatifs et de recherche.
Google Cloud AutoML
Google Cloud AutoML fournit un service géré pour la construction de modèles personnalisés avec un minimum d'effort. Bien que l'architecture sous-jacente ne soit pas documentée publiquement, il est connu pour inclure des modèles basés sur des arbres comme les arbres dégradés boostés pour les données tabulaires. La plate-forme gère le fractionnement des données, le réglage hyperparamétrique et le déploiement automatiquement.
AutoGluon
Développé par Amazon, AutoGluon se concentre sur la simplicité et la robustesse. Il forme automatiquement plusieurs modèles, y compris les arbres de décision, et les combine en un ensemble. Son outil de prévision tabulaire automatisé est connu pour produire des résultats de pointe sur de nombreux ensembles de données de référence avec peu d'entrée utilisateur. AutoGluon utilise une combinaison d'optimisation bayésienne et de empilage pour affiner les modèles.
Étape par étape : utiliser AutoML pour régler un arbre de décision
Pour illustrer le processus, envisagez une tâche de classification binaire à l'aide de l'ensemble de données UCI Heart Disease classique. L'objectif est de prédire la présence de maladies cardiaques en fonction d'attributs tels que l'âge, le cholestérol et le type de douleur thoracique.
1. Préparer les données
Nettoyer l'ensemble de données, gérer les valeurs manquantes et coder les variables catégorisées. La plupart des outils AutoML effectuent ces étapes automatiquement ou fournissent des paramètres pour les contrôler. Par exemple, dans H2O AutoML, vous pouvez spécifier des colonnes catégorisées et l'outil gérera l'encodage.
2. Choisir un cadre autoML
Pour les utilisateurs de Python, Auto-sklearn ou TPOT sont des choix légers. Pour les ensembles de données plus importants ou les besoins de production, H2O AutoML ou AutoGluon sont préférables.
3. Configurer la recherche
Définir l'espace de recherche pour les hyperparamètres de l'arborescence de décision. De nombreux cadres fournissent des plages par défaut. Par exemple, Auto-sklearn définit automatiquement des plages pour , , , etc. Vous pouvez éventuellement restreindre ou élargir ces plages en fonction de connaissances antérieures.
4. Exécuter le processus AutoML
Exécutez la recherche. Le cadre formera et évaluera les modèles d'arbres de décision dans l'espace hyperparamétrique. Il enregistre les mesures de performance (par exemple, ASC, précision, F1) sur un ensemble de validation. Les outils avancés utilisent également la validation croisée pour réduire le surajustement. Vous pouvez surveiller les progrès; certains outils fournissent des classements en direct.
5. Évaluer le meilleur modèle
Une fois terminé, vérifiez la configuration de l'arbre de décision qui se fait le mieux. Vérifiez ses performances sur un ensemble de tests de rétention. Visualisez la structure de l'arbre pour assurer la préservation de l'interprétation, des arbres profonds avec des milliers de nœuds peuvent être moins interprétables. Si le meilleur modèle est une forêt aléatoire ou un ensemble stimulant le gradient, considérez l'équilibre entre précision et expliquabilité.
6. Déploiement ou raffinage
Exportez le modèle dans un format de production (p. ex. PMML, ONNX ou cornichon). Vous pouvez aussi affiner votre recherche en concentrant la recherche sur une gamme plus étroite autour des meilleurs paramètres, ou en intégrant les étapes d'ingénierie des fonctions découvertes par le processus AutoML.
Avantages de l'automatisation de la sélection de l'arbre de décision
- Efficacité du temps: AutoML peut explorer des milliers de configurations en parallèle, en complétant en heures ce qui pourrait prendre des semaines de scientifiques de données manuelles.
- Performance supérieure: La recherche automatisée découvre souvent des combinaisons d'hyperparamètres qui manquent de réglage manuel, ce qui entraîne une précision, une précision ou un rappel plus élevés.
- Réduction du biais humain:[ Les scientifiques en données peuvent avoir des préférences pour certains paramètres par défaut (p. ex., une habitude de définir max profondeur=10). AutoML explore l'espace sans de tels biais.
- Reproductibilité : Les workflows AutoML peuvent être contrôlés en version et ré-exécutés avec la même graine aléatoire, donnant des résultats identiques – critiques pour les pistes de vérification et la conformité réglementaire.
- Accessibilité[: Les non-experts peuvent construire des modèles d'arbres décisionnels efficaces sans connaissance approfondie de l'accordage hyperparamétrique, rendant l'apprentissage automatique plus accessible à l'ensemble des organisations.
- Ingénierie automatique des fonctionnalités[: Certains outils AutoML génèrent également de nouvelles fonctionnalités (p. ex., combinaisons polynômes, binning) qui améliorent la performance de l'arbre de décision, quelque chose de manuel d'accordage néglige typiquement.
Limites et considérations
Malgré ses avantages, AutoML n'est pas une panacée. Comprendre ses limites aide à fixer des attentes réalistes.
Coût informatique
AutoML peut être une source de ressources. L'exécution de centaines d'évaluations de modèles sur de grands ensembles de données nécessite un temps et une mémoire CPU/GPU importants. Les solutions basées sur le cloud aident, mais les coûts peuvent s'additionner.
Risque de suradaptation
Lorsque AutoML effectue une recherche dans un grand espace, il peut trouver une configuration qui fonctionne bien sur les données de validation mais échoue sur les données invisibles. Ceci est atténué par l'utilisation de la validation croisée, mais le problème reste si la recherche est trop agressive. Certains cadres implémentent une régularisation supplémentaire ou préfèrent des modèles plus simples par des pénalités parsimony.
Perte d'interprétation
Les arbres décisionnels offrent naturellement une interprétabilité, mais lorsque AutoML choisit un arbre extrêmement profond ou un ensemble complexe, l'interprétation devient difficile. Si l'interprétation est une exigence stricte, vous devrez peut-être limiter la recherche à des modèles plus simples ou utiliser des méthodes d'explication post-hoc comme SHAP.
Dépendance à l'égard de la qualité des données
AutoML ne répare pas les problèmes de données fondamentaux. Garbage dans, déchets s'applique. Si l'ensemble de données a des étiquettes bruyantes, un déséquilibre de classe sévère, ou trop peu d'échantillons, aucune quantité de réglage hyperparamétrique ne produira un bon modèle. Préprocédez soigneusement les données avant de les alimenter à AutoML.
Boîte noire Nature
Les techniques avancées de l'AutoML (par exemple, optimisation bayésienne, programmation génétique) peuvent être opaques. La compréhension des raisons pour lesquelles une configuration particulière a été choisie peut être incertaine, ce qui peut entraver la confiance dans la production.
Intégration dans les MLOps et les flux de travail de production
Automatiser la sélection de modèles avec AutoML s'intègre naturellement dans un pipeline MLOps mature. L'étape AutoML peut être déclenchée chaque fois que de nouvelles données sont recueillies, des modèles de recyclage sur un calendrier ou lors de la détection de la dérive des données. De nombreux outils AutoML exportent des modèles dans des formats standard qui peuvent être servis via les API REST ou intégrés dans des systèmes logiciels plus grands.
Il est important de coupler AutoML avec un suivi d'expérience robuste. Des outils comme MLflow ou Neptune peuvent enregistrer toutes les combinaisons d'hyperparamètres et les mesures de performance, permettant une auditabilité et une comparaison entre les différents essais. Le contrôle de la version des données et du code combiné avec l'infrastructure comme code (par exemple Docker, Kubernetes) garantit que le processus AutoML est reproductible et évolutif.
Orientations futures
Le champ d'AutoML continue de progresser. Meta-learning, où les modèles apprennent des expériences passées à chaud-démarrer de nouvelles, est déjà utilisé par des cadres comme Auto-Sklearn. Les améliorations futures peuvent inclure des méthodes d'optimisation multifidélité plus efficaces, l'ingénierie automatisée des fonctionnalités liées à la sélection des modèles, et l'intégration avec l'inférence causale.
De plus, l'AutoML fédéré est en train de se développer, permettant de modéliser les ensembles de données distribués sans centraliser les données sensibles, particulièrement pour les soins de santé et les finances, où les arbres décisionnels sont communs et où les règles de confidentialité des données sont strictes.
Conclusion
En utilisant des algorithmes de recherche tels que l'optimisation bayésienne, la recherche aléatoire et les techniques évolutives, les praticiens peuvent rapidement identifier les configurations d'hyperparamètres qui maximisent les performances tout en économisant d'énormes quantités de travail manuel. Les cadres tels que Auto-Sklearn, H2O AutoML, TPOT et AutoGluon rendent ces modèles accessibles aux novices et aux experts, et leur intégration dans les pipelines MLOps garantit que les modèles restent à jour et fiables au fil du temps.
Malgré les coûts de calcul et la nécessité d'une validation minutieuse, les avantages – gains d'exactitude, économies de temps, reproductibilité et démocratisation – l'emportent nettement sur les inconvénients. À mesure que la technologie AutoML arrive à maturité, elle deviendra une composante indispensable de chaque outil d'apprentissage automatique, en particulier pour les modèles d'arbre interprétables qui demeurent fondamentaux dans de nombreuses industries.
Pour en savoir plus sur l'optimisation des hyperparamètres et les cadres AutoML, consultez la documentation officielle de Auto-sklearn[, H2O AutoML et TPOT[.