Comprendre le modèle Interpretabilité dans l'apprentissage automatique

Lorsqu'ils construisent un modèle prédictif, les data savants font face à un compromis fondamental entre précision et interprétabilité. Un modèle qui obtient des performances prédictives élevées mais ne peut expliquer ses décisions est souvent rejeté dans les industries réglementées, tandis qu'un modèle transparent peut sacrifier certaines performances mais gagner la confiance des parties prenantes. Deux algorithmes classiques qui illustrent cette tension sont des arbres de décision et des machines vectrices de soutien (SVM).

L'interprétation dans l'apprentissage machine se réfère au degré auquel un humain peut comprendre la cause de la prédiction d'un modèle. Ce n'est pas une propriété binaire mais un continuum. Les modèles qui sont intrinsèquement interprétables — souvent appelés modèles de «boîte de verre» — permettent aux utilisateurs de tracer le raisonnement étape par étape. Les modèles de boîte noire, par contre, produisent des prédictions qui sont difficiles à expliquer sans outils auxiliaires.

Arbres de décision : Les champions de la boîte de verre

Un arbre de décision est un algorithme d'apprentissage supervisé qui divise l'espace de la fonction en régions en utilisant une série de décisions binaires. Chaque noeud interne de l'arbre teste la valeur d'une seule fonctionnalité, chaque branche représente le résultat du test, et chaque noeud de feuille contient une étiquette prédite ou une distribution de probabilité. La structure résultante est un diagramme de flux qui peut être suivi de racine en feuille, rendant la logique du modèle complètement transparente.

Par exemple, considérez un arbre qui prédit si un patient a une maladie donnée. Le premier noeud pourrait tester si l'âge du patient est supérieur à 60 ans, le suivant pourrait tester si la pression artérielle dépasse un seuil, etc. Toute personne peut tracer le chemin et voir exactement quelles conditions ont conduit au diagnostic. Cette transparence est la principale raison pour laquelle les arbres de décision sont l'algorithme de go-to dans les domaines où l'explication est aussi importante que la prédiction, comme la médecine, les banques et la conformité légale.

Comment les arbres de décision sont construits

À chaque étape, l'algorithme sélectionne la fonction et le point de partage qui sépare le mieux les données selon un critère de pureté — généralement l'impureté ou l'entropie de Gini pour la classification, et l'erreur carrée moyenne pour la régression. La division se poursuit jusqu'à ce qu'une condition d'arrêt soit remplie, comme une profondeur maximale d'arbre, un nombre minimum d'échantillons par feuille, ou lorsque aucune amélioration supplémentaire n'est possible.

L'un des principaux avantages de ce processus est qu'il traite naturellement les caractéristiques numériques et catégoriques, il est invariant aux transformations monotoniques des caractéristiques, et il peut capturer des relations non linéaires sans exiger de l'utilisateur d'inventorier les termes d'interaction.

Avantages des arbres de décision pour l'interprétation

  • Représentation visuelle[: L'arbre peut être dessiné et inspecté directement. Même les non-experts peuvent comprendre un arbre avec un nombre modéré de nœuds.
  • Importance de la caractéristique[: En comptant combien de fois une caractéristique est utilisée pour la division et combien d'impuretés elle réduit, on peut dériver des paramètres d'importance de la caractéristique globale.
  • Explications locales : Pour toute prédiction individuelle, le chemin de la racine à la feuille fournit une explication précise, basée sur des règles.
  • Aucun besoin d'échelle de données[: Les arbres de décision ne sont pas affectés par les différences dans les échelles de caractéristiques, ce qui simplifie le pipeline de prétraitement.
  • Types de données mélangés: Ils peuvent gérer des variables continues, ordinales et nominales nativement.

Limites des arbres décisionnels

Malgré leur transparence, les arbres de décision présentent des faiblesses bien connues. Ils sont enclins à superfiting[, surtout lorsqu'ils sont cultivés à pleine profondeur. Un arbre qui mémorise les données de formation se généralisera mal aux nouvelles observations.

Les arbres de décision sont également non stables: un petit changement dans les données d'entraînement peut produire une structure d'arbre complètement différente. Cette variance peut saper la confiance, parce que deux modèles formés sur des ensembles de données similaires peuvent donner des explications divergentes.

Ensembles et coût de l'intérim

Pour surmonter les faiblesses de chaque arbre, on utilise couramment des méthodes d'ensemble comme les forêts aléatoires et les arbres gradués. Ces méthodes combinent de nombreux arbres pour obtenir une précision et une robustesse plus élevées. Cependant, l'interprétation d'un seul arbre est perdue : l'ensemble de centaines ou de milliers d'arbres devient une boîte noire, même si chaque arbre constituant est transparent.

Néanmoins, les modèles d'ensemble peuvent encore fournir un certain niveau d'explication par l'importance des caractéristiques (p. ex., l'importance de la permutation, les valeurs SHAP, les placettes de dépendance partielle).Ces explications post-hoc ne sont pas aussi directes que suivre un seul chemin, mais elles peuvent rapprocher le comportement global du modèle.

Support Vecteurs Machines: Puissance au prix de la transparence

Les machines vectorielles de soutien sont une classe de modèles d'apprentissage supervisés qui trouvent une séparation optimale de l'hyperplan entre les classes. L'idée principale est de maximiser la marge — la distance entre l'hyperplan et les points de données les plus proches de chaque classe, appelés vecteurs de soutien.

Pour les données linéairement séparables, la fonction de décision est une combinaison linéaire de caractéristiques : . Le signe de détermine la classe prédite. Le vecteur de poids est déterminé uniquement par les vecteurs de support, ce qui rend le modèle clairsemé : seul un sous-ensemble de points d'entraînement influence la limite de décision. Cette sparté est parfois citée comme un avantage d'interprétation, parce que les vecteurs de support "résument" les données, mais dans la pratique, il est difficile d'interpréter la signification d'un vecteur de poids haute dimension.

Les limites du trick et des non-linéaires du noyau

La vraie puissance des SVM provient du kernel. En masquant les données d'entrée dans un espace de fonctionnalités plus grand dimension utilisant une fonction du noyau, les SVM peuvent apprendre des limites de décision non linéaires complexes tout en résolvant un problème d'optimisation convexe. Les noyaux communs comprennent le noyau polynôme, le noyau de base radiale (RBF) et le noyau sigmoïde.

Lorsqu'un noyau non linéaire est utilisé, la fonction de décision devient une somme d'évaluations du noyau entre le point d'essai et les vecteurs de support : . Les poids αi peuvent être positifs ou négatifs, et le noyau K peut n'avoir aucune interprétation intuitive dans l'espace de la fonctionnalité d'origine. C'est là que l'interprétation est perdue. Un humain ne peut pas facilement voir pourquoi un point particulier est classé d'une certaine manière, parce que la limite de décision vit dans un espace transformé qui n'a pas de sens direct.

Avantages des machines vectorielles de soutien

  • Haute précision dans les espaces haute dimension[: Les SVM fonctionnent bien lorsque le nombre de caractéristiques dépasse le nombre d'échantillons, comme dans la classification de texte ou l'analyse de l'expression génétique.
  • Robust aux aberrations: La variante de la marge molle pénalise les erreurs de classification avec un paramètre de compromis C, et seuls les vecteurs de support sont importants. Les valeurs aberrantes qui sont loin de la marge n'ont aucune influence à moins qu'elles ne deviennent des vecteurs de support.
  • Compatibilité du noyau[: Avec un noyau approprié, les SVM peuvent modéliser des limites de décision très complexes.
  • Sparse solution[: Le modèle ne dépend que des vecteurs de support, rendant la prédiction relativement efficace si le nombre de vecteurs de support est faible.

Inconvénients pour l'interprétation

Même avec un noyau linéaire, l'interprétation du vecteur w nécessite une expertise de domaine; l'ampleur et le signe de chaque coefficient ne correspondent pas à des seuils de décision simples comme ceux d'un arbre. Pour les noyaux non linéaires, le modèle est essentiellement une boîte noire. De plus, les SVM ne fournissent pas de sorties probabilistes nativement (bien que l'échelle Platt puisse être appliquée).

Les MVS nécessitent également un prétraitement minutieux: toutes les caractéristiques doivent être étalonnées sur des gammes similaires, généralement par standardisation ou par échelle min-max, car la marge est sensible aux échelles de caractéristiques. Cela ajoute une étape supplémentaire qui complique l'interprétation. De plus, le réglage des hyperparamètres — en particulier le choix du noyau et le paramètre de régularisation C — exige une validation croisée et une connaissance du domaine, et le comportement du modèle résultant peut changer radicalement avec de petits ajustements de paramètres.

Les MVS peuvent-ils être rendus plus compréhensibles?

Plusieurs techniques existent pour améliorer l'interprétation des MVS. Pour les MVS linéaires, les coefficients de poids peuvent être inspectés comme des éléments importants, surtout si les éléments sont sur la même échelle. Les analystes peuvent examiner les plus grands poids positifs et négatifs pour comprendre ce qui motive la classification. Cependant, cette approche devient peu fiable lorsque les éléments sont corrélés.

Pour les MVS non linéaires, les méthodes d'explication post-hoc comme LIME (Explications locales d'un modèle d'interprétation-agnostique) ou SHAP (Explanations additives de SHapley) peuvent approximationner la limite de décision locale autour d'une prédiction.Ces méthodes créent un modèle de substitution simple (p. ex. un modèle linéaire ou un arbre de décision) qui imite le MVS dans une région locale.

Une autre approche consiste à former un arbre de décision sur les vecteurs de support seuls, ou à utiliser le SVM pour préfilter les caractéristiques, puis à construire un modèle transparent sur l'ensemble réduit de caractéristiques. Ces hybrides échangent une certaine précision pour améliorer l'interprétation.

Comparaison entre les arbres de décision et les MVS

Aspect Decision Trees Support Vector Machines
Interpretability Very high, glass box Low to moderate, black box
Accuracy Good, but prone to overfitting Often better on complex datasets
Scalability Scales well with features and data; can handle millions of samples Scales poorly with large data (O(n³) or worse with nonlinear kernels)
Handling non-linearity Natively through splits Through kernel trick, but kernel selection is non-trivial
Missing data Can handle natively with surrogate splits Requires imputation or removal
Feature scaling Not required Critical for performance
Probability estimates Directly from leaf frequencies Requires calibration (e.g., Platt)
Robustness to outliers Moderate; outliers can create deep branches High (with soft-margin)
Parameter tuning Depth, min samples per leaf, etc. Kernel choice, C, gamma, etc.
Memory usage Low (tree structure) Moderate to high (stores support vectors)

Quand choisir un arbre de décision

Les arbres décisionnels sont le choix préféré lorsque l'interprétation est non négociable. Les scénarios communs comprennent:

  • Santé[ : Les médecins et les régulateurs doivent comprendre pourquoi un modèle prédit une maladie. Un arbre avec un petit nombre de chemins peut être examiné par un conseil médical.
  • Notement des frais et du crédit[: Les prêteurs doivent expliquer leurs décisions de crédit aux clients et aux auditeurs.
  • : Les décisions automatisées ayant des conséquences juridiques doivent être vérifiables. Un arbre de décision peut être imprimé et examiné devant le tribunal.
  • Analyse des données exploratoires: Les arbres fournissent un résumé rapide et visuel de la plupart des caractéristiques et de leur interaction.
  • Taille faible à modérée des données[ : Lorsque l'ensemble de données n'est pas énorme et que l'objectif est de déployer un modèle simple et compréhensible.

Quand choisir une machine vectorielle de soutien

Les MVS brillent lorsque l'exactitude est primordiale[ et le problème est complexe, mais le besoin d'explication est moins strict.

  • Classification du texte: Les MVS avec des noyaux linéaires sont très efficaces pour la détection des pourriels, l'analyse des sentiments et l'étiquetage des sujets, où l'espace de fonctionnalités est grand (bag-of-words) et l'interprétation des caractéristiques individuelles est moins critique.
  • Reconnaissance d'image[: Bien que l'apprentissage profond ait largement remplacé les SVM dans les tâches d'image, les SVM avec les noyaux RBF fonctionnent toujours bien pour les ensembles de données plus petits où l'extraction des fonctionnalités a déjà été effectuée (p. ex., en utilisant des fonctionnalités CNN pré-entraînementes).
  • Bioinformatique: Dans les problèmes d'expression ou de classification des protéines, le nombre de caractéristiques dépasse de loin le nombre d'échantillons, et les MVS évitent de s'adapter de façon excessive à de nombreux modèles alternatifs.
  • Géoscience et télédétection[: Les SVM sont populaires pour la classification de la couverture terrestre à partir de l'imagerie satellitaire, où les bandes spectrales sont mesurables et la limite de décision est complexe.
  • Détection de fraudulosité: Lorsque le signal est subtil et que l'ensemble de données est haute dimension, les MVS peuvent obtenir une précision élevée, et le coût d'un faux positif peut être suffisamment faible pour tolérer une boîte noire (ou des explications post-hoc sont acceptables).

L'interpretation – L'échange d'exactitudes : pouvez-vous avoir les deux?

La sagesse conventionnelle veut que vous choisissiez entre un modèle très interprétable mais potentiellement inexact (comme un arbre de décision peu profond) et un modèle précis mais opaque (comme un SVM avec un noyau RBF).

Sélection des fonctionnalités avec SVM

On peut utiliser l'élimination des fonctionnalités récursive du SVM (SVM-RFE) pour sélectionner un petit sous-ensemble de fonctionnalités, puis former un arbre de décision sur ces fonctionnalités. Cet hybride conserve une interprétabilité tout en tirant parti de la capacité du SVM à identifier les fonctionnalités discriminantes.

Les substituts de l'arbre de décision

Un arbre de décision peut être formé pour imiter les prédictions d'un SVM formé. L'arbre sera approximatif de la limite de décision du SVM, et bien qu'il ne soit pas aussi précis, il fournit une substitut transparente qui peut être inspecté et expliqué.

SVM linéaires avec visualisation

Si le problème est linéairement séparable ou presque, un SVM linéaire produit des poids qui peuvent être visualisés comme un diagramme à barres ou une carte thermique. Pour la classification du texte, les mots les plus positifs et négatifs ont souvent un sens intuitif, permettant une forme d'interprétation.

Méthodes d'explication locales

Des outils comme LIME et SHAP peuvent expliquer les prédictions individuelles de n'importe quel modèle, y compris les SVM. Bien qu'ils ne fournissent pas la logique globale complète du modèle, ils offrent des explications par instance qui répondent souvent aux besoins réglementaires.

Taille de l'ensemble pour l'interprétation

Pour les ensembles d'arbres de décision, on peut utiliser des techniques comme une forêt aléatoire qui distillait la forêt en un seul arbre compact, ou utiliser une extraction de règles[ pour produire un ensemble de règles qui résument le comportement de l'ensemble.

Conseils pratiques pour les data scientists

  1. Démarrer avec un arbre de décision comme base de référence. Même si vous prévoyez utiliser un SVM plus tard, un modèle rapide basé sur un arbre vous donne un aperçu des interactions de fonctionnalités et de la structure des données.
  2. Utilisez la validation croisée pour déterminer si la complexité supplémentaire d'un SVM améliore en fait la précision d'un arbre de décision taillé sur votre ensemble de données. Souvent, un ensemble d'arbres bien ajusté (Random Forest) correspond aux performances du SVM et est plus facile à expliquer.
  3. Si l'interprétation est secondaire, essayez d'abord un SVM linéaire; il s'équilibre bien et fournit des poids de caractéristiques.
  4. Documentez votre stratégie d'interprétation[ dans votre projet : indiquez si vous avez besoin d'un modèle de boîte à verre, si les explications post-hoc sont acceptables et quels intervenants consommeront les explications.
  5. Rappelez-vous que l'interprétation n'est pas seulement à propos de l'algorithme — cela dépend aussi du contexte du domaine et du public. Un arbre de décision peu profond est interprétable par un médecin, mais un arbre profond avec 50 feuilles n'est pas . De même, un SVM linéaire avec 10 caractéristiques peut être interprétable par un statisticien mais pas par un profane.

Conclusion: Pas de réponse unique

La question de savoir quel algorithme est plus interprétable est facile à répondre à un niveau élevé: les arbres de décision gagnent les mains en bas. Mais le choix pratique n'est jamais aussi simple. L'écart de précision entre un arbre peu profond et un SVM finement ajusté peut être important, et le coût d'une mauvaise prédiction peut l'emporter sur la valeur de l'explication. Inversement, déployer un modèle de boîte noire dans un environnement réglementé peut entraîner des conséquences juridiques et éthiques que aucun gain de précision ne peut justifier.

Pour de nombreux problèmes, la meilleure solution n'est ni un arbre de décision pur ni un SVM pur, mais une approche hybride qui utilise le bon outil pour chaque étape du workflow - l'analyse exploratoire avec les arbres, la prédiction à haute performance avec SVM, et des explications locales pour combler l'écart. La clé est d'être explicite sur les exigences d'interprétation dès le départ et d'évaluer les modèles non seulement sur les mesures de précision mais aussi sur leur capacité à gagner de la confiance.

Pour plonger plus profondément, consultez les documents originaux : Breiman et al. (1984) pour Classification et régression des arbres, et Cortes & Vapnik (1995) pour Support Vector Networks. La documentation scikit-learn fournit des guides pratiques pour les algorithmes et les ressources comme le livre Molnar Interpretable Machine Learning offre un aperçu complet de la transparence du modèle.