Les ensembles de données déséquilibrés sont courants dans de nombreuses applications réelles, telles que la détection de fraude, le diagnostic médical et la détection d'anomalies. La résolution du déséquilibre est cruciale pour la construction de modèles d'apprentissage machine efficaces.

Comprendre l'équilibre des données

Le déséquilibre des données se produit lorsque le nombre d'instances d'une classe dépasse de façon significative celles d'une autre classe. Ce déséquilibre peut biaiser les modèles vers la classe majoritaire, réduisant ainsi leur capacité à détecter les instances de classe minoritaire. Mathématiquement, si N est le nombre total d'échantillons et N[minorité] est le nombre d'échantillons de classe minoritaire, le rapport de déséquilibre est IR = N/Nminorité.

Techniques de manipulation de l'équilibre

Plusieurs techniques peuvent atténuer les effets du déséquilibre des données, qui peuvent être catégorisés en grandes catégories selon les niveaux de données et les algorithmes.

Méthodes au niveau des données

  • Suréchantillonnage :[ Augmentation des échantillons de classes minoritaires, souvent en utilisant des méthodes comme SMOTE, qui génèrent des points de données synthétiques à partir d'échantillons minoritaires existants.
  • Sous-échantillonnage : Réduction des échantillons de classe majoritaire pour équilibrer l'ensemble de données, ce qui peut risquer de perdre des informations précieuses.
  • Approches hybrides :[ Combinant suréchantillonnage et sous-échantillonnage pour optimiser l'équilibre des données.

Méthodes au niveau de l'algorithme

  • Apprentissage sensible au coût:[ Attribuer des coûts de classification erronés plus élevés aux erreurs de classe minoritaire pour influencer l'orientation du modèle.
  • Ensembler les méthodes:[ Utiliser des techniques comme stimuler pour améliorer la détection des classes minoritaires.
  • Ajuster les seuils de décision: Modifier la limite de probabilité pour favoriser les prédictions de classes minoritaires.

Fondations mathématiques

De nombreuses techniques sont basées sur des concepts statistiques et mathématiques. Par exemple, SMOTE crée des échantillons synthétiques en interpolant entre des points de classe minoritaire :

xnew = xi + lambda (xj - xi]

xi et x[j sont des échantillons de classes minoritaires, et lambda est un nombre aléatoire entre 0 et 1. Cette approche garantit que les données synthétiques se trouvent dans l'espace de caractéristique de la classe minoritaire, en maintenant l'intégrité de la distribution des données.