iatoll

Données déséquilibrées

Données & entraînement

Situation où une catégorie est bien plus représentée qu'une autre dans un jeu de données.

Explication

Les données déséquilibrées surviennent quand, dans un ensemble de données, une classe ou une catégorie est surreprésentée par rapport aux autres. Par exemple, dans un jeu de données médicales, il peut y avoir 90 cas de patients en bonne santé pour seulement 10 cas de patients malades. Cela pose un problème pour les modèles d'IA, car ils risquent de se concentrer sur la catégorie majoritaire et d'ignorer les minoritaires, ce qui fausse leurs prédictions.

Pour y remédier, on peut rééquilibrer les données en ajoutant des exemples de la catégorie minoritaire, en réduisant ceux de la majorité, ou en utilisant des techniques spécifiques lors de l'entraînement. Cela permet au modèle d'apprendre à reconnaître toutes les catégories de manière équitable.

Par exemple, un outil de détection de fraudes bancaires doit être entraîné sur des données équilibrées entre transactions normales et frauduleuses, sinon il risque de classer toutes les transactions comme normales, ce qui le rendrait inutile.

Cas d'usage

  • Détecter des anomalies rares dans des données industrielles
  • Diagnostiquer des maladies peu fréquentes à partir d'images médicales
  • Identifier des fraudes dans un grand volume de transactions
  • Classer des emails en spam ou non-spam malgré leur proportion inégale
  • Prédire des pannes dans des équipements où les défaillances sont rares