iatoll

Déséquilibre des classes

Données & entraînement

Situation où certaines catégories sont surreprésentées dans les données d'entraînement.

Explication

Le déséquilibre des classes se produit quand, dans un jeu de données utilisé pour entraîner un modèle d'IA, certaines catégories (ou « classes ») sont beaucoup plus nombreuses que d'autres. Par exemple, si vous entraînez un outil pour détecter des fraudes dans des transactions bancaires, il y aura probablement très peu de cas de fraude comparé aux transactions normales. Cela peut poser problème car le modèle risque de négliger les classes minoritaires, comme les fraudes, et de se concentrer uniquement sur les plus fréquentes, ce qui réduit son utilité dans la pratique.

Pour y remédier, on peut rééquilibrer les données en ajoutant des exemples de la classe minoritaire, en supprimant des exemples de la classe majoritaire, ou en utilisant des techniques qui donnent plus d'importance aux classes rares pendant l'entraînement. Cela permet au modèle de mieux apprendre à reconnaître toutes les catégories, même les moins fréquentes.

Un exemple concret : un outil de diagnostic médical qui doit repérer des maladies rares. Sans correction du déséquilibre, il pourrait ignorer ces maladies et toujours prédire que le patient est en bonne santé.

Cas d'usage

  • Détecter des fraudes dans un grand volume de transactions
  • Identifier des défauts de fabrication dans une chaîne de production
  • Diagnostiquer des maladies rares à partir de symptômes
  • Classer des emails en spam ou non-spam malgré un faible taux de spams
  • Reconnaître des objets rares dans des images (ex : espèces animales menacées)