iatoll

Problème du bandit manchot

Modèles & architectures

Stratégie pour choisir entre plusieurs options avec des récompenses inconnues, en apprenant au fil des essais.

Explication

Le problème du bandit manchot est une situation où l’on doit choisir à plusieurs reprises entre plusieurs actions (les « bras » du bandit), chacune associant une récompense aléatoire et inconnue. L’objectif est de maximiser la récompense totale sur le long terme, en équilibrant exploration (essayer de nouvelles options) et exploitation (choisir la meilleure option connue jusqu’ici). Ce concept vient des machines à sous (bandits manchots), où chaque levier a une probabilité de gain différente, mais invisible au départ.

En IA, cette approche est utilisée pour optimiser des décisions en temps réel, comme personnaliser des recommandations ou allouer des ressources. Par exemple, un site web peut tester différentes versions d’une page (A/B testing) et ajuster dynamiquement celle qui génère le plus de clics, sans se contenter de la première option essayée.

L’intérêt est de trouver un équilibre entre découvrir de meilleures solutions et exploiter celles déjà identifiées, sans gaspiller trop de ressources sur des options peu prometteuses.

Cas d'usage

  • Personnaliser les publicités affichées à un utilisateur en fonction de ses réactions passées
  • Optimiser les itinéraires de livraison en testant différents trajets
  • Choisir dynamiquement le meilleur algorithme pour traiter une tâche parmi plusieurs disponibles
  • Adapter les suggestions de produits dans un catalogue en ligne
  • Répartir des ressources limitées (budget, temps) entre plusieurs projets