Apprentissage semi-supervisé
Données & entraînementMéthode d'entraînement d'un modèle IA avec peu de données étiquetées et beaucoup de données non étiquetées.
Explication
L'apprentissage semi-supervisé est une approche qui permet d'entraîner un modèle d'intelligence artificielle en combinant deux types de données : une petite quantité de données étiquetées (par exemple, des images de tumeurs annotées par des médecins) et une grande quantité de données non étiquetées (comme des milliers d'images médicales sans annotation). Cette méthode est utile quand il est trop coûteux ou trop long d'étiqueter manuellement toutes les données disponibles.
Contrairement à l'apprentissage supervisé, où toutes les données sont étiquetées, ou à l'apprentissage non supervisé, où aucune donnée n'est étiquetée, l'apprentissage semi-supervisé tire parti des deux mondes. Il diffère aussi de l'apprentissage auto-supervisé, où les étiquettes sont générées automatiquement à partir des données elles-mêmes, sans intervention humaine. Ici, les étiquettes humaines, même en petite quantité, guident le modèle pour qu'il apprenne à généraliser à partir des données non étiquetées.
Par exemple, un outil de détection de fraudes pourrait être entraîné avec quelques centaines de transactions étiquetées comme frauduleuses ou non, complétées par des millions de transactions non étiquetées. Le modèle apprend ainsi à reconnaître des motifs de fraude sans nécessiter une annotation exhaustive.
Cas d'usage
- ✓Classer des images médicales avec peu d'annotations manuelles
- ✓Détecter des fraudes dans des transactions financières sans tout étiqueter
- ✓Améliorer la reconnaissance vocale avec des enregistrements non transcrits
- ✓Segmenter des clients en groupes sans étiqueter toutes les données
- ✓Analyser des textes pour en extraire des tendances avec peu d'exemples annotés