iatoll

Apprentissage auto-supervisé

Données & entraînement

Méthode où le modèle crée lui-même ses étiquettes à partir des données brutes, sans annotation humaine.

Explication

L’apprentissage auto-supervisé est une technique d’entraînement où le modèle génère ses propres exemples d’apprentissage à partir des données disponibles. Contrairement à l’apprentissage supervisé, qui repose sur des étiquettes fournies par des humains (comme classer des images ou traduire des phrases), cette approche utilise la structure même des données pour créer des tâches. Par exemple, dans un texte, on peut masquer un mot et demander au modèle de le deviner en fonction du contexte. Cela permet d’exploiter d’énormes volumes de données non annotées, comme des livres ou des articles, pour pré-entraîner des modèles puissants avant de les affiner avec des données étiquetées.

Cette méthode se distingue aussi de l’apprentissage non supervisé, où le modèle cherche simplement des motifs ou des regroupements dans les données sans aucune étiquette. Ici, les étiquettes existent, mais elles sont créées automatiquement à partir des données elles-mêmes, ce qui rend l’approche particulièrement efficace pour des tâches comme la compréhension du langage ou la reconnaissance d’images.

C’est grâce à l’apprentissage auto-supervisé que les grands modèles de langage actuels peuvent être pré-entraînés sur des milliards de mots, avant d’être adaptés à des usages spécifiques.

Cas d'usage

  • Pré-entraîner un modèle de langage sur des textes non annotés pour comprendre le sens des mots
  • Améliorer la reconnaissance d’images en apprenant à prédire des parties manquantes d’une photo
  • Créer des représentations numériques de données (comme du texte ou du son) pour des tâches ultérieures
  • Réduire la dépendance aux annotations humaines coûteuses et chronophages
  • Entraîner des modèles sur des données rares ou spécialisées sans étiquettes existantes