Trois façons de recevoir un retour
Supervisé, non supervisé ou par renforcement ?
Ces mots ne décrivent pas trois niveaux d’intelligence. Ils indiquent surtout quel signal guide l’apprentissage : une bonne réponse connue, des ressemblances à découvrir ou une récompense obtenue après une action.
La différence en un regard
Ce que le modèle reçoit pour progresser
Des exemples avec leur réponse
Une photo accompagnée de « chat », ou un logement avec son prix réel. Le modèle apprend à relier les entrées à la réponse attendue.
Des exemples sans réponse imposée
Le système cherche des structures, des proximités ou des groupes. Une personne doit ensuite interpréter ce qu’ils signifient.
Des actions, puis une récompense
Un agent essaie une stratégie dans un environnement. Les conséquences favorables ou défavorables orientent les choix futurs.
À vous de choisir
Avec des courriels déjà étiquetés « indésirable » ou « normal », le modèle apprend de façon supervisée. En regroupant des clients sans catégories fournies, il travaille sans supervision. En apprenant à gagner à un jeu grâce à des récompenses et pénalités, il utilise l’apprentissage par renforcement.
Quel apprentissage pour quel problème ?
Choisissez une situation. Le signal disponible donne l’indice essentiel.
Apprentissage supervisé
- Signal
- Chaque message possède déjà une étiquette.
- Ce qui est appris
- La relation entre le contenu d’un message et sa catégorie.
- À contrôler
- Les exemples mal étiquetés et les nouveaux types de spam.
Les pièges de vocabulaire
Trois idées à ne pas mélanger
- 1
Supervisé ne signifie pas surveillé en direct.
La « supervision » vient des réponses attachées aux exemples. - 2
Non supervisé ne signifie pas sans humains.
Il faut choisir les données, la méthode et interpréter les groupes. - 3
Une récompense n’est pas une valeur morale.
Le système optimise le signal défini, même s’il est incomplet. - 4
Les familles peuvent se combiner.
Un même produit peut utiliser plusieurs phases et plusieurs signaux.
Le bon réflexe
Commencer par la question, pas par la technique
Que doit produire le système ?
Une valeur, une catégorie, des groupes ou une suite d’actions ?
Dispose-t-on de réponses fiables ?
Les étiquettes peuvent être rares, coûteuses ou ambiguës.
Comment saura-t-il qu’il progresse ?
Erreur mesurée, cohérence des groupes ou récompense.
Comment tester le résultat ?
Sur des situations nouvelles et des cas difficiles, pas seulement connus.
Source de référence
Pour approfondir
Le cours d’introduction de Google distingue ces familles par la nature du signal utilisé pour apprendre.
Sources consultées le 28 septembre 2026.
Étape suivante
Regardez maintenant ce que le modèle peut produire.
Dans le parcours « Je comprends comment les modèles apprennent »
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.