Des capacités au comportement
Préentraînement et alignement : comment un modèle devient-il un assistant ?
Prédire la suite d’un texte ne suffit pas pour répondre utilement à une demande. Après la formation générale viennent souvent des étapes destinées à mieux suivre les consignes et les préférences.
Le parcours simplifié
Quatre objectifs qui ne se confondent pas
Préentraînement
Le modèle apprend à prédire des tokens sur beaucoup de données. Il acquiert des régularités et des capacités générales.
Objectif : construire une base.Ajustement supervisé
Des exemples de consignes et de réponses attendues lui montrent comment se comporter comme un assistant.
Objectif : suivre la tâche.Préférences
Des réponses sont comparées. Ces choix servent à favoriser certains comportements, par RLHF ou d’autres méthodes.
Objectif : mieux répondre aux attentes.Sécurité et évaluation
Des tests examinent utilité, robustesse, biais, refus et cas dangereux, avant et après le déploiement.
Objectif : connaître et réduire les risques.Ce que signifie « aligner »
Après le préentraînement, un modèle peut surtout être doué pour compléter un texte. Une phase d’apprentissage sur des consignes lui montre ensuite comment répondre à une question. Des évaluations et retours supplémentaires cherchent enfin à rendre ses réponses plus utiles et plus sûres.
Rapprocher le comportement d’objectifs choisis
Il faut définir ce qui est jugé utile, honnête, prudent ou acceptable, puis traduire ces objectifs en exemples, comparaisons, règles et tests. Ces choix humains peuvent être incomplets, contradictoires ou dépendre du contexte.
À ne pas confondre
Capacité, connaissance et comportement
Ce que le modèle sait faire
Résumer, traduire, coder ou résoudre certains problèmes.
La manière dont il répond
Suivre une consigne, reconnaître une limite ou refuser certaines actions.
Ce que ses données permettent de restituer
L’alignement ne met pas automatiquement les faits à jour.
Ce qui doit encore être vérifié
Une réponse préférée par des évaluateurs peut rester factuellement fausse.
Les limites essentielles
Un processus, pas un état parfait
- 1
Préférences limitées
Les évaluateurs ne représentent pas tout le monde. - 2
Optimisation imparfaite
Le modèle peut apprendre des raccourcis. - 3
Situations nouvelles
Un comportement testé peut échouer ailleurs. - 4
Suivi continu
Les usages réels révèlent de nouveaux risques.
Sources de référence
Pour approfondir
Cette fiche décrit une famille de méthodes. Les recettes exactes varient selon les modèles.
Sources consultées le 28 septembre 2026.
Étape suivante
Une fois le modèle entraîné, comment mesure-t-on réellement sa qualité ?
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.