Des capacités au comportement

Préentraînement et alignement : comment un modèle devient-il un assistant ?

Prédire la suite d’un texte ne suffit pas pour répondre utilement à une demande. Après la formation générale viennent souvent des étapes destinées à mieux suivre les consignes et les préférences.

À retenirL’alignement oriente le comportement d’un modèle ; il ne le rend ni omniscient, ni parfaitement fiable, ni porteur de valeurs universelles.
1PréentraînementApprendre des régularités
2InstructionsVoir de bonnes réponses
3PréférencesComparer des sorties
4ÉvaluationsMesurer et corriger

Le parcours simplifié

Quatre objectifs qui ne se confondent pas

01

Préentraînement

Le modèle apprend à prédire des tokens sur beaucoup de données. Il acquiert des régularités et des capacités générales.

Objectif : construire une base.
02

Ajustement supervisé

Des exemples de consignes et de réponses attendues lui montrent comment se comporter comme un assistant.

Objectif : suivre la tâche.
03

Préférences

Des réponses sont comparées. Ces choix servent à favoriser certains comportements, par RLHF ou d’autres méthodes.

Objectif : mieux répondre aux attentes.
04

Sécurité et évaluation

Des tests examinent utilité, robustesse, biais, refus et cas dangereux, avant et après le déploiement.

Objectif : connaître et réduire les risques.

Ce que signifie « aligner »

Exemple : de la phrase suivante à l’assistant

Après le préentraînement, un modèle peut surtout être doué pour compléter un texte. Une phase d’apprentissage sur des consignes lui montre ensuite comment répondre à une question. Des évaluations et retours supplémentaires cherchent enfin à rendre ses réponses plus utiles et plus sûres.

Rapprocher le comportement d’objectifs choisis

Il faut définir ce qui est jugé utile, honnête, prudent ou acceptable, puis traduire ces objectifs en exemples, comparaisons, règles et tests. Ces choix humains peuvent être incomplets, contradictoires ou dépendre du contexte.

UtileFiablePrudentContrôlableComportement recherché

À ne pas confondre

Capacité, connaissance et comportement

Capacité

Ce que le modèle sait faire

Résumer, traduire, coder ou résoudre certains problèmes.

Comportement

La manière dont il répond

Suivre une consigne, reconnaître une limite ou refuser certaines actions.

Connaissance

Ce que ses données permettent de restituer

L’alignement ne met pas automatiquement les faits à jour.

Vérité

Ce qui doit encore être vérifié

Une réponse préférée par des évaluateurs peut rester factuellement fausse.

Les limites essentielles

Un processus, pas un état parfait

  1. 1

    Préférences limitées
    Les évaluateurs ne représentent pas tout le monde.

  2. 2

    Optimisation imparfaite
    Le modèle peut apprendre des raccourcis.

  3. 3

    Situations nouvelles
    Un comportement testé peut échouer ailleurs.

  4. 4

    Suivi continu
    Les usages réels révèlent de nouveaux risques.

Sources de référence

Pour approfondir

Cette fiche décrit une famille de méthodes. Les recettes exactes varient selon les modèles.

Ouyang et al.Suivre des instructions avec du feedback humain →OpenAIInstructGPT et RLHF →NISTGérer les risques sur tout le cycle de vie →

Sources consultées le 28 septembre 2026.

Étape suivante

Une fois le modèle entraîné, comment mesure-t-on réellement sa qualité ?

Comprendre l’évaluation

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.