Une architecture qui relie les éléments d’une séquence
Qu’est-ce qu’un Transformer ?
Un Transformer est une architecture de réseau de neurones qui utilise l’attention pour pondérer les relations entre les éléments d’un contexte. Elle équipe de nombreux modèles de langage modernes.
Observez l’attention
Une fin de phrase peut changer les relations
Les scores ci-dessous sont fictifs. Ils illustrent le principe, pas les calculs d’un modèle réel.
Préparer la séquence
Le modèle combine contenu et position
Avant l’attention, le texte est découpé en tokens. Chacun devient un embedding, puis reçoit une information de position pour distinguer l’ordre des éléments.
Pourquoi la position compte ? « Le chat poursuit la souris » n’a pas le même sens que « La souris poursuit le chat ».
Question, clé, valeur
Chaque token cherche les informations qui lui sont utiles
L’auto-attention crée plusieurs représentations pour chaque token. Une requête est comparée aux clés des autres tokens ; les scores obtenus servent à combiner leurs valeurs.
Requête
« Que dois-je chercher pour interpréter ce token ? »
Clé
« Quel type d’information ce token peut-il apporter ? »
Valeur
« Quelle information transmettre si le lien est important ? »
Plusieurs regards en parallèle
Les têtes d’attention peuvent apprendre des relations différentes
Un bloc comporte généralement plusieurs têtes. Certaines peuvent privilégier des relations grammaticales, des positions, des références ou d’autres motifs appris. Leurs résultats sont combinés puis transformés.
Trois grandes familles
Encoder, décodeur ou les deux
Comprendre une entrée
Examine souvent les deux côtés du contexte pour créer des représentations, classer ou rechercher.
Générer une suite
Utilise les tokens précédents sans regarder les futurs tokens qu’il n’a pas encore produits.
Transformer une séquence
L’un représente l’entrée, l’autre produit la sortie, par exemple pour traduire.
Pourquoi cette architecture a compté
Relier des éléments éloignés et mieux paralléliser l’entraînement
Contrairement aux anciens réseaux qui lisaient surtout les éléments l’un après l’autre, le Transformer peut calculer de nombreuses relations en parallèle. Cela a facilité l’entraînement sur de grands volumes et la prise en compte de contextes plus riches.
A → puis B → puis C → puis D
les étapes dépendent fortement les unes des autresA ↔ B ↔ C ↔ D
de nombreuses relations sont calculées ensembleLes limites à connaître
L’attention n’est ni une mémoire parfaite ni une explication complète
L’attention classique compare de nombreuses paires de positions ; un long contexte demande plus de mémoire et de calcul.
Une carte d’attention ne suffit pas toujours à expliquer pourquoi le modèle a produit sa réponse.
Ce qui dépasse la fenêtre disponible ou ce qui est mal représenté peut être perdu.
Mieux relier les tokens n’empêche ni hallucinations, ni biais, ni mauvaise interprétation.
Quand on vous présente un Transformer
Six questions pour dépasser le mot technique
- 01
Pour quelle entrée ?
Texte, image, audio et vidéo ne sont pas préparés de la même façon. - 02
Encoder ou décodeur ?
L’architecture dépend du rôle attendu. - 03
Quelle longueur de contexte ?
La taille annoncée ne garantit pas une utilisation parfaite. - 04
Quel coût ?
Latence, mémoire et énergie comptent autant que la capacité. - 05
Quelle évaluation ?
Les résultats doivent correspondre aux tâches réelles. - 06
Quelles limites documentées ?
Une architecture performante ne rend pas le système infaillible.
Sources de référence
Pour approfondir
Ces ressources présentent l’architecture originale et le mécanisme d’auto-attention.
La suite logique
Revenez au modèle complet pour relier attention, tokens et génération.
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.