Aide à déterminer quels éléments passés sont pertinents.
Réutiliser au lieu de recommencer
Qu’est-ce que le cache KV d’une IA ?
Pendant qu’un modèle écrit sa réponse, il conserve certains calculs d’attention déjà effectués. Cette mémoire temporaire accélère la suite, mais grandit avec la conversation.
Une image simplifiée
Faites grandir la conversation
La quantité exacte dépend de l’architecture et du service. Cette démonstration montre seulement le principe.
Deux lettres utiles
Sans cache, le modèle recalculerait à chaque nouveau mot les informations liées aux neuf messages précédents. Le cache KV conserve une partie de ce travail déjà effectué : le dixième message peut donc être traité plus vite, au prix d’une mémoire qui augmente avec la longueur de l’échange.
Clés et valeurs dans l’attention
Dans une couche d’attention, chaque token produit notamment une clé (K) et une valeur (V). Pour générer la suite, le modèle compare la nouvelle requête aux clés passées puis combine les valeurs pertinentes.
Contient l’information à combiner pour le calcul courant.
Sans cache / avec cache
Le gain est du temps de calcul
Recalculer le passé
À chaque token, les clés et valeurs précédentes sont produites de nouveau.
Réutiliser le passé
Seuls les nouveaux éléments sont ajoutés, ce qui accélère généralement le décodage.
Le compromis
Plus de contexte, plus de mémoire
Le cache peut devenir un goulot d’étranglement pour les contextes longs ou de nombreuses conversations simultanées. Des caches déchargés, quantifiés, statiques ou à fenêtre glissante échangent différemment mémoire, vitesse et flexibilité.
- 1
Longueur
Le cache grandit avec les tokens conservés. - 2
Couches
Plusieurs couches maintiennent leurs propres états. - 3
Requêtes
Chaque conversation active peut avoir son cache. - 4
Architecture
Fenêtre glissante et attention groupée changent le besoin.
Sources de référence
Pour approfondir
Les détails varient selon les architectures. Ces documentations décrivent le mécanisme et ses principaux compromis.
Sources consultées le 28 septembre 2026.
Étape suivante
Découvrez comment le modèle apprend ensuite à suivre des consignes.
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.