Réutiliser au lieu de recommencer

Qu’est-ce que le cache KV d’une IA ?

Pendant qu’un modèle écrit sa réponse, il conserve certains calculs d’attention déjà effectués. Cette mémoire temporaire accélère la suite, mais grandit avec la conversation.

À retenirLe cache KV ne mémorise pas une conversation pour toujours : il évite surtout de recalculer son passé à chaque nouveau token.
Votre question→Cache K + V→Prochain tokenÀ chaque étape, le cache s’allonge.

Une image simplifiée

Faites grandir la conversation

La quantité exacte dépend de l’architecture et du service. Cette démonstration montre seulement le principe.

Deux lettres utiles

Exemple : une conversation de dix messages

Sans cache, le modèle recalculerait à chaque nouveau mot les informations liées aux neuf messages précédents. Le cache KV conserve une partie de ce travail déjà effectué : le dixième message peut donc être traité plus vite, au prix d’une mémoire qui augmente avec la longueur de l’échange.

Clés et valeurs dans l’attention

Dans une couche d’attention, chaque token produit notamment une clé (K) et une valeur (V). Pour générer la suite, le modèle compare la nouvelle requête aux clés passées puis combine les valeurs pertinentes.

KClé

Aide à déterminer quels éléments passés sont pertinents.

VValeur

Contient l’information à combiner pour le calcul courant.

Sans cache / avec cache

Le gain est du temps de calcul

Sans cache

Recalculer le passé

À chaque token, les clés et valeurs précédentes sont produites de nouveau.

Le compromis

Plus de contexte, plus de mémoire

Le cache peut devenir un goulot d’étranglement pour les contextes longs ou de nombreuses conversations simultanées. Des caches déchargés, quantifiés, statiques ou à fenêtre glissante échangent différemment mémoire, vitesse et flexibilité.

  1. 1

    Longueur
    Le cache grandit avec les tokens conservés.

  2. 2

    Couches
    Plusieurs couches maintiennent leurs propres états.

  3. 3

    Requêtes
    Chaque conversation active peut avoir son cache.

  4. 4

    Architecture
    Fenêtre glissante et attention groupée changent le besoin.

Sources de référence

Pour approfondir

Les détails varient selon les architectures. Ces documentations décrivent le mécanisme et ses principaux compromis.

Hugging Face TransformersStratégies de cache KV →Hugging FaceFonctionnement du cache →

Sources consultées le 28 septembre 2026.

Étape suivante

Découvrez comment le modèle apprend ensuite à suivre des consignes.

Préentraînement et alignement

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.