Mémoire principale
Utilisée par le CPU et les applications. Elle peut accueillir un modèle local, généralement avec une bande passante moindre qu’une mémoire d’accélérateur.
Faire tenir le modèle et son travail
Avant de calculer, l’appareil doit charger les poids du modèle et réserver de la place pour les données intermédiaires. Si la mémoire manque, le modèle ralentit, est réparti ou ne démarre pas.
Estimez les poids seuls
Choisissez une taille et une précision. Le résultat est une estimation décimale minimale des poids, sans cache ni espace de travail.
Où vont les données ?
À quatre bits par paramètre, ses seuls poids occupent environ 4 Go. Il faut encore de la mémoire pour le cache KV, le logiciel et les calculs temporaires. Une carte annoncée avec 4 Go ne suffit donc pas nécessairement, et une conversation plus longue peut encore augmenter le besoin.
Utilisée par le CPU et les applications. Elle peut accueillir un modèle local, généralement avec une bande passante moindre qu’une mémoire d’accélérateur.
Proche des unités de calcul du GPU. Sa capacité et sa bande passante sont cruciales pour les modèles accélérés.
Employée sur certains accélérateurs de centre de données pour alimenter rapidement le calcul.
CPU et accélérateur peuvent partager une même réserve, mais capacité, débit et architecture restent déterminants.
Pendant l’inférence
La mémoire maximale n’est pas toujours utilisée au même moment. Ce qui compte est le pic : un buffer temporaire peut provoquer une erreur même si l’usage moyen paraît acceptable.
Poids
Les valeurs apprises du modèle.
Activations
Les résultats intermédiaires des couches.
Cache KV
Les informations réutilisées pour générer la suite.
Buffers
Les espaces temporaires du calcul et du logiciel.
Une conversation qui grandit
Lorsqu’un modèle génère token après token, il conserve des informations d’attention déjà calculées. Cela évite de tout recalculer, mais le cache augmente avec le contexte, le nombre de couches, les requêtes simultanées et certains choix d’architecture.
Contexte long → davantage de cache
Pendant l’entraînement
Il faut conserver des activations pour le retour arrière, calculer des gradients et stocker les états de l’optimiseur. Le lot de données et la longueur des séquences influencent aussi fortement le pic mémoire.
Quand cela ne tient pas
Réduit fortement la mémoire des paramètres, avec un compromis de qualité et de compatibilité.
Libère la VRAM, mais les transferts peuvent ralentir la génération.
Chaque puce conserve une partie du modèle, avec un coût de communication.
Diminue la mémoire dynamique, au prix de moins d’informations disponibles.
Capacité et vitesse
La bande passante indique la quantité de données transférable par seconde. Un grand modèle peut tenir mais générer lentement si les poids n’arrivent pas assez vite aux unités de calcul.
Avant d’installer un modèle
Combien de paramètres ?
Taille totale et paramètres actifs.
Quelle précision ?
FP32, FP16, INT8, INT4 ou autre.
Quel usage ?
Inférence, fine-tuning ou entraînement.
Quel contexte ?
Longueur et nombre de conversations simultanées.
Quelle mémoire ?
Capacité, bande passante et marge disponible.
Quel logiciel ?
Formats, offloading et accélérateur pris en charge.
Sources de référence
Ces documentations détaillent les composantes de la mémoire d’un modèle, le cache KV et les limites de débit.
Sources consultées le 28 septembre 2026.
Relier les notions
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.