Faire tenir le modèle et son travail

RAM, VRAM et mémoire : pourquoi la taille d’un modèle d’IA est-elle limitée ?

Avant de calculer, l’appareil doit charger les poids du modèle et réserver de la place pour les données intermédiaires. Si la mémoire manque, le modèle ralentit, est réparti ou ne démarre pas.

À retenirLa mémoire contient le modèle, mais aussi tout ce dont il a besoin pour travailler.
Mémoire disponible
PoidsCache KVTravailLibre
Les proportions varient selon le modèle et l’usage.

Estimez les poids seuls

Paramètres × octets par paramètre

Choisissez une taille et une précision. Le résultat est une estimation décimale minimale des poids, sans cache ni espace de travail.

Taille du modèle
B signifie ici « milliards de paramètres ».
Représentation
Valeurs théoriques simplifiées, hors métadonnées.

Où vont les données ?

Exemple : un modèle de 8 milliards de paramètres

À quatre bits par paramètre, ses seuls poids occupent environ 4 Go. Il faut encore de la mémoire pour le cache KV, le logiciel et les calculs temporaires. Une carte annoncée avec 4 Go ne suffit donc pas nécessairement, et une conversation plus longue peut encore augmenter le besoin.

RAM, VRAM, HBM et mémoire unifiée

RAM

Mémoire principale

Utilisée par le CPU et les applications. Elle peut accueillir un modèle local, généralement avec une bande passante moindre qu’une mémoire d’accélérateur.

VRAM

Mémoire du GPU

Proche des unités de calcul du GPU. Sa capacité et sa bande passante sont cruciales pour les modèles accélérés.

HBM

Mémoire à très haut débit

Employée sur certains accélérateurs de centre de données pour alimenter rapidement le calcul.

Unifiée

Un espace partagé

CPU et accélérateur peuvent partager une même réserve, mais capacité, débit et architecture restent déterminants.

Pendant l’inférence

Quatre occupants principaux

La mémoire maximale n’est pas toujours utilisée au même moment. Ce qui compte est le pic : un buffer temporaire peut provoquer une erreur même si l’usage moyen paraît acceptable.

  1. 01

    Poids
    Les valeurs apprises du modèle.

  2. 02

    Activations
    Les résultats intermédiaires des couches.

  3. 03

    Cache KV
    Les informations réutilisées pour générer la suite.

  4. 04

    Buffers
    Les espaces temporaires du calcul et du logiciel.

Une conversation qui grandit

Le cache KV échange du calcul contre de la mémoire

Lorsqu’un modèle génère token après token, il conserve des informations d’attention déjà calculées. Cela évite de tout recalculer, mais le cache augmente avec le contexte, le nombre de couches, les requêtes simultanées et certains choix d’architecture.

Contexte court

Contexte long → davantage de cache

Pendant l’entraînement

Apprendre demande bien plus que charger les poids

Il faut conserver des activations pour le retour arrière, calculer des gradients et stocker les états de l’optimiseur. Le lot de données et la longueur des séquences influencent aussi fortement le pic mémoire.

PoidsLe modèle
GradientsComment le corriger
OptimiseurHistorique des mises à jour
ActivationsÉtapes du calcul à retrouver

Quand cela ne tient pas

Réduire, déplacer ou répartir

Quantifier

Moins d’octets par poids

Réduit fortement la mémoire des paramètres, avec un compromis de qualité et de compatibilité.

Décharger

Utiliser la RAM ou le stockage

Libère la VRAM, mais les transferts peuvent ralentir la génération.

Répartir

Plusieurs accélérateurs

Chaque puce conserve une partie du modèle, avec un coût de communication.

Réduire le contexte

Limiter le cache

Diminue la mémoire dynamique, au prix de moins d’informations disponibles.

Capacité et vitesse

Avoir assez de mémoire ne suffit pas

La bande passante indique la quantité de données transférable par seconde. Un grand modèle peut tenir mais générer lentement si les poids n’arrivent pas assez vite aux unités de calcul.

CapacitéLe modèle peut-il tenir ?Bande passantePeut-il être alimenté rapidement ?

Avant d’installer un modèle

Six questions pratiques

  1. 01

    Combien de paramètres ?
    Taille totale et paramètres actifs.

  2. 02

    Quelle précision ?
    FP32, FP16, INT8, INT4 ou autre.

  3. 03

    Quel usage ?
    Inférence, fine-tuning ou entraînement.

  4. 04

    Quel contexte ?
    Longueur et nombre de conversations simultanées.

  5. 05

    Quelle mémoire ?
    Capacité, bande passante et marge disponible.

  6. 06

    Quel logiciel ?
    Formats, offloading et accélérateur pris en charge.

Sources de référence

Pour approfondir

Ces documentations détaillent les composantes de la mémoire d’un modèle, le cache KV et les limites de débit.

Hugging Face TransformersAnatomie de la mémoire GPU →Hugging FaceStratégies de cache KV →NVIDIACalcul et bande passante mémoire →

Sources consultées le 28 septembre 2026.

Relier les notions

Voyez comment la quantification réduit la mémoire occupée par les poids.

Comprendre la quantification

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.