Des calculs similaires, des matériels différents
GPU, TPU et NPU : pourquoi l’IA utilise-t-elle des puces spécialisées ?
Les modèles d’IA réalisent énormément d’opérations mathématiques répétitives. Certaines puces sont conçues pour en exécuter beaucoup en parallèle, plus rapidement ou avec moins d’énergie.
Choisissez une situation
La meilleure puce dépend du travail demandé
Ces choix illustrent des tendances générales. Un modèle et un logiciel précis peuvent conduire à une autre décision.
Quatre familles
Du généraliste au très spécialisé
Le chef d’orchestre polyvalent
Il exécute le système, les applications, les branchements logiques et de nombreuses tâches différentes.
Le champion du parallélisme
Né pour le graphisme, il est devenu programmable et traite beaucoup d’opérations similaires à la fois.
L’accélérateur de Google
C’est un ASIC conçu pour les charges de machine learning, notamment les grandes opérations matricielles.
L’accélérateur neuronal local
Il vise des inférences soutenues et économes sur téléphone ou ordinateur compatible.
Pourquoi les matrices ?
L’IA répète énormément de multiplications et d’additions
Les paramètres et les activations d’un réseau sont organisés en tableaux de nombres. L’entraînement et l’inférence multiplient ces tableaux, additionnent les résultats et recommencent couche après couche.
Image mentale : un CPU résout de nombreux types de problèmes. Un accélérateur installe une immense équipe sur quelques opérations très fréquentes.
Le goulot d’étranglement
Calculer vite ne suffit pas : il faut alimenter la puce
Les poids du modèle et les données intermédiaires doivent être stockés puis déplacés. La capacité mémoire, sa bande passante et les communications entre puces peuvent limiter la vitesse avant même la puissance de calcul.
Si une étape ne suit pas, les unités de calcul attendent.
IA locale ou dans le cloud
Le lieu d’exécution change le compromis
Proximité et sobriété
- Peut fonctionner sans envoyer chaque donnée au cloud
- Réponse rapide pour les petites fonctions compatibles
- Limité par la mémoire, l’énergie et la chaleur
Puissance mutualisée
- Accès à de nombreux GPU ou TPU reliés
- Peut accueillir des modèles beaucoup plus grands
- Dépend du réseau, du coût et des règles de traitement des données
Un chiffre à manier avec prudence
Les TOPS ne racontent pas toute l’histoire
Les « trillions d’opérations par seconde » mesurent un débit théorique dans certaines conditions. Deux puces affichant un nombre proche peuvent donner des résultats différents selon la précision numérique, la mémoire, le modèle et le logiciel.
Il faut mesurer sur le modèle, le format et l’appareil réellement utilisés.
Les limites
Une puce spécialisée exige un écosystème compatible
Toutes les opérations ne sont pas forcément prises en charge.
Compilateur, bibliothèque et pilotes doivent exploiter le matériel.
Un modèle trop grand ne tient pas, même avec beaucoup de TOPS.
Vitesse, énergie, qualité et coût doivent être comparés ensemble.
Avant de comparer
Six questions plus utiles que le nom de la puce
- 01
Entraînement ou inférence ?
Les besoins ne sont pas les mêmes. - 02
Quel modèle ?
Taille, opérations et précision numérique. - 03
Quelle mémoire ?
Capacité et bande passante disponibles. - 04
Quel logiciel ?
Prise en charge réelle de l’accélérateur. - 05
Où l’exécuter ?
Appareil local, serveur ou cloud. - 06
Quel résultat ?
Latence, débit, énergie, coût et qualité.
Sources de référence
Pour approfondir
Ces documentations officielles présentent le calcul parallèle, l’architecture TPU et l’accélération locale sur CPU, GPU et NPU.
Sources consultées le 28 septembre 2026.
Relier les notions
Voyez ensuite comment la mémoire limite la taille et la vitesse d’un modèle.
Comprendre une notion
Gardez le fil de votre apprentissage.
Une étape courte et clairement reliée à ce que vous venez de lire.