Le fichier du modèle
Poids, architecture, tokenizer, licence et format utilisable.
Le calcul reste sur l’appareil
Une IA locale charge le modèle et réalise l’inférence sur votre ordinateur, téléphone ou autre appareil, sans envoyer nécessairement chaque demande à un serveur distant.
Selon la priorité
Ce qu’il faut réunir
Avec un modèle local, le téléphone peut transformer la voix en texte sans envoyer l’enregistrement vers un serveur et même sans connexion. En contrepartie, le modèle doit tenir dans la mémoire de l’appareil et peut être moins rapide ou moins performant qu’un service distant plus puissant.
Poids, architecture, tokenizer, licence et format utilisable.
RAM ou VRAM pour les poids, le cache KV et les calculs temporaires.
Logiciel capable d’exécuter les opérations sur CPU, GPU ou NPU.
Interface, historique, documents, permissions et règles de conservation.
Les gains possibles
Possible si l’application ne contacte aucun service externe.
Utile sur le terrain ou avec un réseau instable.
Mais matériel, électricité et maintenance ont un coût.
Version, format, quantification et mises à jour sont maîtrisés.
Les limites concrètes
Un modèle quantifié peut tenir en mémoire mais rester lent si le processeur ou la bande passante sont insuffisants. Les appareils chauffent, consomment de l’énergie et ne prennent pas tous en charge les mêmes opérations.
Mémoire
Poids, contexte et cache doivent tenir.
Débit
Mesurer les tokens par seconde sur l’appareil réel.
Compatibilité
Format et accélérateur doivent être reconnus.
Sécurité
Téléchargements et extensions restent des logiciels à contrôler.
Sources de référence
Les moteurs locaux gèrent tokenisation, inférence, échantillonnage et cache sur différents accélérateurs.
Sources consultées le 28 septembre 2026.
Étape suivante
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.