Le calcul reste sur l’appareil

Faire fonctionner une IA localement : qu’est-ce que cela change ?

Une IA locale charge le modèle et réalise l’inférence sur votre ordinateur, téléphone ou autre appareil, sans envoyer nécessairement chaque demande à un serveur distant.

À retenir« Local » décrit le lieu du calcul. Cela ne prouve ni que le logiciel est sûr, ni qu’aucune donnée ne sort jamais de l’appareil.
Vos données+Modèle+CPU · GPU · NPUVotre appareil

Selon la priorité

Local ou cloud ?

Ce qu’il faut réunir

Exemple : transcrire une note vocale

Avec un modèle local, le téléphone peut transformer la voix en texte sans envoyer l’enregistrement vers un serveur et même sans connexion. En contrepartie, le modèle doit tenir dans la mémoire de l’appareil et peut être moins rapide ou moins performant qu’un service distant plus puissant.

Un modèle compatible avec le matériel et le logiciel

01

Le fichier du modèle

Poids, architecture, tokenizer, licence et format utilisable.

02

La mémoire

RAM ou VRAM pour les poids, le cache KV et les calculs temporaires.

03

Le moteur d’inférence

Logiciel capable d’exécuter les opérations sur CPU, GPU ou NPU.

04

L’application

Interface, historique, documents, permissions et règles de conservation.

Les gains possibles

Confidentialité, disponibilité et contrôle

Moins de transfert

Données sur place

Possible si l’application ne contacte aucun service externe.

Sans connexion

Usage hors ligne

Utile sur le terrain ou avec un réseau instable.

Coût fixe

Pas de facture par requête

Mais matériel, électricité et maintenance ont un coût.

Contrôle

Choix du modèle

Version, format, quantification et mises à jour sont maîtrisés.

Les limites concrètes

Faire tenir ne signifie pas faire tourner vite

Un modèle quantifié peut tenir en mémoire mais rester lent si le processeur ou la bande passante sont insuffisants. Les appareils chauffent, consomment de l’énergie et ne prennent pas tous en charge les mêmes opérations.

  1. 1

    Mémoire
    Poids, contexte et cache doivent tenir.

  2. 2

    Débit
    Mesurer les tokens par seconde sur l’appareil réel.

  3. 3

    Compatibilité
    Format et accélérateur doivent être reconnus.

  4. 4

    Sécurité
    Téléchargements et extensions restent des logiciels à contrôler.

Sources de référence

Pour approfondir

Les moteurs locaux gèrent tokenisation, inférence, échantillonnage et cache sur différents accélérateurs.

Microsoft ONNX RuntimeGénération locale et accélérateurs →ONNX RuntimePetits modèles sur NPU →

Sources consultées le 28 septembre 2026.

Étape suivante

Un modèle local ou distant peut aussi utiliser des outils. Voyez comment.

Agents et appels d’outils

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.