La matière première des modèles

Quelles données utilise une IA ?

Une donnée est une information enregistrée sous une forme qu’un système peut traiter : nombre, mot, image, son, clic ou mesure. Seule, elle ne « dit » pas tout. Son origine, sa qualité et la façon dont elle est préparée changent ce que l’IA pourra apprendre.

Texte42ImageVoixClicTempératureUne donnée peut décrire une personne, un objet, une action ou un phénomène.

Observer avant d’apprendre

Que voit réellement le système ?

Choisissez un type de donnée. L’IA ne reçoit pas notre expérience du monde : elle traite une représentation numérique préparée pour une tâche.

Du monde réel au modèle

Une donnée ne passe pas directement dans l’IA

1

Collecter

Créer, mesurer, acheter ou réutiliser des informations provenant de sources identifiées.

2

Trier et nettoyer

Retirer les doublons, corriger des erreurs et limiter les éléments inutiles.

3

Décrire ou annoter

Ajouter parfois une étiquette humaine : « spam », « chat », « avis positif ».

4

Transformer

Convertir les informations en représentations numériques adaptées au modèle.

5

Répartir et contrôler

Séparer entraînement, validation et test, puis documenter la provenance et les limites.

Un exemple et une étiquette

Les humains donnent souvent une partie du sens

Dans l’apprentissage supervisé, des personnes peuvent associer une réponse attendue à chaque exemple. Cette annotation sert de repère au modèle.

Pour détecter les courriels indésirables, on peut fournir le contenu d’un message avec l’étiquette « spam » ou « non-spam ». Si les consignes sont floues ou les annotations incohérentes, le modèle reçoit de mauvais repères.

Exemple

« Vous avez gagné. Cliquez immédiatement pour recevoir votre lot. »

Étiquette humaineSpam probable
Ce repère simplifié dépend de règles définies pour le projet.

La qualité avant la quantité

Un grand jeu de données peut rester mauvais

Un million d’exemples presque identiques ne représente pas forcément le monde réel. Une base utile doit correspondre à la tâche, couvrir les situations importantes et contenir le moins possible d’erreurs évitables.

Exactitude

Les valeurs et les étiquettes sont-elles suffisamment fiables ?

Diversité

Les cas, langues et publics nécessaires sont-ils présents ?

Actualité

Les informations correspondent-elles encore à la réalité ?

Pertinence

Chaque donnée aide-t-elle réellement à accomplir la tâche prévue ?

Public ne signifie pas libre de tout usage

Données publiques, personnelles et sensibles

Une information visible sur Internet peut rester protégée par le droit d’auteur, le droit des données personnelles ou les conditions du site qui la publie.

Personnelle

Elle permet d’identifier directement ou indirectement une personne : nom, image, voix, identifiant, localisation…

Sensible

Elle révèle notamment la santé, les opinions politiques, la religion, la biométrie ou l’orientation sexuelle. Sa protection est renforcée.

Anonymisée

Elle ne doit plus permettre raisonnablement d’identifier une personne. Remplacer un nom par un numéro ne suffit pas toujours.

Votre conversation aussi contient des données

Avant d’envoyer un document à une IA

Vérifiez la règle du service.Conservation, réutilisation, accès et suppression peuvent varier.
Retirez l’inutile.Noms, coordonnées, secrets professionnels et informations médicales ne sont pas nécessaires à la plupart des demandes.
Demandez l’autorisation.Le document d’une autre personne ou d’une entreprise ne vous appartient pas forcément.
Préférez une version fictive.Pour obtenir un modèle ou une méthode, remplacez les vraies informations par des exemples inventés.

Trois idées à corriger

Ce que les données ne garantissent pas

« C’est sur Internet, donc c’est libre. »

Non. L’accès public ne supprime pas automatiquement les droits, la vie privée ni les conditions de réutilisation.

« Plus il y en a, meilleure sera l’IA. »

Non. La quantité ne compense pas toujours des erreurs, un manque de diversité ou un mauvais lien avec la tâche.

« Les données sont neutres. »

Non. Le choix de ce que l’on collecte, exclut, corrige et étiquette reflète des décisions humaines.

Sources pédagogiques et institutionnelles

Pour vérifier les notions

Ces références détaillent la constitution, la qualité et la protection des jeux de données utilisés en apprentissage automatique.

CNILCollecter et qualifier les données d’entraînement →CNILComprendre l’annotation des données →Google for DevelopersCaractéristiques d’un jeu de données →

Sources consultées le 27 septembre 2026.

La suite logique

Voyez comment des données et des choix peuvent créer des biais.

Comprendre les biais

Comprendre une notion

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.