Ce que le modèle voit réellement

Comment lire un jeu de données pour l’IA ?

Un jeu de données est une collection d’exemples. Chaque exemple contient des informations disponibles — les caractéristiques — et parfois la réponse que le modèle doit apprendre à prédire — l’étiquette.

À retenirUne grande quantité de données ne compense pas automatiquement des exemples faux, incomplets ou différents de la réalité.
Surface
Pièces
Prix
42 m²
2
185 000 €
78 m²
4
312 000 €
CaractéristiquesÉtiquette

Le vocabulaire de base

Une ligne, des indices et une réponse

Exemple

Un cas observé

Une maison, un message, une photo ou une transaction. Dans un tableau, c’est souvent une ligne.

Étiquette

La réponse attendue

Prix réel, « spam », espèce photographiée. Elle guide l’apprentissage supervisé.

Une bonne caractéristique

Les limites commencent dans le jeu de données

Une caractéristique peut être facile à mesurer mais peu pertinente, une étiquette peut contenir des erreurs et certaines personnes peuvent être sous-représentées. Si la réponse attendue se glisse accidentellement dans les données d’entrée, le modèle semblera excellent pendant le test sans savoir généraliser.

Disponible au bon moment et réellement utile

Une information peut être très corrélée à la réponse sans pouvoir être utilisée en situation réelle. Si elle n’existe qu’après l’événement à prédire, elle crée une fuite.

  1. 1

    Disponible
    Connue au moment exact où la prédiction sera faite.

  2. 2

    Fiable
    Mesurée de façon cohérente et suffisamment complète.

  3. 3

    Pertinente
    Reliée au problème, pas seulement à un hasard du fichier.

  4. 4

    Acceptable
    Collectée et utilisée dans un cadre légal et légitime.

Trois ensembles séparés

Apprendre, choisir, puis évaluer

Entraînement · 70 %Ajuster les paramètres
Validation · 15 %Comparer les réglages
Test · 15 %Mesurer une dernière fois

Les proportions sont un exemple, pas une règle universelle. Le point essentiel est l’indépendance du test et sa ressemblance avec l’usage réel.

La fuite de données

Quand le modèle reçoit discrètement la réponse

Un test peut paraître excellent si une information du futur, un doublon ou une trace de l’étiquette se glisse dans les caractéristiques. En production, cet indice disparaît et la performance s’effondre.

ObjectifPrédire une annulation+Caractéristique interdite« Date d’annulation »=RésultatScore artificiellement parfait

Contrôle qualité

Six questions avant d’entraîner

  1. 1

    Qui manque ?
    Certains profils ou situations sont-ils absents ?

  2. 2

    Qui est surreprésenté ?
    Le fichier reflète-t-il vraiment l’usage futur ?

  3. 3

    Les étiquettes sont-elles justes ?
    Comparer plusieurs annotateurs sur les cas ambigus.

  4. 4

    Y a-t-il des doublons ?
    Ils peuvent contaminer entraînement et test.

  5. 5

    Les valeurs manquantes ont-elles un sens ?
    « Inconnu » n’est pas toujours zéro.

  6. 6

    Peut-on retracer l’origine ?
    Version, date, collecte et transformations.

Sources de référence

Pour approfondir

Google présente un jeu de données comme une collection d’exemples et recommande un test distinct, représentatif et sans doublons de l’entraînement.

Google for DevelopersCaractéristiques et qualité des données →Google for DevelopersSéparer entraînement, validation et test →

Sources consultées le 28 septembre 2026.

Étape suivante

Une fois le test propre, encore faut-il choisir la bonne mesure.

Matrice de confusion et métriques

Dans le parcours « Je comprends comment les modèles apprennent »

Gardez le fil de votre apprentissage.

Une étape courte et clairement reliée à ce que vous venez de lire.