Un cas observé
Une maison, un message, une photo ou une transaction. Dans un tableau, c’est souvent une ligne.
Ce que le modèle voit réellement
Un jeu de données est une collection d’exemples. Chaque exemple contient des informations disponibles — les caractéristiques — et parfois la réponse que le modèle doit apprendre à prédire — l’étiquette.
Le vocabulaire de base
Une maison, un message, une photo ou une transaction. Dans un tableau, c’est souvent une ligne.
Surface, nombre de pièces, mots du message ou pixels de l’image. Elles servent d’indices au modèle.
Prix réel, « spam », espèce photographiée. Elle guide l’apprentissage supervisé.
Une bonne caractéristique
Une caractéristique peut être facile à mesurer mais peu pertinente, une étiquette peut contenir des erreurs et certaines personnes peuvent être sous-représentées. Si la réponse attendue se glisse accidentellement dans les données d’entrée, le modèle semblera excellent pendant le test sans savoir généraliser.
Une information peut être très corrélée à la réponse sans pouvoir être utilisée en situation réelle. Si elle n’existe qu’après l’événement à prédire, elle crée une fuite.
Disponible
Connue au moment exact où la prédiction sera faite.
Fiable
Mesurée de façon cohérente et suffisamment complète.
Pertinente
Reliée au problème, pas seulement à un hasard du fichier.
Acceptable
Collectée et utilisée dans un cadre légal et légitime.
Trois ensembles séparés
Les proportions sont un exemple, pas une règle universelle. Le point essentiel est l’indépendance du test et sa ressemblance avec l’usage réel.
La fuite de données
Un test peut paraître excellent si une information du futur, un doublon ou une trace de l’étiquette se glisse dans les caractéristiques. En production, cet indice disparaît et la performance s’effondre.
Contrôle qualité
Qui manque ?
Certains profils ou situations sont-ils absents ?
Qui est surreprésenté ?
Le fichier reflète-t-il vraiment l’usage futur ?
Les étiquettes sont-elles justes ?
Comparer plusieurs annotateurs sur les cas ambigus.
Y a-t-il des doublons ?
Ils peuvent contaminer entraînement et test.
Les valeurs manquantes ont-elles un sens ?
« Inconnu » n’est pas toujours zéro.
Peut-on retracer l’origine ?
Version, date, collecte et transformations.
Sources de référence
Google présente un jeu de données comme une collection d’exemples et recommande un test distinct, représentatif et sans doublons de l’entraînement.
Sources consultées le 28 septembre 2026.
Étape suivante
Dans le parcours « Je comprends comment les modèles apprennent »
Une étape courte et clairement reliée à ce que vous venez de lire.