Annonce 90 %, réussit 65 %
Le nombre inspire plus de confiance que les résultats ne le permettent.
Quand 80 % doit ressembler à 80 %
Parmi de nombreuses prédictions annoncées autour de 80 %, environ 80 % devraient réellement se produire. La calibration vérifie cette correspondance entre les probabilités annoncées et les fréquences observées.
≈ 80 devraient être réellement positifs
Trois comportements
Le nombre inspire plus de confiance que les résultats ne le permettent.
Sur beaucoup de cas comparables, la fréquence rejoint le score annoncé.
Le modèle distingue peut-être bien les cas mais minimise sa fiabilité.
Le diagramme de fiabilité
On rassemble les prédictions proches — par exemple celles entre 70 et 80 % — puis on calcule la proportion réellement positive. Un modèle bien calibré se rapproche de la diagonale idéale.
Deux qualités distinctes
Il peut très bien ordonner les cas tout en donnant de mauvaises probabilités.
Elle devient essentielle lorsque le score sert à doser une action ou un risque.
Recalibrer proprement
Sans utiliser les données réservées à la calibration.
Sur des exemples nouveaux et représentatifs.
Associer les scores bruts à de meilleures probabilités.
Une dérive peut aussi détériorer la calibration.
Ce qui peut tromper
Trop peu de cas
Les fréquences deviennent instables dans chaque groupe.
Données différentes
La calibration peut changer selon la population ou la période.
Groupes trop larges
Ils masquent des écarts importants à l’intérieur.
Score sans catégorie claire
Une similarité ou un logit n’est pas automatiquement une probabilité.
Sources techniques
Ces références expliquent la correspondance entre probabilités annoncées et fréquences réelles, ainsi que l’intérêt de probabilités interprétables pour contrôler un modèle en production.
Sources consultées le 28 septembre 2026.
Repérer l’inhabituel
Comprendre une notion
Une étape courte et clairement reliée à ce que vous venez de lire.