FichesCarte › Partie 01 · L'objet aléatoire › déroulé 04

De l'accuracy au SE en quatre maillons

Fil A, format sonde. Un seul chiffre — 872 bonnes réponses sur 1 000 — et quatre maillons à dire à voix haute, sans support, en trois minutes : ce qui est tiré, la loi de X, la loi de p, le plug-in. On arrive à SE = 0,0106 et à la phrase qui la nomme : le SE décrit la procédure, pas le chiffre. Les mêmes quatre maillons sont ensuite rejoués sur un rappel de 28 positifs retrouvés sur 30, où une cinquième marche s'ajoute.

Ce que ce déroulé suppose acquis
  • La chaîne complète. Ce déroulé ne démontre rien de neuf : il rejoue p01-01 sur un seul exemple, à l'oral, en quatre maillons. Les chiffres sont repris tels quels.
  • Binomiale(n, p). Somme de n Bernoulli(p) indépendantes : E = np, Var = np(1−p).
  • Transformation affine. Var(aX) = a²Var(X) — c'est ce a² qui fabrique le 1/n du SE.
  • Notation. L'estimateur porte son chapeau : p se calcule sur les données, π non. En fréquentiste, p(x ; π) et jamais p(x | π).
Hypothèses de la sonde
H1Le test set est un tirage iid dans la population d'usage. C'est elle, et elle seule, qui fabrique l'aléa dont parlent les quatre maillons. H2Le modèle est figé : ni réentraînement, ni seuil choisi sur ce test set. Une seule entrée dans la colonne aléatoire. H3Les erreurs sont indépendantes d'une ligne à l'autre : une ligne, un individu. H4La sonde se dit sans support et d'une traite. Le texte de droite sert à vérifier après coup, pas à lire pendant.

Les quatre maillons, sur 872/1 000

Ce qui est tiré

Avant toute formule, trois colonnes en une ligne : fixe, aléatoire, procédure. La colonne du milieu n'a qu'une entrée — le test set. X et p en descendent, ce ne sont pas des sources d'aléa de plus.

« Le modèle est figé et π est une propriété de la population, donc la seule chose tirée au sort est le test set, donc le chiffre calculé dessus hérite de cet aléa. »

Au tableau — maillon 1
fixealéatoireprocédure
π (accuracy vraie)
le modèle, ses poids
n = 1 000
le test set (seule entrée)
X = 872
p = 0,872
tirer 1 000 lignes
→ compter les bonnes
→ diviser par n

La troisième colonne est la seule qu'on écrit en toutes lettres : c'est elle que le SE finira par décrire.

La loi de X

Chaque ligne du test set est réussie ou ratée : une Bernoulli(π). Sous H1 et H3 elles sont indépendantes, et X est leur somme.

X ~ Binomiale(1 000, π)    E[X] = 1 000π    Var(X) = 1 000π(1−π)

« Chaque ligne est une Bernoulli(π) et les lignes sont indépendantes, donc X est leur somme, donc X suit une Binomiale(1 000, π), d'espérance 1 000π et de variance 1 000π(1 − π). »

Au tableau — maillon 2

En posant π = 0,87 pour chiffrer :

E[X] = 870    Var(X) = 1 000 × 0,87 × 0,13 = 113,1    σ(X) = 10,6

On en a observé 872. L'écart de 2 lignes tient dans un cinquième d'écart-type : c'est le tirage, pas une anomalie.

La loi de p tronc

p = X/n : une transformation affine de coefficient 1/n. L'espérance se divise par n, la variance par n².

E[p] = π    Var(p) = π(1−π)/n    SE = √(π(1−π)/n)

Le SE est l'écart-type de la distribution d'échantillonnage : la largeur de l'histogramme qu'on obtiendrait en refaisant l'expérience. Il décroît en 1/√n.

« p est X divisé par n, donc son espérance vaut π et il est non biaisé, donc sa variance est celle de X divisée par n², c'est-à-dire π(1 − π)/n, donc le SE vaut √(0,87 × 0,13 / 1 000) = 0,0106. »

Au tableau — maillon 3
Var(p) = 0,87 × 0,13 / 1 000 = 1,131·10−4    SE = 0,010635

Arrondi de sonde : 0,0106. Le SE de p est exactement σ(X)/1 000 = 10,6/1 000 — même largeur, deux unités.

Vérification de cohérence à dire en passant : ×100 sur n ⇒ ÷10 sur le SE.

Figure 1 — la largeur qu'on ne voit jamais

Chaque tirage simule un test set entier de 1 000 lignes (1 000 Bernoulli, vraiment tirées) et pose son p dans l'histogramme. Le trait bleu est π = 0,87, fixe ; le trait ambre pointillé est p = 0,872, le seul point qu'on observe dans la vraie vie ; le trait rouge est la moyenne des tirages. Clique « tirer 500 » : l'écart-type affiché sous la figure converge vers le 0,0106 calculé à gauche. C'est la même largeur, une fois mesurée, une fois dérivée.

Le plug-in, et le mot « procédure » tronc

La formule du SE contient π, qui est justement l'inconnue. On y substitue l'estimateur :

SE = √(p(1−p)/n)

Légitime car pp(1−p) varie lentement autour de son argument : l'erreur est un ordre de grandeur sous la quantité estimée.

« Le SE dépend de π qui est inconnu, donc on y branche p = 0,872, donc on obtient 0,01056 au lieu de 0,010635, donc on rapporte 0,872 ± 0,011 où 0,011 décrit la procédure. »

Au tableau — maillon 4, et la phrase
SE calculé envaleur
π = 0,87 (inaccessible)0,010635
p = 0,872 (plug-in)0,010565

Écart : 7·10−5, soit 0,7 % du SE. Les deux donnent 0,872 ± 0,011.

Le mot « procédure », cash. « 0,872 ± 0,011 » se traduit mot à mot : « la procédure “tirer 1 000 lignes dans la population d'usage, compter les bonnes réponses du modèle figé, diviser par 1 000” produit des valeurs dispersées de 0,011 autour de π ; celle que j'ai tirée vaut 0,872. »

Test de la phrase : 0,872 est tombé, il ne varie plus, il n'a pas de variance. Passer à n = 10 000 change le SE sans changer π — le SE bouge quand la recette bouge, jamais quand la vérité bouge. Si ce paragraphe ne vient pas, la sonde est tombée.

Le second exemple — les mêmes quatre maillons sur 28/30

Un rappel : 28 positifs retrouvés sur 30 positifs réels. Rien ne change dans les maillons, sauf ce qui est tiré : le rappel conditionne sur les positifs, donc l'échantillon est l'ensemble des 30 positifs.

Maillons 2, 3, 4 mot pour mot, avec n+ = 30 au lieu de 1 000.

« Le rappel se calcule sur les positifs réels, donc l'échantillon tiré est l'ensemble des 30 positifs, donc n vaut 30 et non 1 000, donc le SE vaut √(0,933 × 0,067 / 30) = 0,0455. »

Au tableau — les quatre maillons rejoués
maillonaccuracy 872/1 000rappel 28/30
1 · ce qui est tiréle test set, 1 000 lignesles positifs réels, 30
2 · loi de XBin(1 000, π)Bin(30, ρ)
3 · loi de l'estimateurp = 0,872, SE = 0,0106r = 0,933, SE = 0,0455
4 · plug-in0,872 ± 0,0110,933 ± 0,089

Le SE est 4,3 fois plus large, uniquement parce que le dénominateur est passé de 1 000 à 30. Un rappel sur classe rare est bruité par son effectif de positifs, pas par la prévalence.

La marche 5 du second exemple casse

Sur 872/1 000 la sonde s'arrête au maillon 4. Sur 28/30 il en faut un de plus, parce qu'on a écrit « ± » sans vérifier d'où vient la forme : le ± 1,96 SE de Wald vient du TCL, qui exige succès et échecs ≥ 10. Ici il y a 28 succès et 2 échecs.

« Wald suppose r approximativement normale, donc il exige succès et échecs ≥ 10 chacun, donc avec 2 échecs seulement sa borne haute sort à 1,023, hors de [0 ; 1], donc on change d'intervalle — Wilson, [0,787 ; 0,982] — et non de formule de SE. »

Trois limites
  • Wald déborde. 0,933 ± 1,96 × 0,0455 = [0,844 ; 1,023]. Une borne au-dessus de 1 pour une proportion : c'est la forme normale qui a lâché, pas le SE. Wilson résout l'équation en π au lieu d'y brancher r, et reste dans [0 ; 1] : [0,787 ; 0,982].
  • Ce qui casse est le nombre d'échecs. min(succès, échecs) = 2 < 10. Une classe de prévalence 1 % avec 4 000 positifs et 300 échecs ne pose aucun problème ; 30 positifs dont 2 ratés, si. La prévalence n'est pas le critère.
  • Les maillons 1 à 3 tiennent quand même. Le modèle Bernoulli, l'additivité des variances et √(r(1−r)/n+) restent valides : 0,0455 est le bon SE. Seule l'étape « largeur ⇒ intervalle » demande une autre recette.

Résumé

À retenir
  1. Maillon 1 — ce qui est tiré : le test set, seule entrée. Fixe π · aléatoire test set → Xp · procédure tirer → compter → diviser.
  2. Maillon 2X ~ Binomiale(1 000, π) : E = 870, Var = 113,1.
  3. Maillon 3p = X/n : E = π, Var = π(1−π)/n, SE = √(0,87 × 0,13 / 1 000) = 0,0106.
  4. Maillon 4 — plug-in de p : 0,01056. On rapporte 0,872 ± 0,011, et 0,011 décrit la procédure, pas le 0,872 qui est tombé.
  5. Second exemple — rappel 28/30 : seul le maillon 1 change (n+ = 30), SE = 0,0455, soit 4,3 fois plus large.
  6. Marche 5 — 2 échecs < 10 : Wald sort à 1,023, Wilson donne [0,787 ; 0,982]. C'est le nombre d'échecs qui casse la forme, jamais la prévalence.
« Le modèle est figé, donc la seule chose tirée au sort est le test set, donc l'accuracy observée est une variable aléatoire : centrée sur π, de largeur √(π(1 − π)/n) que j'estime par plug-in, soit 0,0106 sur 872 pour 1 000. J'écris 0,872 ± 0,011, et ce 0,011 est une propriété de la procédure d'évaluation — tirer, compter, diviser — pas du chiffre que j'ai en main. »

Chaîne verbalisée — la sonde, à voix haute, sans support

4 maillons · clique pour révéler après avoir dit
  1. 872 sur 1 000. Qu'est-ce qui est aléatoire là-dedans ?
    Le test set, seule entrée. X et p̂ en descendent ; π et le modèle figé sont fixes ; la procédure est « tirer 1 000 lignes → compter → diviser ».
  2. Quelle est la loi de X ?
    Binomiale(1 000, π) : somme de 1 000 Bernoulli(π) indépendantes. E[X] = 870, Var(X) = 113,1, σ(X) = 10,6.
  3. Et celle de p̂ ? Donne le SE.
    p̂ = X/n : E[p̂] = π (non biaisé), Var(p̂) = π(1−π)/n. SE = √(0,87 × 0,13 / 1 000) = 0,0106.
  4. On ne connaît pas π. Que fais-tu, et que décrit le nombre que tu écris après le ± ?
    Plug-in : p̂ dans la formule, 0,01056. J'écris 0,872 ± 0,011, et 0,011 décrit la procédure « tirer 1 000 lignes, compter, diviser » — la dispersion de ses résultats — pas le 0,872, qui est tombé et ne varie plus.