Fiches › Carte › 0 · Socle probabiliste › leçon 11

Théorème central limite

La loi des grands nombres dit où va la moyenne de n mesures : vers μ ; Var(X̄) = σ²/n donne sa largeur, σ/√n. Le théorème central limite dit quelle forme a sa loi en chemin : une cloche, quelle que soit la loi d'une mesure, pourvu que les mesures soient indépendantes, de même loi et de variance finie. La leçon suit Brunton 36, avec ses exemples : mesurer trente fois la vitesse de la lumière, lancer des dés, sonder des électeurs. Elle dit aussi à partir de quel n, où ça casse, et comment on en tire l'intervalle X̄ ± 1,96 σ/√n.

outilà savoir produire au tableau, donnera une cartecultureà comprendre, reste ici, pas de carte▸ blocs à déplier : exemples, preuve, code, où ça casse
Ce que cette leçon suppose acquis
  • La moyenne est une variable aléatoire. X̄ₙ = (X₁ + … + Xₙ)/n change à chaque expérience. E[X̄ₙ] = μ par linéarité ; Var(X̄ₙ) = σ²/n quand les mesures sont indépendantes et de même loi (l10, notion 3).
  • La loi des grands nombres et l'erreur standard. X̄ₙ tend vers μ ; son écart-type σ/√n s'appelle l'erreur standard (SE). La somme, elle, s'écarte de nμ en σ√n (l10, notions 4 et 5).
  • Standardiser. Z = (X − μ)/σ a pour moyenne 0 et pour écart-type 1, et garde la forme de X : standardiser ne rend pas normal (l06, notion 3).
  • La normale. Z ~ N(0, 1), Φ(z) = P(Z ≤ z), et P(|Z| ≤ 1,96) = 0,95 (l04, notion 6). La binomiale s'en approche quand n grandit (l04, notion 7).
  • Le dé et l'asymétrie. Un dé : μ = 3,5, σ² = 35/12 = 2,917, σ = 1,708 (l08, notion 6). L'asymétrie γ₁ = E[((X − μ)/σ)³] dit de quel côté traîne la queue (l08, notion 7).

La leçon

L'énoncé exact : la moyenne standardisée devient normale outil

Brunton 36 · The Central Limit Theorem (énoncés aussi en 01 et 44)

Brunton prend une grandeur difficile à mesurer, la vitesse de la lumière. On refait l'expérience trente fois, on obtient trente valeurs un peu différentes, et on fait leur moyenne. La loi des grands nombres dit où va cette moyenne : vers la vraie valeur μ ; Var(X̄) donne sa largeur, σ/√n. Le théorème central limite dit quelle forme a sa loi : une cloche, quelle que soit la loi d'une seule mesure.

Avec des dés, la cloche se fabrique sous nos yeux. Un dé : six barres plates. La moyenne de deux dés : un triangle, où 3,5 sort avec probabilité 6/36. La moyenne de quatre dés : déjà une cloche, qui tombe à moins d'un SE (0,854) de 3,5 dans 68,2 % des cas ; la normale dit 68,3 %.

Mais quand n grandit, la cloche s'écrase sur 3,5 et finit en un trait. Pour garder sa forme en vue, il faut zoomer au rythme où elle se resserre : retirer μ, diviser par σ/√n. C'est cette moyenne standardisée qui converge vers N(0, 1).

Voir l'idée — refaire l'expérience : n dés, une moyenne, mille fois

Chaque expérience lance n dés et garde leur moyenne x̄ ; Brunton annonce cette expérience sur ordinateur (n = 100, refaite 50 fois) ; ici, elle est refaite 1 000 fois. En haut, l'axe brut de 1 à 6 : monte n, la cloche se resserre sur 3,5 jusqu'à n'être plus qu'un trait, c'est la loi des grands nombres. En bas, les mêmes moyennes zoomées, z = (x̄ − 3,5)/(σ/√n) : leur écart-type reste 1, et leur forme rejoint la courbe rouge N(0, 1) (dès n = 10, les valeurs voisines sont regroupées en classes, sinon 1 000 tirages répartis sur 150 barres feraient des dents de scie). À n = 1, six barres plates ; à n = 2, un triangle ; à n = 4, déjà une cloche. Refaire tire 1 000 nouvelles expériences.

L'énoncé
Zn = (X̄n − μ)/(σ/√n)     P(Zn ≤ z) → Φ(z) pour tout z, quand n → ∞
  • X₁, …, Xₙ indépendantes : chaque mesure apporte un aléa neuf. C'est ce qui donne Var(X̄ₙ) = σ²/n, et ce qui empêche un aléa commun de survivre à la moyenne (notion 4).
  • de même loi : un seul μ et un seul σ, ceux d'une mesure. C'est ce qui fait de σ/√n la bonne échelle. L'hypothèse peut s'affaiblir (condition de Lindeberg) : des lois différentes conviennent si aucun terme ne domine la somme.
  • de variance σ² finie, et non nulle : sans elle, l'échelle σ/√n n'existe pas et la limite n'est plus normale ; si même la moyenne manque, comme pour la Cauchy, X̄ ne se resserre pas du tout (notion 4).
  • « → » est une convergence en loi : c'est la fonction de répartition de Zₙ qui tend vers Φ (figure 1). Pas une densité : la moyenne de n dés n'en a pas.
  • À n fixé, on s'en sert sous la forme approchée X̄ₙ ≈ N(μ, σ²/n) : « ≈ » et non « = », et la qualité de l'approximation dépend de la loi (notion 2).
Figure 1 — ce qui converge : la fonction de répartition

L'escalier est la fonction de répartition exacte de Zₙ, la moyenne standardisée de n dés ; la courbe rouge est Φ. L'énoncé dit que l'écart entre les deux tend vers 0 partout. Monte n : l'écart maximal, marqué en ocre, vaut 0,143 à n = 1, 0,059 à n = 4, 0,021 à n = 30, 0,012 à n = 100. L'escalier reste un escalier : chaque marche est une probabilité P(Sₙ = s), qui rapetisse sans disparaître ; il n'y a pas de densité à faire converger. Choisis la pièce : deux valeurs par lancer, des marches plus hautes ; à n = 100, l'écart vaut encore 0,040, la moitié de la marche centrale P(S = 50) = 0,080.

Exemples simples un dé, quatre dés, la vitesse de la lumière, cent pièces, un batch
  1. Un dé, n = 1. Z = (X − 3,5)/1,708 prend six valeurs, de −1,46 à +1,46, avec la même probabilité. Aucune cloche, et 100 % des valeurs sont dans ±1,96 au lieu de 95 % : le TCL ne dit rien pour un n donné, il parle de la limite.
  2. Quatre dés. SE = 1,708/√4 = 0,854. P(|X̄ − 3,5| ≤ 0,854) = 0,682 exactement (la somme entre 11 et 17), contre 0,683 pour la normale ; P(|X̄ − 3,5| ≤ 1,96 × 0,854) = 0,946, contre 0,95.
  3. Trente mesures de la vitesse de la lumière (Brunton). Disons que chaque mesure a un bruit d'écart-type 100 km/s, valeur prise pour l'illustration, la même qu'en l10. La moyenne de 30 mesures a pour SE 100/√30 = 18,26 km/s ; elle tombe à moins de 1,96 × 18,26 = 35,8 km/s de la vraie valeur dans environ 95 % des cas, que le bruit soit uniforme, exponentiel ou autre, pourvu que les mesures soient indépendantes, de même loi et de variance finie.
  4. Cent pièces. X̄ est la proportion de piles : μ = 0,5, σ = 0,5, SE = 0,05, donc Z = (X̄ − 0,5)/0,05. La normale limite de la binomiale (l04, notion 5) est ce cas particulier du TCL, avec des Bernoulli.
  5. Exemple ML : la perte d'un batch. Sur un batch de 256 exemples tirés au hasard, la perte est la moyenne de 256 pertes individuelles. Elle fluctue autour de la perte moyenne μ avec un écart-type σ/√256 = σ/16, et sa loi est proche d'une normale même quand la perte d'un exemple est asymétrique, comme une cross-entropy, tant que cette asymétrie reste modérée : celle de la moyenne vaut γ₁/16 (notion 2). C'est l'argument derrière le bruit gaussien qu'on prête souvent au gradient de mini-batch ; il tombe quand les pertes individuelles ont des queues lourdes (notion 4).
Pourquoi ce zoom, et où est la preuve culture : centre et largeur sont fixés, seule la forme reste
E[Zn] = (E[X̄n] − μ)/(σ/√n) = 0
E[X̄ₙ] = μ par linéarité (l10, notion 3)
Var(Zn) = Var(X̄n)/(σ²/n) = 1
Var(aY + b) = a² Var(Y) (l08, notion 9) ; Var(X̄ₙ) = σ²/n sous indépendance

Le zoom fixe le centre à 0 et la largeur à 1 pour tout n. Le TCL n'apprend donc rien sur le centre ni sur la largeur, déjà connus : il ne dit que la forme. C'est aussi le seul bon zoom. Zoomer moins, en divisant par σ/n0,4, plus grand que σ/√n, laisse une variance n−0,2 qui tend vers 0 : la loi s'écrase encore. Zoomer plus, avec σ/n0,6, donne n0,2 : elle s'étale sans fin.

La preuve que la forme limite est normale passe par la fonction génératrice des moments : c'est l'objet de l12, notion 6.

Simuler en Python 100 000 moyennes standardisées, et des données qui restent plates
import numpy as np
from scipy.stats import norm

rng = np.random.default_rng(0)
mu, sigma = 3.5, np.sqrt(35 / 12)          # one fair die
reps = 100_000                             # repeat the experiment 100,000 times
for n in (1, 4, 30):
    rolls = rng.integers(1, 7, size=(reps, n))
    z = (rolls.mean(axis=1) - mu) / (sigma / np.sqrt(n))   # standardized mean
    inside = np.mean(np.abs(z) <= 1.96)
    print(f"n={n:2d}  mean(Z)={z.mean():+.3f}  sd(Z)={z.std():.3f}  "
          f"P(Z<=1)={np.mean(z <= 1):.3f}  P(|Z|<=1.96)={inside:.3f}")
print(f"N(0,1)                          P(Z<=1)={norm.cdf(1):.3f}  "
      f"P(|Z|<=1.96)={norm.cdf(1.96) - norm.cdf(-1.96):.3f}")

# the data themselves do not become normal: the 3,000,000 rolls of n=30 stay flat
share = np.bincount(rolls.ravel(), minlength=7)[1:] / rolls.size
print("share of each face among all rolls:", np.round(share, 3))
n= 1  mean(Z)=-0.001  sd(Z)=0.999  P(Z<=1)=0.835  P(|Z|<=1.96)=1.000
n= 4  mean(Z)=+0.002  sd(Z)=0.999  P(Z<=1)=0.841  P(|Z|<=1.96)=0.946
n=30  mean(Z)=+0.004  sd(Z)=1.000  P(Z<=1)=0.844  P(|Z|<=1.96)=0.953
N(0,1)                          P(Z<=1)=0.841  P(|Z|<=1.96)=0.950
share of each face among all rolls: [0.167 0.167 0.166 0.167 0.167 0.167]
Où ça casse
  • « X̄ devient normale » est mal dit. X̄ₙ tend vers μ, une constante, et N(μ, σ²/n) s'écrase en un trait (vignette, en haut). Ce qui a une loi limite non dégénérée, c'est (X̄ₙ − μ)/(σ/√n). « X̄ₙ ≈ N(μ, σ²/n) » est une approximation à n fixé, pas une limite.
  • Ce sont les moyennes qui deviennent normales, pas les données. Les 3 millions de lancers du code restent plats : chaque face sort une fois sur six. Beaucoup de données ne rendent pas une loi gaussienne ; seules une moyenne, une somme ou un estimateur qui se comporte comme elles le deviennent.
  • Convergence en loi, pas de densité. La moyenne de n dés reste discrète pour tout n : P(X̄₂ = 3,5) = 6/36, et pour tout n chaque valeur s/n a une probabilité > 0 ; elle n'a pas de densité. Ce qui converge, c'est P(Zₙ ≤ z) (figure 1) ; c'est pour cela que l'énoncé exact s'écrit avec Φ.
  • Standardiser ne suffit pas. Une seule exponentielle standardisée a moyenne 0 et écart-type 1, mais reste une exponentielle décalée (l06, notion 3). C'est la moyenne de beaucoup de termes qui fabrique la cloche, pas la standardisation.
  • Le TCL ne dit pas à partir de quel n. C'est une limite ; la vitesse dépend de la loi (notion 2).
Brunton, rectifiéBrunton (01) énonce le TCL comme « la moyenne de variables de même loi devient normale », et (36) écrit « X̄ₙ est normale, de moyenne μ et de variance σ²/n » comme une égalité, sans dire ce qui converge (à l'oral, seulement « quand n grandit, elle commence à être distribuée comme une gaussienne »). C'est : si X₁, …, Xₙ sont indépendantes, de même loi et de variance σ² finie, alors (X̄ₙ − μ)/(σ/√n) converge en loi vers N(0, 1) ; X̄ₙ, elle, tend vers μ. En 44, il donne la bonne forme, avec Φ, mais annonce sa stratégie par « même fonction génératrice, donc même densité » : c'est la fonction de répartition qui converge, comme il le dit en 36 (« techniquement, c'est la fonction de répartition ») et dans sa conclusion.

X₁, …, Xₙ indépendantes, de même loi, de variance σ² finie : (X̄ₙ − μ)/(σ/√n) converge en loi vers N(0, 1), et X̄ₙ ≈ N(μ, σ²/n) à n fixé. Ce sont les moyennes qui deviennent normales, pas les données.

La vitesse : symétrie, asymétrie, événements rares outil

Brunton 36

Le TCL est une limite : il dit que la cloche finira par être là, pas quand. Brunton annonce l'expérience sur ordinateur, n = 100 refait 50 fois. Faite sur trois lois au même n, elle montre que la réponse dépend de la loi de départ.

À n = 30, la moyenne de 30 dés colle à la normale. Celle de 30 attentes exponentielles, l'attente entre deux mails, penche encore, avec une queue à droite. Celle de 30 Bernoulli(0,02), la proportion d'un événement rare, n'est même pas une cloche : 54,5 % des échantillons ne contiennent aucun succès.

Deux règles le résument. L'asymétrie de la moyenne vaut celle d'une mesure divisée par √n : 2/√30 = 0,37 pour l'exponentielle, et il faut quadrupler n pour la diviser par deux. Pour une proportion, ce qui compte est le nombre de succès attendus, np, et celui des échecs, n(1 − p), pas n : on en demande au moins 10 de chaque.

Voir l'idée — trois lois, le même n

Les lois exactes des trois moyennes, standardisées, sur le même axe que N(0, 1) en rouge. À n = 30 : les dés collent à la courbe ; les exponentielles montent plus vite à gauche et traînent à droite (asymétrie 0,37) ; les Bernoulli(0,02) ne prennent que quelques valeurs, et la barre de gauche, zéro succès, porte 54,5 % des échantillons. Passe à n = 100 puis n = 500 : l'asymétrie de l'exponentielle tombe à 0,20 puis 0,09, et la Bernoulli ne ressemble à une cloche qu'à n = 500, quand np atteint 10.

Les deux règles
asymétrie(X̄n) = γ₁/√n    exponentielle : 2/√n    Bernoulli(p) : (1 − 2p)/√(np(1 − p))     proportion : np ≥ 10 et n(1 − p) ≥ 10
  • γ₁ = E[((X − μ)/σ)³] est l'asymétrie d'une seule mesure (l08, notion 7) : 0 pour un dé ou une pièce équilibrée, 2 pour une exponentielle. La règle demande l'indépendance et un moment d'ordre 3 fini (preuve dépliable).
  • Une loi symétrique part de γ₁ = 0 : sa moyenne est symétrique dès n = 1. Il reste l'épaisseur des queues, qui s'efface plus vite encore, en 1/n, et, pour une loi discrète comme le dé, les marches de la figure 1.
  • np est le nombre de succès attendus. Le seuil varie selon les auteurs, 5 ou 10 ; 10 est le plus prudent, et c'est celui de la suite (p01-01).
  • Culture, l'inégalité de Berry-Esseen : supz |P(Zₙ ≤ z) − Φ(z)| ≤ C · E|X − μ|³/(σ³√n), avec une constante C inférieure à 0,48. L'erreur décroît en 1/√n, d'autant plus lentement que la loi a de la queue. Pour une Bernoulli(p) avec p petit, E|X − p|³/σ³ ≈ 1/√p, et la borne vaut environ 0,48/√(np) : c'est np qui règle l'erreur, pas n.
Figure 2 — l'exponentielle : l'asymétrie s'efface en 1/√n

La densité exacte de la moyenne de n exponentielles de moyenne 1, une loi Gamma, en bleu, contre la normale N(1, 1/n) que promet le TCL, en pointillé rouge, toutes deux à la même échelle verticale. Les traits verticaux sont μ ± 1,96 SE. Monte n : à n = 2 la densité part de 0 et traîne loin à droite ; à n = 10 son sommet est encore à gauche de 1. À n = 100 l'œil ne voit plus rien, mais les queues, si : 3,0 % des moyennes au-delà de μ + 1,96 SE au lieu de 2,5 %, et 1,9 % en deçà de μ − 1,96 SE. À n = 30, 3,4 % et 1,4 %.

Figure 3 — un événement rare : c'est np qui compte

La loi exacte de la proportion observée p̂ quand p = 0,02, en barres, contre la normale N(p, p(1 − p)/n), en pointillé rouge. L'axe descend sous 0 pour montrer ce que la normale y met : des proportions négatives. À n = 20, trois barres seulement dans le cadre ; à n = 100, np = 2 : un peigne collé à 0, où 13,3 % des échantillons n'ont aucun succès, et la normale met 7,7 % de sa masse sous 0 ; à n = 500, np = 10 : une cloche encore penchée, d'asymétrie 0,31 ; à n = 5 000, la cloche. Compare avec la figure 2 : au même n = 100, une cloche presque symétrique là-bas, un peigne ici.

Exemples simples dé, exponentielle, Bernoulli rare, deux pièces, un taux de conversion
  1. Le dé : γ₁ = 0. À n = 4, la moyenne est déjà symétrique : 2,7 % au-delà de chaque borne ±1,96 SE, au lieu de 2,5 %.
  2. L'exponentielle : γ₁ = 2. À n = 30, l'asymétrie vaut 0,37 : 3,4 % des moyennes au-delà de μ + 1,96 SE, 1,4 % en deçà de μ − 1,96 SE. À n = 100, 0,20 : 3,0 % et 1,9 %. Le total reste proche de 5 %, mais mal réparti, et c'est un test d'un seul côté qui en pâtit.
  3. Bernoulli(0,02) : γ₁ = 0,96/√(0,02 × 0,98) = 6,86. À n = 100, np = 2 : asymétrie 0,69, 13,3 % des échantillons sans succès, 7,7 % de la normale sous 0. À n = 500, np = 10 : asymétrie 0,31.
  4. Deux pièces, n = 30. Équilibrée : asymétrie 0, 15 succès attendus. Truquée à p = 0,1 : asymétrie 0,49, np = 3, et 4,2 % des séries de 30 lancers sans un seul succès.
  5. Exemple ML : un taux de conversion. 2 %, c'est rare ; mais sur 10 000 visiteurs, cela fait 200 succès attendus. np = 200 dépasse 10 de loin, l'asymétrie de p̂ vaut 0,07 et le TCL s'applique sans souci. Ce n'est pas la rareté qui compte, c'est le nombre de succès.
Preuve culture : pourquoi l'asymétrie se divise par √n

Pose Yᵢ = Xᵢ − μ : E[Y] = 0, E[Y²] = σ², E[Y³] = γ₁σ³.

E[(Y₁ + … + Yₙ)³]
la somme centrée, au cube
= Σi E[Yi³] + 3 Σi ≠ j E[Yi² Yj]
développer le cube : les cubes, puis les carrés croisés…
  + 6 Σi < j < k E[Yi Yj Yk]
… et les triples produits
= n γ₁ σ³ + 0 + 0
indépendance : E[Yᵢ² Yⱼ] = E[Yᵢ²] E[Yⱼ] = 0, de même pour le triple produit ; c'est ici qu'elle sert
asymétrie(Sₙ) = n γ₁ σ³ / (nσ²)3/2 = γ₁/√n
Var(Sₙ) = nσ² ; on divise par l'écart-type au cube
asymétrie(X̄ₙ) = asymétrie(Sₙ)
X̄ₙ = Sₙ/n : un moment réduit ne change pas quand on multiplie par une constante positive
Simuler en Python asymétrie et queues de l'exponentielle, Bernoulli rare
import numpy as np
from scipy.stats import skew

rng = np.random.default_rng(1)
reps = 100_000
for n in (30, 100):                        # mean of n Exponential(1): mu = sigma = 1
    m = rng.exponential(1.0, size=(reps, n)).mean(axis=1)
    z = (m - 1) / (1 / np.sqrt(n))
    print(f"exponential n={n:3d}: skew {skew(z):.2f} (theory {2 / np.sqrt(n):.2f})  "
          f"P(Z>1.96)={np.mean(z > 1.96):.3f}  P(Z<-1.96)={np.mean(z < -1.96):.3f}")

p = 0.02                                   # a rare event: Bernoulli(0.02)
for n in (30, 100, 500):
    phat = rng.binomial(n, p, size=reps) / n
    none = np.mean(phat == 0)              # share of samples without a single success
    print(f"Bernoulli(0.02) n={n:3d}: np={n * p:4.1f}  "
          f"no success {none:.1%}  skew {skew(phat):.2f}")
exponential n= 30: skew 0.36 (theory 0.37)  P(Z>1.96)=0.033  P(Z<-1.96)=0.014
exponential n=100: skew 0.20 (theory 0.20)  P(Z>1.96)=0.030  P(Z<-1.96)=0.020
Bernoulli(0.02) n= 30: np= 0.6  no success 54.6%  skew 1.25
Bernoulli(0.02) n=100: np= 2.0  no success 13.4%  skew 0.68
Bernoulli(0.02) n=500: np=10.0  no success 0.0%  skew 0.32
Où ça casse
  • « n ≥ 30 » n'est pas un théorème. À n = 30, l'exponentielle penche encore et la Bernoulli(0,02) est un peigne. Pour une loi symétrique et bornée, 30 est large ; pour une loi asymétrique ou un événement rare, il ne suffit pas.
  • np ≥ 10 porte sur les succès et sur les échecs. Un rappel de 93 % mesuré sur 30 positifs a 28 succès mais 2 échecs : la loi de p̂ est collée à 1, et l'intervalle normal en sort (notion 5).
  • Une queue lourde coûte très cher. Le patrimoine log-normal de l08 (σ = 1,79) a une asymétrie de 129 : pour ramener celle de la moyenne à 0,2, il faudrait environ 420 000 ménages.
  • La vitesse dépend du critère. En écart maximal entre fonctions de répartition, la moyenne de 30 dés (0,021) fait à peine mieux que celle de 30 exponentielles (0,024), parce qu'elle reste un escalier (figure 1). Pour un intervalle, ce sont les queues à ±1,96 qui comptent : 2,4 % de chaque côté pour les dés, 3,4 % et 1,4 % pour les exponentielles.

Pour que p̂ soit approximativement normale, et l'IC de Wald fiable, il faut np ≥ 10 et n(1 − p) ≥ 10 : le nombre de succès et d'échecs, pas n.

La version somme : Sₙ ≈ N(nμ, nσ²) outil

Brunton 36

Brunton écrit aussi le théorème sans diviser par n : la somme Sₙ = X₁ + … + Xₙ est approximativement normale, de moyenne nμ et de variance nσ². C'est le même énoncé. Sₙ = n X̄ₙ, et multiplier par n une variable presque normale donne une variable presque normale (l06), dont le centre et l'écart-type sont multipliés par n.

Cent dés : la somme est centrée sur 350, d'écart-type 1,708 × √100 = 17,1. D'après la normale, avec la correction de continuité (379,5), P(S ≥ 380) ≈ 4,2 % ; le calcul exact donne aussi 4,2 %. La binomiale est le cas où chaque terme est une Bernoulli : le nombre de piles sur 400 lancers est une somme de 400 termes.

La différence avec la moyenne est la largeur. Celle de la somme grandit en σ√n quand celle de la moyenne rétrécit en σ/√n : la somme ne converge vers rien, seule sa forme se stabilise.

Voir l'idée — le même tirage, lu en somme et en moyenne

La loi exacte de la somme de n dés en haut, sur un axe de 0 à 420, et celle de leur moyenne en bas, sur un axe de 1 à 6 ; en pointillé rouge, la normale N(nμ, nσ²) sur la somme. Les crochets vont de −σ à +σ. Lance de 1 à 100, ou bouge n : la cloche du haut glisse vers la droite et s'élargit, jusqu'à 17,1 d'écart-type à n = 100 ; celle du bas reste sur 3,5 et se resserre, jusqu'à 0,171. C'est le même tirage, divisé ou non par n. La largeur relative de la somme, σ√n/(nμ) = 0,488/√n, baisse quand même : 4,9 % à n = 100.

La formule
Sn = X₁ + … + Xn    (Sn − nμ)/(σ√n) = (X̄n − μ)/(σ/√n) → N(0, 1)    à n fixé : Sn ≈ N(nμ, nσ²)
  • Les hypothèses sont celles de la notion 1 : c'est la même variable standardisée, réécrite (preuve dépliable).
  • E[Sₙ] = nμ par linéarité, sans hypothèse ; Var(Sₙ) = nσ² parce que les variances s'ajoutent sous indépendance (l09, notion 2).
  • Une somme d'entiers (dés, nombres de succès) s'approche mieux avec la correction de continuité : P(S ≥ 380) ≈ P(Y ≥ 379,5), avec Y ~ N(350 ; 17,08²) (l04, notion 7).
  • Cas binomial : une Binomiale(n, p) est la somme de n Bernoulli(p), d'où B(n, p) ≈ N(np, np(1 − p)).
Exemples simples deux dés, cent dés, 400 pièces, cent spams, un jeu de test
  1. Deux dés. La somme est un triangle, de 2 à 12. n = 2 est trop petit : la somme garde la forme de ses termes.
  2. Cent dés. S ≈ N(350 ; 17,08²). P(S ≥ 380) : z = (379,5 − 350)/17,08 = 1,73, d'où 4,21 %, pour 4,20 % exactement.
  3. 400 lancers de pièce (Brunton 16). X ≈ N(200 ; 10²). P(190 ≤ X ≤ 230) = Φ(3) − Φ(−1) = 0,840 sans correction de continuité, 0,852 avec, et 0,852 exactement.
  4. Cent spams à 4 par heure (l05). Le temps pour les recevoir tous est une somme de 100 attentes exponentielles de moyenne 15 min : E = 25 h, σ = 15 min × √100 = 2,5 h. P(S > 30 h) ≈ 1 − Φ(2) = 2,3 % ; la loi exacte, une Gamma, donne 2,8 % : l'asymétrie de l'exponentielle se voit encore dans la queue.
  5. Exemple ML : les erreurs sur un jeu de test (test set). Un modèle qui se trompe 12,8 % du temps fait, sur 1 000 exemples, un nombre d'erreurs qui est une somme de 1 000 Bernoulli : ≈ N(128 ; 10,56²). P(au moins 150 erreurs) ≈ 2,1 % avec la correction de continuité, 2,3 % exactement.
Preuve culture : somme standardisée et moyenne standardisée sont la même variable
(Sn − nμ)/(σ√n) = (n X̄n − nμ)/(σ√n)
Sₙ = n X̄ₙ
= n(X̄n − μ)/(σ√n) = (X̄n − μ)/(σ/√n)
on divise le haut et le bas par n : σ√n/n = σ/√n

Un seul théorème, donc, et deux façons de l'écrire. Brunton préfère la moyenne parce qu'elle parle d'erreur expérimentale et de taille d'échantillon ; la somme sert dès qu'on compte quelque chose (succès, erreurs, temps total).

Simuler en Python les queues de la somme de 100 exponentielles, exactes contre normales
import numpy as np
from scipy.stats import gamma, norm

n = 100                                    # sum of 100 Exponential(1): mean 100, sd 10
S = gamma(a=n)                             # exact law of the sum
for k in (2, 3, 4, 5):
    exact, approx = S.sf(n + k * np.sqrt(n)), norm.sf(k)
    print(f"P(S > mean + {k} sd): exact {exact:.2e}  normal {approx:.2e}  "
          f"ratio {exact / approx:5.1f}")

rng = np.random.default_rng(3)             # check one line by simulation
s = rng.exponential(size=(200_000, n)).sum(axis=1)
print(f"simulated P(S > mean + 3 sd) = {np.mean(s > n + 3 * np.sqrt(n)):.2e}")
P(S > mean + 2 sd): exact 2.79e-02  normal 2.28e-02  ratio   1.2
P(S > mean + 3 sd): exact 2.75e-03  normal 1.35e-03  ratio   2.0
P(S > mean + 4 sd): exact 1.61e-04  normal 3.17e-05  ratio   5.1
P(S > mean + 5 sd): exact 5.92e-06  normal 2.87e-07  ratio  20.7
simulated P(S > mean + 3 sd) = 2.83e-03
Où ça casse
  • La somme ne converge pas. Son centre nμ et sa largeur σ√n grandissent avec n : « Sₙ tend vers N(nμ, nσ²) » n'a pas de sens, la cible bouge. C'est une approximation à n fixé (l10, notion 4 : la somme s'écarte).
  • Loin dans les queues, l'erreur relative explose. Le TCL contrôle l'écart absolu entre fonctions de répartition, pas le rapport entre deux petites probabilités. Pour 100 exponentielles, la vraie probabilité de dépasser la moyenne de 3 écarts-types est 2 fois celle que donne la normale ; de 5 écarts-types, 21 fois (code). Pour 100 dés, P(S ≥ 450) vaut 1,5 × 10⁻⁹ ; la normale dit 2,8 × 10⁻⁹ avec la correction de continuité, 2,4 × 10⁻⁹ sans. Les risques extrêmes ne se calculent pas avec le TCL.
  • Une somme d'entiers sans correction de continuité. Cent pièces, P(X ≥ 60) = 2,84 % exactement ; la normale donne 2,87 % avec la correction, 2,28 % sans.
Brunton, rectifiéBrunton (36) écrit « Sₙ est normale, N(nμ, nσ²) » comme une égalité, et (44), où il prend μ = 0, « Sₙ est normale, N(0, nσ²) ». C'est la somme standardisée, (Sₙ − nμ)/(σ√n), qui converge en loi vers N(0, 1). Sₙ ≈ N(nμ, nσ²) est une approximation à n fixé, de plus en plus large quand n grandit.

Sous les hypothèses du TCL, Sₙ = X₁ + … + Xₙ ≈ N(nμ, nσ²) à n fixé, puisque Sₙ = n X̄ₙ ; son écart-type σ√n grandit, et l'approximation vaut au centre, pas loin dans les queues.

Où ça casse : dépendance, variance infinie, « n ≥ 30 » outil

Brunton 36

Brunton répète que « peu importe la loi des Xᵢ ». C'est vrai de la forme limite, pas des hypothèses, glissées en une phrase : « tant qu'elles sont identiques et indépendantes, avec une moyenne et une variance ». Chacune peut tomber, et chacune casse quelque chose de précis.

Sans variance finie, l'échelle σ/√n disparaît et la limite n'est plus normale. La loi de Cauchy n'a même pas de moyenne : la moyenne de n Cauchy a exactement la loi d'une seule. Avec n = 1 000 comme avec n = 1, une moyenne sur deux tombe à plus de 1 de 0 : moyenner n'apporte rien.

Côté dépendance, un dé recopié cent fois donne une « moyenne de 100 dés » qui reste plate. Plus réaliste : si toutes les mesures partagent une erreur commune, de corrélation ρ = 0,05, l'écart-type de leur moyenne plafonne à 0,38 (mesures d'écart-type σ = 1,708, celui d'un dé) au lieu de tendre vers 0. Et « n ≥ 30 » n'est qu'un ordre de grandeur (notion 2).

Voir l'idée — une moyenne qui ne se resserre pas

2 000 moyennes de n mesures, simulées et centrées, en violet ; en gris derrière, à la même échelle, la référence : 2 000 moyennes de n dés indépendants, dont le pic, plus concentré, sort du cadre. Choisis un cas, puis monte n. Cauchy : la loi ne bouge pas, à n = 1 000 comme à n = 1, et environ 70 % des moyennes restent à plus de 0,5 de 0 (70,5 % en théorie ; les 15,6 % qui tombent hors du cadre ±4 sont comptés à part). Un dé recopié : six barres plates pour tout n, deux tiers au-delà de 0,5. Corrélées, ρ = 0,05 : la cloche se resserre puis s'arrête, environ 20 % au-delà de 0,5 à n = 1 000. Indépendants : la cloche se resserre, et la part tombe presque à 0 dès n = 100.

Ce que chaque hypothèse protège
indépendance ⟶ sinon Var(X̄n) = σ²[ρ + (1 − ρ)/n] → ρσ²
variance finie ⟶ sinon plus d'échelle σ/√n ni de limite normale (Pareto α = 1,5 : X̄n − μ en n−1/3)
moyenne finie ⟶ sinon, par exemple (Cauchy), X̄n a la loi de X₁ pour tout n
n assez grand ⟶ se lit sur γ₁/√n et sur np (notion 2)
  • ρ est la corrélation commune entre deux mesures, par exemple une erreur d'étalonnage partagée : Xᵢ = μ + C + Eᵢ (l10, notion 6). La largeur plafonne à σ√ρ ; la moyenne reste centrée sur μ, seule la largeur ment.
  • Culture : quand la dépendance s'éteint avec la distance (une série temporelle dont la corrélation au décalage k, ρₖ, tend vite vers 0), un TCL tient encore, mais σ² y est remplacée par σ²(1 + 2 Σₖ ρₖ).
  • Culture : des lois différentes conviennent si aucun terme ne domine la somme (condition de Lindeberg). Une seule mesure énorme parmi des petites suffit à casser.
  • Culture : moyenne finie mais variance infinie, comme une Pareto d'indice 1 < α < 2. X̄ₙ → μ, la loi des grands nombres tient ; mais ses fluctuations décroissent en n1/α − 1 au lieu de n−1/2, soit n−1/3 pour α = 1,5, et leur loi limite n'est pas normale (c'est une loi dite stable).
Exemples simples copies, erreur commune, Cauchy, Pareto, A/B test par événement
  1. Copies. X₁ = X₂ = … = Xₙ : un seul dé recopié, ρ = 1. X̄ = X₁ reste plate, d'écart-type 1,708 pour tout n.
  2. Une erreur commune, ρ = 0,05, pour des mesures d'écart-type σ = 1,708, celui d'un dé : l'écart-type de X̄ plafonne à √(0,05 × 2,917) = 0,382 (l10, notion 6). La conséquence pour l'intervalle : à n = 10 000, σ/√n annonce 0,017, et l'intervalle « à 95 % » ne contient μ que 7 % du temps.
  3. Cauchy. P(|X̄ₙ| > 1) = ½ pour tout n, et 95 % des moyennes sont dans ±12,7, à n = 1 comme à n = 1 000 000.
  4. Pareto d'indice 1,5 (moyenne 3, variance infinie). À n = 100, 70 % des moyennes tombent sous 3 et leur médiane vaut 2,69 (simulation) : de rares tirages énormes tirent la moyenne vers le haut, le reste du temps elle reste en dessous.
  5. Exemple ML : un A/B test analysé par événement. Le test est randomisé par utilisateur, mais on calcule le SE sur les clics comme s'ils étaient indépendants. Les clics d'un même utilisateur sont corrélés : le SE est trop petit, et les « victoires » se multiplient (b04). Même effet avec un jeu de test rempli de quasi-doublons, augmentations ou images d'une même vidéo.
Preuve culture : pourquoi la moyenne de n Cauchy est une Cauchy

La fonction génératrice de l12 n'existe pas pour une Cauchy : E[etX] est infinie pour tout t ≠ 0. On prend sa cousine, la fonction caractéristique φ(t) = E[eitX], qui existe toujours, et vaut e−|t| pour une Cauchy standard.

φSₙ(t) = φ(t)n = e−n|t|
somme indépendante : produit des fonctions caractéristiques, comme pour les génératrices (l12)
φX̄ₙ(t) = φSₙ(t/n) = e−n|t|/n = e−|t|
X̄ₙ = Sₙ/n : on évalue en t/n
X̄n ~ Cauchy(0, 1)
même fonction caractéristique, même loi

Pour une loi d'espérance μ finie, la même opération donne φ(t/n)n → eiμt, la fonction caractéristique de la constante μ : c'est la loi des grands nombres. Pour la Cauchy, la queue compense exactement la division par n.

Simuler en Python Cauchy contre dés, et le plafond d'une erreur commune
import numpy as np

rng = np.random.default_rng(2)
reps, sigma = 10_000, np.sqrt(35 / 12)
for n in (1, 10, 100, 1000):
    cauchy = rng.standard_cauchy((reps, n)).mean(axis=1)
    dice = rng.integers(1, 7, (reps, n)).mean(axis=1)
    print(f"n={n:4d}  P(|mean - centre| > 1):  Cauchy {np.mean(np.abs(cauchy) > 1):.3f}"
          f"   dice {np.mean(np.abs(dice - 3.5) > 1):.3f}")

rho = 0.05                                 # a common error C shared by all measurements
for n in (10, 100, 1000):
    C = rng.standard_normal((reps, 1))
    E = rng.standard_normal((reps, n))
    x = 3.5 + sigma * (np.sqrt(rho) * C + np.sqrt(1 - rho) * E)
    iid = sigma / np.sqrt(n)               # what sigma/sqrt(n) promises
    formula = sigma * np.sqrt(rho + (1 - rho) / n)
    sd = x.mean(axis=1).std()
    print(f"n={n:4d}  sd of mean {sd:.3f}   iid {iid:.3f}   formula {formula:.3f}")
n=   1  P(|mean - centre| > 1):  Cauchy 0.497   dice 0.670
n=  10  P(|mean - centre| > 1):  Cauchy 0.500   dice 0.049
n= 100  P(|mean - centre| > 1):  Cauchy 0.501   dice 0.000
n=1000  P(|mean - centre| > 1):  Cauchy 0.500   dice 0.000
n=  10  sd of mean 0.654   iid 0.540   formula 0.650
n= 100  sd of mean 0.418   iid 0.171   formula 0.417
n=1000  sd of mean 0.385   iid 0.054   formula 0.385
Où ça casse
  • Un échantillon a toujours une variance finie. s² se calcule sur n'importe quelles données, même de Cauchy : il ne prouve pas que σ² existe. Les signes d'alerte sont une moyenne courante qui saute à chaque gros tirage (l10, notion 4), ou un seul point qui pèse une part visible de la somme.
  • La dépendance ne se voit pas dans le centre. E[X̄] = μ reste vrai (l10, notion 3) : seule la largeur ment. On la détecte en se demandant quelle est l'unité tirée au hasard (l'utilisateur, le jour, le patient), pas en regardant les lignes.
  • Rééchantillonner ne répare pas la dépendance. Un bootstrap qui tire des lignes corrélées comme si elles étaient indépendantes reproduit la même erreur ; il faut rééchantillonner les groupes.
Brunton, rectifiéBrunton (36) insiste : « peu importe la loi des Xᵢ ». C'est vrai de la forme limite, à condition que les mesures soient indépendantes et de variance finie, ce qu'il ne dit qu'en passant. Et c'est faux pour la vitesse : la loi de départ décide du n nécessaire (notion 2), et une Cauchy n'y arrive jamais.

Le TCL casse quand une hypothèse tombe : corrélation commune ρ > 0, l'écart-type de X̄ plafonne à σ√ρ ; variance infinie, plus d'échelle σ/√n ni de limite normale ; pas de moyenne (Cauchy), X̄ ne se resserre jamais.

La brique de l'intervalle de confiance : X̄ ± 1,96 σ/√n outil

Brunton 36

Brunton finit sur les usages : intervalles de confiance, tests, et « quelle taille de sondage pour connaître l'issue d'une élection ? ». Tout part d'une ligne : la moyenne standardisée est presque N(0, 1), donc elle tombe entre −1,96 et +1,96 avec probabilité 0,95.

Isole μ dans cet événement : −1,96 ≤ (X̄ − μ)/(σ/√n) ≤ 1,96 revient à X̄ − 1,96 σ/√n ≤ μ ≤ X̄ + 1,96 σ/√n. L'intervalle bouge avec l'échantillon ; μ, lui, est fixe. La procédure capture μ dans environ 95 % des échantillons.

Un sondage de 1 000 électeurs donne 52 % pour A. Une voix est une Bernoulli, d'écart-type √(0,52 × 0,48) ≈ 0,50 : SE = 0,0158, et l'intervalle 0,52 ± 0,031 = [0,489 ; 0,551] contient 50 %. On ne peut pas annoncer A. Pour une marge de ±3 points dans le pire cas, p = ½ et σ = 0,5, il faut n = (1,96 × 0,5/0,03)², soit 1 068 personnes.

Voir l'idée — l'intervalle bouge, la vraie part reste

Vingt-cinq sondages de 1 000 électeurs, tirés dans une population où la vraie part de A vaut 0,52 (trait rouge). Chaque barre est l'intervalle p̂ ± 1,96 SE d'un sondage. Les barres bougent, le trait rouge non : en moyenne une sur vingt le manque, et elle passe en rouge. Le pointillé est 50 % : environ trois intervalles sur quatre le contiennent aussi (74,6 % en théorie), et ces sondages-là ne départagent pas A et B. 25 nouveaux sondages : le compte change, la part des barres qui touchent 0,52 tourne autour de 95 %.

La formule
P(X̄ − 1,96 σ/√n ≤ μ ≤ X̄ + 1,96 σ/√n) ≈ 0,95    IC à 95 % : x̄ ± 1,96 σ/√n    taille pour une demi-largeur h : n = (1,96 σ/h)²
  • X̄, la variable, donne l'intervalle aléatoire, avant les données. x̄ est sa réalisation : une fois calculé, [x̄ ± 1,96 σ/√n] contient μ ou ne le contient pas. Le 95 % qualifie la procédure, pas cet intervalle-là.
  • Il faut que le TCL vaille à ce n et pour cette loi : indépendance, variance finie, n assez grand pour l'asymétrie (notions 2 et 4). Pour une proportion, np ≥ 10 et n(1 − p) ≥ 10.
  • σ est en général inconnu. On le remplace par l'écart-type de l'échantillon, ou, pour une proportion, par √(p̂(1 − p̂)) : c'est l'intervalle de Wald. À grand n, cela ne change presque rien ; à petit n avec des données normales, 1,96 devient un quantile de Student, 2,262 pour n = 10 (p01-03).
  • Wilson : on garde p inconnu dans le SE et on résout |p̂ − p| ≤ 1,96 √(p(1 − p)/n) en p ; les bornes restent dans [0, 1] (preuve dépliable).
  • 1,96 = Φ⁻¹(0,975). Pour 90 %, 1,645 ; pour 99 %, 2,576.
Figure 4 — un IC sur une proportion : c'est np qui décide, pas p

La couverture réelle, calculée exactement, de l'intervalle de Wald « à 95 % » sur une proportion, pour n = 30, 100 et 1 000 ; le trait rouge marque 95 %. Sur l'axe de la prévalence p, les trois courbes se séparent : à la même prévalence p = 0,02 (pointillé), Wald couvre 45 % à n = 30, 87 % à n = 100, 95 % à n = 1 000. Passe à l'axe des succès attendus np : chaque courbe glisse de log n, et les trois se superposent. Ce n'est pas la prévalence qui décide, c'est le nombre de succès. Sous np = 10 (pointillé), Wald couvre mal ; au-dessus, il oscille entre 91 et 96 %. Choisis Wilson : il reste entre 92 et 98 % dès np ≥ 1.

Exemples simples un dé suspect, le sondage, un taux de bonnes réponses, un test A/B, un rappel
  1. Un dé suspect. 30 lancers, x̄ = 3,8. Avec σ = 1,708 : 3,8 ± 1,96 × 1,708/√30 = 3,8 ± 0,61, soit [3,19 ; 4,41]. 3,5 est dedans : rien de suspect à ce niveau.
  2. Le sondage de l'idée : 520 voix sur 1 000, [0,489 ; 0,551]. ±3 points demandent 1 068 personnes ; ±1 point, 9 604 : neuf fois plus pour une marge divisée par trois (l10, notion 5).
  3. Exemple ML : un taux de bonnes réponses (accuracy). 872 bonnes réponses sur 1 000 : SE = √(0,872 × 0,128/1 000) = 0,0106, et l'IC vaut [0,851 ; 0,893]. 872 succès et 128 échecs : le TCL tient.
  4. Exemple ML : un test A/B. A convertit 200 visiteurs sur 10 000 (2,0 %), B 240 sur 10 000 (2,4 %). Les deux groupes sont indépendants, donc les variances s'ajoutent (l09, notion 2) : le SE de la différence vaut √(0,02 × 0,98/10 000 + 0,024 × 0,976/10 000) = 0,00207. Différence 0,4 point, z = 1,93, IC [−0,01 ; 0,81] point : il contient 0 de justesse, pas de conclusion à 95 %. Le taux est rare, mais 200 et 240 succès suffisent largement au TCL.
  5. Exemple ML : un rappel. 28 positifs détectés sur 30, dans un jeu de test de 1 000 lignes. Le rappel est la moyenne de 30 Bernoulli, une par positif : son n vaut 30, pas 1 000. La suite est dans « où ça casse ».
Preuve culture : isoler μ, et d'où vient Wilson
−1,96 ≤ (X̄ − μ)/(σ/√n) ≤ 1,96
l'événement de probabilité ≈ 0,95 (notion 1)
−1,96 σ/√n ≤ X̄ − μ ≤ 1,96 σ/√n
multiplier par σ/√n > 0
−X̄ − 1,96 σ/√n ≤ −μ ≤ −X̄ + 1,96 σ/√n
retrancher X̄
X̄ − 1,96 σ/√n ≤ μ ≤ X̄ + 1,96 σ/√n
multiplier par −1 : les inégalités se retournent

Même événement, donc même probabilité : c'est tout ce qu'est un intervalle de confiance. Pour une proportion, σ = √(p(1 − p)) dépend du p inconnu. Wald y branche p̂. Wilson garde p et résout |p̂ − p| ≤ 1,96 √(p(1 − p)/n) en p : une inéquation du second degré, dont les deux racines sont les bornes. Elles restent dans [0, 1] par construction, et l'intervalle n'est pas centré sur p̂ mais tiré vers ½.

Simuler en Python Wald et Wilson sur 28/30, couvertures exactes
import numpy as np
from scipy.stats import binom, norm

z = norm.ppf(0.975)                        # 1.96

def wald(k, n):
    p = k / n; h = z * np.sqrt(p * (1 - p) / n)
    return p - h, p + h

def wilson(k, n):
    p = k / n; c = (p + z**2 / (2 * n)) / (1 + z**2 / n)
    h = z / (1 + z**2 / n) * np.sqrt(p * (1 - p) / n + z**2 / (4 * n**2))
    return c - h, c + h

print("recall 28/30  Wald [%.3f ; %.3f]" % wald(28, 30))
print("recall 28/30  Wilson [%.3f ; %.3f]" % wilson(28, 30))

def coverage(n, p, ci):          # exact: add P(K = k) over the k whose interval holds p
    k = np.arange(n + 1); lo, hi = ci(k, n)
    return binom.pmf(k, n, p)[(lo <= p) & (p <= hi)].sum()

for n, p in ((30, 0.93), (30, 0.02), (100, 0.02), (1000, 0.02), (1000, 0.872)):
    fewest = min(n * p, n * (1 - p))       # expected successes or failures, the fewer
    cw, cs = coverage(n, p, wald), coverage(n, p, wilson)
    print(f"n={n:4d} p={p:.3f}  fewest {fewest:5.1f}   Wald {cw:.3f}  Wilson {cs:.3f}")
recall 28/30  Wald [0.844 ; 1.023]
recall 28/30  Wilson [0.787 ; 0.982]
n=  30 p=0.930  fewest   2.1   Wald 0.883  Wilson 0.945
n=  30 p=0.020  fewest   0.6   Wald 0.454  Wilson 0.978
n= 100 p=0.020  fewest   2.0   Wald 0.866  Wilson 0.949
n=1000 p=0.020  fewest  20.0   Wald 0.950  Wilson 0.947
n=1000 p=0.872  fewest 128.0   Wald 0.951  Wilson 0.948
Où ça casse
  • « 95 % de chances que la vraie part soit dans [0,489 ; 0,551] » est faux en lecture fréquentiste. La vraie part est fixe ; cet intervalle-là la contient ou ne la contient pas. Ce qui vaut 95 %, c'est la part des intervalles qui la contiennent quand on refait le sondage (vignette).
  • Ce n'est pas la prévalence qui casse Wald, c'est le nombre de succès ou d'échecs. Rappel de 28/30 : p̂ = 0,933, SE = √(0,933 × 0,067/30) = 0,0455, et Wald donne [0,844 ; 1,023], qui sort de [0, 1] ; Wilson donne [0,787 ; 0,982]. Il n'y a que 2 échecs. À l'inverse, un taux de 2 % sur 10 000 visiteurs, 200 succès, ne pose aucun problème (figure 4).
  • Le rappel est une Bernoulli sur les positifs. Son n est le nombre de positifs, 30, pas la taille du jeu de test, 1 000 : avec n = 1 000, on trouverait un SE de 0,0079, près de six fois trop petit.
  • σ estimé à petit n. Avec 10 mesures, l'écart-type de l'échantillon fluctue lui-même, et 1,96 devient 2,262 (Student, p01-03).
  • La dépendance rend l'intervalle trop étroit. Avec ρ = 0,05 et n = 1 000 mesures d'écart-type σ = 1,708, celui d'un dé, le vrai SE vaut 0,385 et σ/√n annonce 0,054 : l'intervalle « à 95 % » ne contient μ que 22 % du temps (notion 4).

Si le TCL s'applique, l'intervalle X̄ ± 1,96 σ/√n contient μ pour environ 95 % des échantillons : c'est l'intervalle qui est aléatoire, μ est fixe.

Résumé

À retenir
  1. TCL : X₁, …, Xₙ indépendantes, de même loi, de variance finie ⇒ (X̄ₙ − μ)/(σ/√n) → N(0, 1) en loi.
  2. X̄ₙ, elle, tend vers μ : X̄ₙ ≈ N(μ, σ²/n) est une approximation à n fixé. Ce sont les moyennes, pas les données, qui deviennent normales.
  3. Vitesse : l'asymétrie de la moyenne vaut γ₁/√n (exponentielle : 2/√n) ; pour une proportion, np ≥ 10 et n(1 − p) ≥ 10.
  4. Somme : Sₙ ≈ N(nμ, nσ²), le même théorème ; sa largeur σ√n grandit ; fiable au centre, pas dans les queues lointaines.
  5. Casse : dépendance (plafond σ√ρ) ; variance infinie (plus de limite normale ; sans moyenne, la Cauchy ne se resserre jamais) ; « n ≥ 30 » pris pour une règle.
  6. IC : X̄ ± 1,96 σ/√n capture μ dans environ 95 % des échantillons ; l'intervalle est aléatoire, μ est fixe.
  7. Wald casse par le nombre de succès ou d'échecs, pas par la prévalence : 28/30 donne [0,844 ; 1,023] ; Wilson, [0,787 ; 0,982].
« Si les observations sont indépendantes, de même loi et de variance finie, la moyenne standardisée, (X̄ − μ)/(σ/√n), converge en loi vers une normale standard, quelle que soit la loi de départ ; en pratique X̄ ≈ N(μ, σ²/n), d'où l'intervalle X̄ ± 1,96 σ/√n. La vitesse dépend de la loi : lente si elle est asymétrique, et pour une proportion il faut au moins dix succès et dix échecs. Le théorème casse avec la dépendance et les variances infinies. »

Chaîne verbalisée — une prise, à voix haute

7 maillons · clique pour révéler après avoir dit
  1. Énonce le TCL avec ses hypothèses.
    X₁, …, Xₙ indépendantes, de même loi, de variance σ² finie : (X̄ₙ − μ)/(σ/√n) converge en loi vers N(0, 1).
  2. Pourquoi ne pas dire « X̄ devient normale » ?
    X̄ tend vers μ, une constante ; c'est la version standardisée qui a une loi limite. X̄ ≈ N(μ, σ²/n) n'est qu'une approximation à n fixé.
  3. La moyenne de 30 exponentielles est-elle normale ?
    Pas tout à fait : asymétrie 2/√30 = 0,37 ; 3,4 % des moyennes au-delà de μ + 1,96 SE au lieu de 2,5 %, et 1,4 % en deçà de μ − 1,96 SE.
  4. Pourquoi la moyenne de n Cauchy ne se resserre-t-elle pas ?
    Elle n'a pas de moyenne : la loi des grands nombres elle-même tombe, et X̄ₙ a la loi d'une seule Cauchy, pour tout n.
  5. Quelle est la loi approchée de la somme de 100 dés ?
    N(350 ; 17,08²), puisque nμ = 350 et σ√n = 1,708 × 10 ; P(S ≥ 380) ≈ 4,2 %.
  6. 28 bons sur 30 positifs : pourquoi l'intervalle de Wald échoue-t-il ?
    Deux échecs seulement, n(1 − p̂) = 2 < 10. Wald donne [0,844 ; 1,023] et sort de [0, 1] ; Wilson donne [0,787 ; 0,982].
  7. Que qualifie le 95 % d'un intervalle de confiance ?
    La procédure : la part des échantillons dont l'intervalle contient μ, environ 95 % quand le TCL s'applique. μ est fixe, l'intervalle est aléatoire.