Chapitre 7 · Semestre 3

Échantillonnage et estimation

Probabilités

🎯 Objectifs du chapitre — À la fin de ce chapitre, vous saurez :

  • distinguer paramètres de la population et statistiques de l'échantillon ;
  • décrire la distribution d'échantillonnage d'une moyenne et d'une fréquence (théorème central limite) ;
  • choisir un estimateur sans biais d'une moyenne, d'une variance et d'une proportion ;
  • construire un intervalle de confiance d'une moyenne et d'une proportion ;
  • déterminer la taille d'échantillon nécessaire pour une précision donnée.

7.1 Population, échantillon et sondage

Étudier toute une population coûte cher et prend du temps : on observe donc un échantillon, dont on tire des conclusions sur la population. C'est le principe des enquêtes du HCP (emploi, consommation), des sondages d'opinion, des études de marché et du contrôle qualité.

Population (inconnu) Échantillon (calculé)
Taille $N$ $n$
Moyenne $\mu$ $\bar{x}$
Écart-type $\sigma$ $s$
Proportion $p$ $f$

Pour que l'échantillon soit représentatif, il doit être tiré au hasard (sondage aléatoire simple : chaque individu a la même probabilité d'être choisi). Les instituts utilisent aussi des sondages stratifiés (par région, par milieu urbain ou rural) ou la méthode des quotas.

7.2 La distribution d'échantillonnage de la moyenne

Si l'on tirait tous les échantillons possibles de taille $n$, la moyenne $\bar{X}$ varierait d'un échantillon à l'autre : c'est une variable aléatoire, avec :

$$\boxed{E(\bar{X}) = \mu \qquad \sigma(\bar{X}) = \frac{\sigma}{\sqrt{n}}}$$

Pour un tirage sans remise dans une petite population, on multiplie l'écart-type par le facteur d'exhaustivité $\sqrt{(N - n)/(N - 1)}$, négligeable si $n / N < 10\,\%$.

Théorème central limite : quelle que soit la loi de la population, si $n$ est assez grand (en pratique $n \ge 30$), $\bar{X}$ suit approximativement la loi $\mathcal{N}(\mu ; \sigma / \sqrt{n})$. Si la population est normale, c'est vrai pour tout $n$.

Plus l'échantillon est grand, plus la moyenne observée est proche de la vraie moyenne : pour diviser l'écart-type de $\bar{X}$ par 2, il faut quadrupler la taille de l'échantillon.

7.3 La distribution d'échantillonnage d'une fréquence

La fréquence $F$ observée dans un échantillon de taille $n$ vérifie :

$$E(F) = p \qquad \sigma(F) = \sqrt{\frac{p\,(1 - p)}{n}} \qquad F \approx \mathcal{N}\left(p ; \sqrt{\frac{p(1 - p)}{n}}\right) \text{ si } np \ge 5 \text{ et } n(1 - p) \ge 5$$

7.4 L'estimation ponctuelle

Un estimateur est une statistique calculée sur l'échantillon pour approcher un paramètre inconnu. Un bon estimateur est sans biais (son espérance est égale au paramètre) et convergent (sa variance tend vers 0 quand $n$ augmente).

Paramètre Estimateur sans biais
Moyenne $\mu$ $\bar{x}$
Proportion $p$ $f$
Variance $\sigma^2$ $s^2 = \dfrac{n}{n - 1} \times V_{\text{éch}} = \dfrac{1}{n - 1} \sum (x_i - \bar{x})^2$

La variance de l'échantillon $V_{\text{éch}}$ (divisée par $n$) sous-estime en moyenne la variance de la population : on la corrige par le facteur $n / (n - 1)$.

7.5 L'intervalle de confiance d'une moyenne

Une estimation ponctuelle ne dit rien de sa précision. L'intervalle de confiance au niveau $1 - \alpha$ (souvent 95 %) est un intervalle qui contient le vrai paramètre dans 95 % des échantillons possibles.

Situation Intervalle de confiance de $\mu$
$\sigma$ connu (population normale ou $n \ge 30$) $\bar{x} \pm z_{\alpha/2}\,\dfrac{\sigma}{\sqrt{n}}$
$\sigma$ inconnu, $n \ge 30$ $\bar{x} \pm z_{\alpha/2}\,\dfrac{s}{\sqrt{n}}$
$\sigma$ inconnu, $n < 30$, population normale $\bar{x} \pm t_{n-1 ;\, \alpha/2}\,\dfrac{s}{\sqrt{n}}$ (loi de Student)

Valeurs usuelles de $z_{\alpha/2}$ : 1,645 (90 %), 1,96 (95 %), 2,576 (99 %). Plus le niveau de confiance est élevé, plus l'intervalle est large.

Exemple : une enquête auprès de 400 ménages donne une dépense alimentaire mensuelle moyenne de 3 200 DH, avec $s = 800$ DH. Au niveau 95 % : $3\,200 \pm 1{,}96 \times 800 / 20 = 3\,200 \pm 78{,}4$, soit [3 121,6 ; 3 278,4] DH.

7.6 L'intervalle de confiance d'une proportion

$$\boxed{f \pm z_{\alpha/2}\,\sqrt{\frac{f\,(1 - f)}{n}}}$$

Exemple : 240 consommateurs sur 600 connaissent une marque ($f = 0{,}4$). Au niveau 95 % : $0{,}4 \pm 1{,}96 \times \sqrt{0{,}24 / 600} = 0{,}4 \pm 0{,}0392$, soit [36,1 % ; 43,9 %].

7.7 La taille de l'échantillon

Pour obtenir une marge d'erreur $E$ (demi-largeur de l'intervalle) :

$$n = \left(\frac{z_{\alpha/2}\,\sigma}{E}\right)^2 \quad (\text{moyenne}) \qquad n = \frac{z_{\alpha/2}^2\,p\,(1 - p)}{E^2} \quad (\text{proportion})$$

Si $p$ est inconnu, on retient $p = 0{,}5$, cas le plus défavorable : pour une marge de ± 3 points à 95 %, $n = 1{,}96^2 \times 0{,}25 / 0{,}03^2 \approx 1\,067{,}1$, soit 1 068 personnes. C'est pourquoi beaucoup de sondages portent sur environ 1 000 personnes. On arrondit toujours $n$ à l'entier supérieur.

Vers les tests d'hypothèses : l'intervalle de confiance permet aussi de juger une affirmation. Si un fabricant annonce un poids moyen de 250 g et que l'intervalle de confiance calculé sur un échantillon ne contient pas 250, on rejette son affirmation au risque de 5 %. Cette démarche est formalisée au chapitre 8 sur les tests d'hypothèses.

7.8 Méthode : construire un intervalle de confiance

  1. Identifier le paramètre (moyenne ou proportion) et le niveau de confiance.
  2. Calculer l'estimation ponctuelle ($\bar{x}$ ou $f$) et, si besoin, l'écart-type corrigé $s$.
  3. Choisir la loi : normale ($z$) si $\sigma$ connu ou $n \ge 30$, Student ($t$) pour un petit échantillon.
  4. Calculer l'erreur type ($\sigma / \sqrt{n}$ ou $\sqrt{f(1 - f)/n}$), puis la marge d'erreur.
  5. Écrire l'intervalle et l'interpréter en une phrase.

⚠️ Les pièges à éviter

  • Diviser par $n$ au lieu de $\sqrt{n}$ dans l'erreur type.
  • Oublier de corriger la variance de l'échantillon ($n - 1$ au dénominateur).
  • Dire « le paramètre a 95 % de chances d'être dans cet intervalle » : c'est la méthode qui réussit dans 95 % des échantillons.
  • Utiliser 1,96 pour un petit échantillon à écart-type inconnu : il faut la loi de Student.
  • Arrondir la taille d'échantillon à l'entier inférieur.

Exercice 1 — Enquête sur les PME d'une région

Partie A — Distribution d'échantillonnage. Dans une région, le salaire mensuel des employés de PME a une moyenne $\mu = 5\,700$ DH et un écart-type $\sigma = 1\,800$ DH. On tire au hasard 36 employés.

  1. Donnez l'espérance et l'écart-type de la moyenne $\bar{X}$ de l'échantillon, ainsi que sa loi approchée.
  2. Calculez $P(\bar{X} > 6\,000)$ et $P(5\,400 < \bar{X} < 6\,000)$.

Partie B — Estimation d'une moyenne. Sur un échantillon aléatoire de 64 PME, le chiffre d'affaires moyen est de 4,2 millions de DH, avec un écart-type corrigé $s = 1{,}6$ million. 3. Construisez l'intervalle de confiance du chiffre d'affaires moyen des PME de la région au niveau 95 %, puis 99 %. Commentez.

Partie C — Estimation d'une proportion. Parmi ces 64 PME, 16 exportent. 4. Construisez l'intervalle de confiance à 95 % de la proportion de PME exportatrices. 5. Combien de PME faudrait-il interroger pour estimer cette proportion à ± 3 points près (95 %), en utilisant l'estimation obtenue ? Et si l'on ne disposait d'aucune estimation préalable ?

Voir le corrigé

1) $E(\bar{X}) = \mathbf{5\,700}$ DH ; $\sigma(\bar{X}) = 1\,800 / \sqrt{36} = \mathbf{300}$ DH. Comme $n \ge 30$, le théorème central limite donne $\bar{X} \approx \mathcal{N}(5\,700 ; 300)$.

2) $P(\bar{X} > 6\,000) = 1 - \Phi(1) \approx \mathbf{0{,}159}$ ; $P(5\,400 < \bar{X} < 6\,000) = 2\,\Phi(1) - 1 \approx \mathbf{0{,}683}$.

3) Erreur type : $1{,}6 / \sqrt{64} = 0{,}2$ million.

Niveau Marge d'erreur Intervalle (millions de DH)
95 % $1{,}96 \times 0{,}2 = 0{,}392$ [3,808 ; 4,592]
99 % $2{,}576 \times 0{,}2 \approx 0{,}515$ [3,685 ; 4,715]

Exiger une confiance plus grande élargit l'intervalle : on gagne en sécurité ce que l'on perd en précision.

4) $f = 16 / 64 = 0{,}25$ ; $np = 16 \ge 5$ et $n(1 - p) = 48 \ge 5$.

$$0{,}25 \pm 1{,}96 \times \sqrt{\frac{0{,}25 \times 0{,}75}{64}} = 0{,}25 \pm 1{,}96 \times 0{,}0541 \approx 0{,}25 \pm 0{,}106$$

soit [14,4 % ; 35,6 %] : l'estimation est peu précise avec un aussi petit échantillon.

5) Avec $p \approx 0{,}25$ : $n = 1{,}96^2 \times 0{,}25 \times 0{,}75 / 0{,}03^2 \approx 800{,}3$, soit 801 PME. Sans estimation préalable ($p = 0{,}5$) : $n \approx 1\,067{,}1$, soit 1 068 PME.

Exercice 2 — Petit échantillon et loi de Student

Un transporteur mesure le délai de livraison (en jours) de 10 colis choisis au hasard : moyenne 5,2 jours, écart-type corrigé 1,1 jour. On suppose les délais distribués normalement.

  1. Pourquoi faut-il utiliser la loi de Student ?
  2. Construisez l'intervalle de confiance à 95 % du délai moyen ($t_{9 ;\, 0{,}025} = 2{,}262$).
  3. Le transporteur annonce un délai moyen de 4 jours. Qu'en pensez-vous ?
Voir le corrigé

1) L'échantillon est petit ($n = 10 < 30$) et l'écart-type de la population est inconnu : on utilise la loi de Student à $n - 1 = 9$ degrés de liberté.

2) $5{,}2 \pm 2{,}262 \times 1{,}1 / \sqrt{10} = 5{,}2 \pm 0{,}787$, soit [4,41 ; 5,99] jours.

3) La valeur 4 n'appartient pas à l'intervalle : au risque de 5 %, l'annonce du transporteur n'est pas compatible avec les observations (le délai réel semble plus long).

Exercice 3 — Sondage et marge d'erreur

Un institut interroge 1 200 étudiants : 540 déclarent utiliser quotidiennement une application de paiement mobile.

  1. Estimez la proportion d'utilisateurs quotidiens et construisez son intervalle de confiance à 95 %.
  2. Quelle serait la marge d'erreur avec 300 étudiants seulement (même fréquence) ?
  3. Combien d'étudiants faudrait-il interroger pour une marge de ± 2 points (95 %), sans information préalable ?
Voir le corrigé

1) $f = 540 / 1\,200 = 0{,}45$ ; erreur type $\sqrt{0{,}45 \times 0{,}55 / 1\,200} \approx 0{,}0144$ ; marge $1{,}96 \times 0{,}0144 \approx 0{,}028$ ; intervalle [42,2 % ; 47,8 %].

2) Erreur type $\sqrt{0{,}2475 / 300} \approx 0{,}0287$ ; marge $\approx$ 5,6 points : diviser l'échantillon par 4 double la marge d'erreur.

3) $n = 1{,}96^2 \times 0{,}25 / 0{,}02^2 = 2\,401$ étudiants.

L'essentiel — Échantillonnage et estimation

  • Paramètres de la population ($\mu$, $\sigma$, $p$) estimés par les statistiques de l'échantillon ($\bar{x}$, $s$, $f$) ; tirage aléatoire pour la représentativité.
  • $E(\bar{X}) = \mu$, $\sigma(\bar{X}) = \sigma / \sqrt{n}$ ; théorème central limite : $\bar{X} \approx \mathcal{N}(\mu ; \sigma/\sqrt{n})$ pour $n \ge 30$.
  • $F \approx \mathcal{N}(p ; \sqrt{p(1 - p)/n})$.
  • Estimateurs sans biais : $\bar{x}$, $f$, $s^2 = \frac{n}{n - 1} V_{\text{éch}}$.
  • IC d'une moyenne : $\bar{x} \pm z\,\sigma/\sqrt{n}$ (ou $s$ si $n \ge 30$) ; petit échantillon : Student $t_{n-1}$.
  • IC d'une proportion : $f \pm z \sqrt{f(1 - f)/n}$ ; $z = 1{,}645$ (90 %), $1{,}96$ (95 %), $2{,}576$ (99 %).
  • Taille : $n = (z\sigma/E)^2$ ou $z^2 p(1 - p)/E^2$ ; avec $p = 0{,}5$ et $E = 3$ points : 1 068 personnes.
1L'écart-type de la moyenne d'un échantillon de taille n vaut :
2Le théorème central limite permet d'approcher la loi de la moyenne par une loi normale si :
3L'estimateur sans biais de la variance divise la somme des carrés des écarts par :
4Au niveau de confiance 95 %, on utilise z égal à :
5Moyenne 50, σ = 10, n = 100. L'intervalle de confiance à 95 % est :
6Pour diviser par 2 la marge d'erreur, il faut multiplier la taille de l'échantillon par :
7Quand le niveau de confiance augmente, l'intervalle de confiance :
8f = 0,3 et n = 100. L'erreur type de la fréquence vaut environ :
9Pour un petit échantillon issu d'une population normale d'écart-type inconnu, on utilise :
10Sans information sur p, on calcule la taille d'échantillon avec :

📚S'entraîner sur des sujets réels

Des sujets réels de concours (master, licence d'excellence) avec une épreuve de Probabilités : énoncé complet et corrigé indicatif.

Voir les 39 sujets de concours en Probabilités →