Chapitre 8 · Semestre 3

Les tests d'hypothèses

Probabilités

🎯 Objectifs du chapitre — À la fin de ce chapitre, vous saurez :

  • formuler une hypothèse nulle et une hypothèse alternative, unilatérale ou bilatérale ;
  • distinguer le risque de première espèce, le risque de seconde espèce et la puissance d'un test ;
  • mener un test sur une moyenne (loi normale ou de Student) et sur une proportion ;
  • comparer deux moyennes ou deux proportions sur de grands échantillons ;
  • réaliser un test du khi-deux d'indépendance et interpréter une p-valeur.

8.1 Le principe d'un test

Le chapitre 7 estimait un paramètre inconnu. Un test répond à une question différente : une affirmation sur ce paramètre est-elle compatible avec les observations ? Un fabricant annonce que ses paquets pèsent 1 kg en moyenne, une enseigne que 80 % de ses clients sont satisfaits, un directeur commercial que le canal d'achat ne dépend pas de l'âge. L'échantillon ne reproduira jamais exactement ces valeurs ; toute la question est de savoir si l'écart observé peut s'expliquer par le hasard de l'échantillonnage, ou s'il est trop grand pour cela.

Définition — Hypothèses : l'hypothèse nulle $H_0$ est l'affirmation que l'on teste (en général une égalité : $\mu = \mu_0$, $p = p_0$, indépendance). L'hypothèse alternative $H_1$ est ce que l'on retient si l'on rejette $H_0$.

Le test est bilatéral si $H_1$ est $\mu \neq \mu_0$ (un écart dans les deux sens nous intéresse) et unilatéral si $H_1$ est $\mu < \mu_0$ ou $\mu > \mu_0$ (seul un sens compte : un poids trop faible, un délai trop long). C'est l'énoncé qui fixe le sens, avant de regarder les données.

La logique ressemble à celle d'un procès : $H_0$ est présumée vraie, et on ne la rejette que si les observations la rendent très invraisemblable. Ne pas rejeter $H_0$ ne prouve donc pas qu'elle est vraie : cela signifie seulement que les données ne permettent pas de la contredire.

8.2 Les deux risques d'erreur

$H_0$ vraie $H_0$ fausse
On ne rejette pas $H_0$ Bonne décision ($1 - \alpha$) Erreur de seconde espèce (risque $\beta$)
On rejette $H_0$ Erreur de première espèce (risque $\alpha$) Bonne décision : puissance $1 - \beta$

Le risque $\alpha$, appelé seuil ou niveau de signification, est choisi à l'avance : 5 % en général, 1 % quand une erreur serait coûteuse. Les deux risques varient en sens contraire : diminuer $\alpha$ rend le test plus prudent, mais augmente $\beta$. Seule l'augmentation de la taille de l'échantillon permet de réduire les deux à la fois.

Exemple : un contrôle qualité teste $H_0$ « le lot est conforme ». L'erreur de première espèce consiste à refuser un bon lot (coût pour le fournisseur) ; l'erreur de seconde espèce, à accepter un lot défectueux (coût pour le client).

8.3 La démarche en cinq étapes

  1. Formuler $H_0$ et $H_1$, et fixer $\alpha$.
  2. Choisir la statistique de test et sa loi sous $H_0$ (normale, Student, khi-deux).
  3. Déterminer la région critique (ou région de rejet) : les valeurs de la statistique trop improbables si $H_0$ est vraie.
  4. Calculer la statistique sur l'échantillon.
  5. Décider et conclure en une phrase, dans les termes du problème.

La p-valeur est la probabilité, si $H_0$ est vraie, d'observer un écart au moins aussi grand que celui constaté. On rejette $H_0$ lorsque la p-valeur est inférieure à $\alpha$. Elle a l'avantage de dire à quel point le résultat est significatif, là où la région critique ne donne qu'une réponse par oui ou non.

8.4 Le test sur une moyenne

Situation Statistique de test sous $H_0 : \mu = \mu_0$ Loi
$\sigma$ connu (population normale ou $n \ge 30$) $Z = \dfrac{\bar{x} - \mu_0}{\sigma / \sqrt{n}}$ $\mathcal{N}(0 ; 1)$
$\sigma$ inconnu, $n \ge 30$ $Z = \dfrac{\bar{x} - \mu_0}{s / \sqrt{n}}$ $\mathcal{N}(0 ; 1)$
$\sigma$ inconnu, $n < 30$, population normale $T = \dfrac{\bar{x} - \mu_0}{s / \sqrt{n}}$ Student à $n - 1$ ddl
Test ($\alpha = 5\,\%$, loi normale) Rejet de $H_0$ si
Bilatéral ($H_1 : \mu \neq \mu_0$) $\lvert Z \rvert > 1{,}96$
Unilatéral à droite ($H_1 : \mu > \mu_0$) $Z > 1{,}645$
Unilatéral à gauche ($H_1 : \mu < \mu_0$) $Z < -1{,}645$

Exemple : un fournisseur affirme que la durée de vie moyenne de ses lampes est d'au moins 8 000 heures ($\sigma = 600$ h). Un hôtel de Marrakech en teste 36 et obtient une moyenne de 7 810 heures. On teste $H_0 : \mu = 8\,000$ contre $H_1 : \mu < 8\,000$ au seuil de 5 %.

$$Z = \frac{7\,810 - 8\,000}{600 / \sqrt{36}} = \frac{-190}{100} = -1{,}9 < -1{,}645$$

On rejette $H_0$ : l'affirmation du fournisseur n'est pas crédible au seuil de 5 %. La p-valeur vaut $P(Z < -1{,}9) = 1 - \Phi(1{,}9) \approx 0{,}029$ ; au seuil de 1 % (seuil $-2{,}326$), on ne l'aurait pas rejetée.

8.5 Le test sur une proportion

Sous $H_0 : p = p_0$, avec $n p_0 \ge 5$ et $n(1 - p_0) \ge 5$ :

$$\boxed{Z = \frac{f - p_0}{\sqrt{p_0\,(1 - p_0) / n}}} \sim \mathcal{N}(0 ; 1)$$

On utilise $p_0$, et non $f$, sous la racine : le calcul se fait en supposant $H_0$ vraie.

Exemple : une marque de boissons revendique 30 % de part de marché. Sur 500 consommateurs interrogés, 135 déclarent l'acheter ($f = 0{,}27$). On teste $H_0 : p = 0{,}30$ contre $H_1 : p < 0{,}30$ : $Z = (0{,}27 - 0{,}30) / \sqrt{0{,}21 / 500} \approx -1{,}46$, supérieur à $-1{,}645$. On ne rejette pas $H_0$ : l'écart de 3 points peut s'expliquer par le hasard de l'échantillonnage.

8.6 Comparer deux moyennes ou deux proportions

Pour deux grands échantillons indépendants ($n_1, n_2 \ge 30$), on teste $H_0 : \mu_1 = \mu_2$ avec :

$$Z = \frac{\bar{x}_1 - \bar{x}_2}{\sqrt{\dfrac{s_1^2}{n_1} + \dfrac{s_2^2}{n_2}}}$$

et $H_0 : p_1 = p_2$ avec la proportion commune $\hat{p} = (n_1 f_1 + n_2 f_2)/(n_1 + n_2)$ :

$$Z = \frac{f_1 - f_2}{\sqrt{\hat{p}(1 - \hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}}$$

Exemple : le panier moyen de 100 clients d'une enseigne à Casablanca est de 520 DH ($s_1 = 80$), celui de 120 clients à Rabat de 495 DH ($s_2 = 90$). $Z = 25 / \sqrt{64 + 67{,}5} \approx 25 / 11{,}47 \approx 2{,}18 > 1{,}96$ : la différence est significative au seuil de 5 % (p-valeur ≈ 0,029).

8.7 Le test du khi-deux d'indépendance

Pour savoir si deux caractères qualitatifs sont liés, on compare les effectifs observés $O_{ij}$ d'un tableau de contingence aux effectifs théoriques $T_{ij}$ qu'on observerait en cas d'indépendance (voir le chapitre 5 du cours de statistique descriptive) :

$$T_{ij} = \frac{n_{i\cdot} \times n_{\cdot j}}{N} \qquad \boxed{\chi^2 = \sum_i \sum_j \frac{(O_{ij} - T_{ij})^2}{T_{ij}}}$$

Sous $H_0$ (indépendance), cette statistique suit une loi du khi-deux à $(r - 1)(c - 1)$ degrés de liberté, $r$ et $c$ étant les nombres de lignes et de colonnes. On rejette l'indépendance si $\chi^2$ dépasse la valeur critique. La condition d'usage est que tous les effectifs théoriques soient au moins égaux à 5.

ddl 1 2 3 4 6
$\chi^2$ critique à 5 % 3,841 5,991 7,815 9,488 12,592
$\chi^2$ critique à 1 % 6,635 9,210 11,345 13,277 16,812

Le même principe donne le test d'ajustement : on compare des effectifs observés aux effectifs prévus par une loi (répartition annoncée, loi de Poisson…), avec $k - 1$ ddl pour $k$ classes (moins le nombre de paramètres estimés).

8.8 Méthode : rédiger un test à l'examen

  1. Écrire $H_0$ et $H_1$ en précisant le paramètre et le sens (bilatéral ou unilatéral), puis $\alpha$.
  2. Vérifier les conditions (taille de l'échantillon, $n p_0 \ge 5$, effectifs théoriques $\ge 5$).
  3. Donner la statistique de test et sa loi sous $H_0$, puis la valeur critique lue dans la table.
  4. Calculer la statistique ; comparer à la valeur critique (ou calculer la p-valeur).
  5. Conclure dans le langage du problème : « au seuil de 5 %, on ne peut pas affirmer que… ».

⚠️ Les pièges à éviter

  • Écrire l'hypothèse nulle avec les valeurs de l'échantillon ($H_0 : \bar{x} = \dots$) : les hypothèses portent sur les paramètres de la population.
  • Utiliser 1,96 pour un test unilatéral à 5 % : le seuil est 1,645.
  • Utiliser $f$ au lieu de $p_0$ dans l'erreur type d'un test sur une proportion.
  • Conclure « $H_0$ est vraie » quand on ne la rejette pas.
  • Oublier les degrés de liberté $(r - 1)(c - 1)$, ou appliquer le khi-deux à des pourcentages au lieu d'effectifs.

Exercice 1 — Études de marché pour une enseigne de distribution

Partie A — Délai de livraison (petit échantillon). Une enseigne annonce un délai moyen de livraison de 3 jours. Sur 16 commandes choisies au hasard, le délai moyen est de 3,4 jours, avec un écart-type corrigé de 0,8 jour. On suppose les délais distribués normalement.

  1. Testez au seuil de 5 % l'hypothèse $\mu = 3$ contre $\mu \neq 3$ ($t_{15 ;\, 0{,}025} = 2{,}131$).
  2. Une association de consommateurs soupçonne que le délai réel est supérieur à 3 jours. Refaites le test ($t_{15 ;\, 0{,}05} = 1{,}753$). Commentez.

Partie B — Satisfaction (proportion). L'enseigne affirme que 80 % de ses clients sont satisfaits. Sur 400 clients interrogés, 300 se déclarent satisfaits. 3. Testez cette affirmation au seuil de 5 %, puis de 1 %, contre l'hypothèse que la satisfaction est inférieure. Calculez la p-valeur.

Partie C — Canal d'achat et âge (khi-deux). On a interrogé 400 clients :

18-30 ans 31-50 ans Plus de 50 ans Total
En ligne 90 70 20 180
En magasin 60 90 70 220
Total 150 160 90 400
  1. Calculez les effectifs théoriques sous l'hypothèse d'indépendance.
  2. Calculez la statistique du khi-deux et concluez au seuil de 5 %.
Voir le corrigé

1) $H_0 : \mu = 3$ contre $H_1 : \mu \neq 3$ ; petit échantillon, $\sigma$ inconnu, population normale : loi de Student à 15 ddl.

$$T = \frac{3{,}4 - 3}{0{,}8 / \sqrt{16}} = \frac{0{,}4}{0{,}2} = \mathbf{2}$$

$|T| = 2 < 2{,}131$ : on ne rejette pas $H_0$ au seuil de 5 %.

2) $H_1 : \mu > 3$ (test unilatéral à droite). $T = 2 > 1{,}753$ : on rejette $H_0$. Le même échantillon conduit à deux conclusions différentes : le test unilatéral concentre tout le risque $\alpha$ d'un seul côté, ce qui le rend plus puissant pour détecter un écart dans ce sens. C'est pourquoi le sens du test doit être fixé par la question posée, avant de voir les données.

3) $H_0 : p = 0{,}80$ contre $H_1 : p < 0{,}80$. Conditions : $400 \times 0{,}8 = 320 \ge 5$ et $400 \times 0{,}2 = 80 \ge 5$. $f = 300 / 400 = 0{,}75$.

$$Z = \frac{0{,}75 - 0{,}80}{\sqrt{0{,}8 \times 0{,}2 / 400}} = \frac{-0{,}05}{0{,}02} = \mathbf{-2{,}5}$$

$-2{,}5 < -1{,}645$ et $-2{,}5 < -2{,}326$ : on rejette $H_0$ aux seuils de 5 % et de 1 %. La p-valeur vaut $P(Z < -2{,}5) = 1 - \Phi(2{,}5) \approx \mathbf{0{,}006}$ : si 80 % des clients étaient réellement satisfaits, on n'observerait un résultat aussi bas que dans 0,6 % des sondages. L'affirmation de l'enseigne est surévaluée.

4) Effectifs théoriques $T_{ij} = n_{i\cdot} \times n_{\cdot j} / 400$ :

18-30 ans 31-50 ans Plus de 50 ans
En ligne $180 \times 150 / 400 = 67{,}5$ 72 40,5
En magasin 82,5 88 49,5

Tous sont supérieurs à 5 : le test est applicable.

5) Statistique du khi-deux

Case $(O - T)^2 / T$
En ligne, 18-30 $22{,}5^2 / 67{,}5 = 7{,}500$
En ligne, 31-50 $2^2 / 72 \approx 0{,}056$
En ligne, plus de 50 $20{,}5^2 / 40{,}5 \approx 10{,}377$
Magasin, 18-30 $22{,}5^2 / 82{,}5 \approx 6{,}136$
Magasin, 31-50 $2^2 / 88 \approx 0{,}045$
Magasin, plus de 50 $20{,}5^2 / 49{,}5 \approx 8{,}490$
Total $\chi^2 \approx \mathbf{32{,}60}$

Degrés de liberté : $(2 - 1)(3 - 1) = 2$ ; valeur critique à 5 % : 5,991. Comme $32{,}60 > 5{,}991$ (et même $> 9{,}210$ à 1 %), on rejette l'indépendance : le canal d'achat dépend nettement de l'âge. Les 18-30 ans achètent davantage en ligne (90 observés pour 67,5 attendus), les plus de 50 ans davantage en magasin (70 pour 49,5). L'enseigne peut en tirer une segmentation de ses campagnes : réseaux sociaux et application pour les jeunes, catalogue et promotions en magasin pour les seniors.

Exercice 2 — Comparer deux campagnes publicitaires

Une banque en ligne teste deux messages publicitaires. Le message A, envoyé à 500 prospects, obtient 60 ouvertures de compte ; le message B, envoyé à 400 prospects, en obtient 32.

  1. Calculez les taux de conversion et la proportion commune.
  2. Testez au seuil de 5 % l'hypothèse d'égalité des taux (test bilatéral). Donnez la p-valeur.
  3. Le service marketing voulait savoir si A est plus efficace que B. Quelle conclusion ?
Voir le corrigé

1) $f_A = 60/500 = 0{,}12$ ; $f_B = 32/400 = 0{,}08$ ; $\hat{p} = 92/900 \approx 0{,}1022$.

2) $H_0 : p_A = p_B$ contre $H_1 : p_A \neq p_B$.

$$Z = \frac{0{,}12 - 0{,}08}{\sqrt{0{,}1022 \times 0{,}8978 \times \left(\frac{1}{500} + \frac{1}{400}\right)}} = \frac{0{,}04}{0{,}0203} \approx \mathbf{1{,}97}$$

$1{,}97 > 1{,}96$ : on rejette $H_0$ au seuil de 5 %, de justesse. La p-valeur vaut $2\,(1 - \Phi(1{,}97)) \approx \mathbf{0{,}049}$, à peine inférieure à 5 %.

3) Test unilatéral $H_1 : p_A > p_B$ : $Z = 1{,}97 > 1{,}645$, p-valeur $\approx 0{,}025$. On conclut que le message A est plus efficace. Le résultat bilatéral étant limite, il serait prudent de confirmer sur un nouvel envoi avant de généraliser le message A.

Exercice 3 — Test d'ajustement : les réclamations sont-elles uniformes ?

Un service client a reçu 200 réclamations en un mois, réparties ainsi selon le jour ouvrable :

Jour Lundi Mardi Mercredi Jeudi Vendredi
Réclamations 48 35 38 36 43
  1. Formulez l'hypothèse d'une répartition uniforme et calculez les effectifs théoriques.
  2. Calculez la statistique du khi-deux et concluez au seuil de 5 % (valeur critique 9,488 pour 4 ddl).
  3. Le responsable affirme : « le test prouve que les réclamations sont uniformes ». Qu'en pensez-vous ?
Voir le corrigé

1) $H_0$ : chaque jour reçoit 20 % des réclamations. Effectif théorique : $200 \times 0{,}2 = 40$ par jour (tous $\ge 5$).

2) $\chi^2 = \dfrac{8^2 + 5^2 + 2^2 + 4^2 + 3^2}{40} = \dfrac{118}{40} = \mathbf{2{,}95}$, avec $5 - 1 = 4$ ddl. $2{,}95 < 9{,}488$ : on ne rejette pas $H_0$. L'excès du lundi (48) reste compatible avec le hasard.

3) L'affirmation est incorrecte : un test ne prouve jamais $H_0$. Il indique seulement que les données ne permettent pas de la rejeter. Avec plus de mois d'observation, un léger « effet lundi » pourrait devenir significatif (le risque $\beta$ est ici élevé).

L'essentiel — Tests d'hypothèses

  • $H_0$ : l'affirmation testée, sur un paramètre ($\mu = \mu_0$, $p = p_0$, indépendance) ; $H_1$ : bilatérale ($\neq$) ou unilatérale ($<$ ou $>$), fixée avant de voir les données.
  • Risque $\alpha$ (1ʳᵉ espèce) : rejeter $H_0$ vraie ; risque $\beta$ (2ᵉ espèce) : garder $H_0$ fausse ; puissance $1 - \beta$. Seul un $n$ plus grand réduit les deux.
  • Cinq étapes : hypothèses et $\alpha$ ; statistique et loi sous $H_0$ ; région critique ; calcul ; conclusion dans les termes du problème.
  • p-valeur : probabilité, sous $H_0$, d'un écart au moins aussi grand ; rejet si p-valeur $< \alpha$.
  • Moyenne : $Z = (\bar{x} - \mu_0) / (\sigma/\sqrt{n})$ ; petit échantillon, $\sigma$ inconnu : $T$ de Student à $n - 1$ ddl.
  • Seuils à 5 % : bilatéral $\lvert Z \rvert > 1{,}96$ ; unilatéral $1{,}645$. À 1 % : $2{,}576$ et $2{,}326$.
  • Proportion : $Z = (f - p_0) / \sqrt{p_0(1 - p_0)/n}$, avec $p_0$ sous la racine.
  • Deux moyennes : $Z = (\bar{x}_1 - \bar{x}_2) / \sqrt{s_1^2/n_1 + s_2^2/n_2}$ ; deux proportions : proportion commune $\hat{p}$.
  • Khi-deux : $T_{ij} = n_{i\cdot}\,n_{\cdot j} / N$, $\chi^2 = \sum (O - T)^2 / T$, $(r - 1)(c - 1)$ ddl, effectifs théoriques $\ge 5$ ; seuils à 5 % : 3,841 (1 ddl), 5,991 (2 ddl).
  • Ne pas rejeter $H_0$ ne prouve pas qu'elle est vraie.
1L'hypothèse nulle d'un test porte sur :
2Le risque de première espèce est la probabilité de :
3La puissance d'un test est égale à :
4Pour un test unilatéral au seuil de 5 % avec la loi normale, la valeur critique est :
5On rejette H0 lorsque la p-valeur est :
6Moyenne observée 52, μ0 = 50, σ = 8, n = 64. La statistique Z vaut :
7Dans un test sur une proportion, l'erreur type utilise :
8Un tableau de contingence à 3 lignes et 4 colonnes donne un khi-deux à :
9Dans le test du khi-deux d'indépendance, l'effectif théorique d'une case vaut :
10Ne pas rejeter H0 signifie que :

📚S'entraîner sur des sujets réels

Des sujets réels de concours (master, licence d'excellence) avec une épreuve de Probabilités : énoncé complet et corrigé indicatif.

Voir les 39 sujets de concours en Probabilités →