Le modèle de régression multiple
5.1 Écriture du modèle
$$Y_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + \dots + \beta_{k-1} X_{(k-1)i} + \varepsilon_i$$
Sous forme matricielle : $Y = X\beta + \varepsilon$, d'où l'estimateur des MCO :
$$\hat{\beta} = (X'X)^{-1} X'Y$$
Cet estimateur n'existe que si $X'X$ est inversible, c'est-à-dire si les colonnes de $X$ sont linéairement indépendantes (absence de colinéarité parfaite).
5.2 L'interprétation « toutes choses égales par ailleurs »
$\beta_j$ mesure l'effet d'une variation d'une unité de $X_j$ sur $Y$, les autres variables explicatives étant maintenues constantes (ceteris paribus). C'est l'apport décisif de la régression multiple par rapport à la régression simple.
5.3 Le test de Fisher (significativité globale)
$$H_0 : \beta_1 = \beta_2 = \dots = \beta_{k-1} = 0 \qquad \text{(le modèle n'explique rien)}$$
$$F_c = \frac{SCE/(k-1)}{SCR/(n-k)} = \frac{R^2/(k-1)}{(1-R^2)/(n-k)}$$
Si $F_c > F_{\text{table}}(k-1 ; n-k)$, on rejette $H_0$ : le modèle est globalement significatif.
⚠️ Le test de Student teste une variable à la fois ; le test de Fisher teste toutes les variables ensemble. Un modèle peut être globalement significatif alors qu'aucun coefficient ne l'est individuellement — signe caractéristique de multicolinéarité.
5.4 Les variables muettes (dummies)
Une variable qualitative à $m$ modalités s'introduit par $m - 1$ variables binaires, la modalité omise servant de référence. Introduire les $m$ variables provoquerait la trappe des variables muettes (colinéarité parfaite avec la constante).
Exercice 1
Question — Un modèle à 3 variables explicatives estimé sur 40 observations donne $R^2 = 0{,}65$. Testez la significativité globale au seuil de 5 % ($F_{\text{table}}(3 ; 36) \approx 2{,}87$).
Voir le corrigé
Avec $k - 1 = 3$ et $n - k = 40 - 4 = 36$ :
$$F_c = \frac{0{,}65/3}{(1 - 0{,}65)/36} = \frac{0{,}2167}{0{,}009722} \approx 22{,}29$$
$F_c = 22{,}29 > 2{,}87$ ➜ on rejette $H_0$.
Le modèle est globalement significatif au seuil de 5 % : au moins une des variables explicatives contribue significativement à expliquer $Y$. Il reste ensuite à tester chaque coefficient individuellement par le test de Student pour identifier lesquelles.
Exercice 2 — Lire une équation de salaire
Sur 60 salariés, on estime : $\hat{S} = 3\,000 + 250\,\text{EXP} + 1\,200\,\text{MASTER} + 800\,\text{CASA}$, avec $S$ le salaire mensuel (DH), EXP l'expérience (années), MASTER = 1 si le salarié a un master, CASA = 1 s'il travaille à Casablanca. $R^2 = 0{,}45$.
- Interprétez les coefficients 250 et 1 200.
- Prévoyez le salaire d'un titulaire de master, à Casablanca, avec 4 ans d'expérience.
- Testez la significativité globale ($F_{table}(3 ; 56) \approx 2{,}77$).
Voir le corrigé
1) Une année d'expérience supplémentaire est associée à +250 DH de salaire, à diplôme et ville identiques ; un master est associé à +1 200 DH par rapport à un salarié sans master (référence), à expérience et ville identiques.
2) $3\,000 + 250 \times 4 + 1\,200 + 800 = 6\,000$ DH.
3) $F_c = \dfrac{0{,}45 / 3}{0{,}55 / 56} \approx 15{,}3 > 2{,}77$ : modèle globalement significatif.
L'essentiel — Régression multiple
- $Y = X\beta + \varepsilon$ ; estimateur $\hat{\beta} = (X'X)^{-1}X'Y$, qui exige l'absence de colinéarité parfaite.
- Chaque $\beta_j$ s'interprète toutes choses égales par ailleurs.
- Test de Fisher (significativité globale) : $F_c = \dfrac{R^2 / (k - 1)}{(1 - R^2) / (n - k)}$ ; rejet de $H_0$ si $F_c > F_{table}$.
- Student teste une variable, Fisher toutes à la fois.
- Variables muettes : une variable qualitative à $m$ modalités → $m - 1$ indicatrices ; la modalité omise sert de référence (sinon, trappe des variables muettes).