Le modèle de régression linéaire simple
2.1 Les hypothèses du modèle classique
| N° | Hypothèse | Écriture |
|---|---|---|
| H1 | Linéarité des paramètres | $Y = \beta_0 + \beta_1 X + \varepsilon$ |
| H2 | $X$ non aléatoire (exogène) | $\text{Cov}(X_i, \varepsilon_i) = 0$ |
| H3 | Espérance nulle des erreurs | $E(\varepsilon_i) = 0$ |
| H4 | Homoscédasticité | $V(\varepsilon_i) = \sigma^2$ constante |
| H5 | Absence d'autocorrélation | $\text{Cov}(\varepsilon_i, \varepsilon_j) = 0$ pour $i \neq j$ |
| H6 | Normalité des erreurs | $\varepsilon_i \sim \mathcal{N}(0 ; \sigma^2)$ |
2.2 La méthode des moindres carrés ordinaires (MCO)
Les MCO minimisent la somme des carrés des résidus :
$$\min \sum_{i=1}^{n} e_i^2 = \min \sum_{i=1}^{n} (Y_i - \hat{\beta}_0 - \hat{\beta}_1 X_i)^2$$
Les conditions du premier ordre donnent les équations normales, d'où :
$$\hat{\beta}_1 = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2} = \frac{\text{Cov}(X,Y)}{V(X)}$$
$$\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}$$
2.3 Propriétés des estimateurs — le théorème de Gauss-Markov
Sous les hypothèses H1 à H5, les estimateurs des MCO sont BLUE (Best Linear Unbiased Estimators) : linéaires, sans biais ($E(\hat{\beta}_j) = \beta_j$) et de variance minimale parmi tous les estimateurs linéaires sans biais.
2.4 Variance des estimateurs
$$V(\hat{\beta}_1) = \frac{\hat{\sigma}^2}{\sum (X_i - \bar{X})^2} \qquad \text{avec} \qquad \hat{\sigma}^2 = \frac{\sum e_i^2}{n - 2}$$
L'écart-type estimé $\hat{\sigma}_{\hat{\beta}_1} = \sqrt{V(\hat{\beta}_1)}$ est l'erreur standard du coefficient.
2.5 Interprétation des coefficients
| Forme du modèle | Interprétation de $\beta_1$ |
|---|---|
| $Y = \beta_0 + \beta_1 X$ (niveau-niveau) | Une unité de $X$ en plus ➜ $\beta_1$ unités de $Y$ en plus |
| $\ln Y = \beta_0 + \beta_1 X$ (log-niveau) | Une unité de $X$ en plus ➜ $Y$ varie de $100\beta_1$ % |
| $\ln Y = \beta_0 + \beta_1 \ln X$ (log-log) | $\beta_1$ est l'élasticité de $Y$ par rapport à $X$ |
Exercice 1
Question — Sur 20 observations, on dispose de : $\bar{X} = 8$, $\bar{Y} = 30$, $\sum(X_i - \bar{X})^2 = 80$, $\sum(X_i - \bar{X})(Y_i - \bar{Y}) = 200$. Estimez les paramètres du modèle $Y = \beta_0 + \beta_1 X + \varepsilon$ et interprétez.
Voir le corrigé
$$\hat{\beta}_1 = \frac{200}{80} = 2{,}5$$
$$\hat{\beta}_0 = 30 - 2{,}5 \times 8 = 30 - 20 = 10$$
Le modèle estimé s'écrit :
$$\hat{Y}_i = 10 + 2{,}5 \, X_i$$
Interprétation : lorsque $X$ augmente d'une unité, $Y$ augmente en moyenne de 2,5 unités. La constante $\hat{\beta}_0 = 10$ correspond à la valeur moyenne de $Y$ quand $X = 0$ — interprétation à ne retenir que si $X = 0$ a un sens économique et appartient au domaine des données observées.
Exercice 2 — Estimation complète sur 5 observations
| X | 2 | 4 | 6 | 8 | 10 |
|---|---|---|---|---|---|
| Y | 5 | 9 | 10 | 14 | 17 |
- Estimez $\hat{\beta}_0$ et $\hat{\beta}_1$.
- Calculez les résidus et vérifiez que leur somme est nulle.
- Calculez $\hat{\sigma}^2$ et l'erreur standard de $\hat{\beta}_1$.
- Dans le modèle $\ln Q = 3 - 1{,}2 \ln P$, interprétez le coefficient $-1{,}2$.
Voir le corrigé
1) $\bar{X} = 6$ ; $\bar{Y} = 11$ ; $\sum (X_i - \bar{X})(Y_i - \bar{Y}) = 58$ ; $\sum (X_i - \bar{X})^2 = 40$.
$\hat{\beta}_1 = 58 / 40 = 1{,}45$ ; $\hat{\beta}_0 = 11 - 1{,}45 \times 6 = 2{,}3$ ; $\hat{Y} = 2{,}3 + 1{,}45X$.
2) $\hat{Y}$ : 5,2 ; 8,1 ; 11 ; 13,9 ; 16,8. Résidus : −0,2 ; 0,9 ; −1 ; 0,1 ; 0,2. Somme $= 0$ ✓.
3) $\sum e_i^2 = 0{,}04 + 0{,}81 + 1 + 0{,}01 + 0{,}04 = 1{,}9$ ; $\hat{\sigma}^2 = 1{,}9 / 3 \approx 0{,}633$ ; $\hat{\sigma}_{\hat{\beta}_1} = \sqrt{0{,}633 / 40} \approx 0{,}126$.
4) Modèle log-log : $-1{,}2$ est l'élasticité-prix ; une hausse du prix de 1 % fait baisser la quantité demandée d'environ 1,2 % (demande élastique).
L'essentiel — Régression simple et MCO
- Hypothèses : linéarité, $X$ exogène, $E(\varepsilon) = 0$, homoscédasticité, absence d'autocorrélation, normalité.
- Les MCO minimisent $\sum e_i^2$ : $\hat{\beta}_1 = \dfrac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{\sum (X_i - \bar{X})^2}$ et $\hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X}$.
- Gauss-Markov : sous H1 à H5, les estimateurs MCO sont BLUE (linéaires, sans biais, de variance minimale).
- $\hat{\sigma}^2 = \dfrac{\sum e_i^2}{n - 2}$ ; $V(\hat{\beta}_1) = \dfrac{\hat{\sigma}^2}{\sum (X_i - \bar{X})^2}$.
- Les résidus MCO ont une somme nulle.
- Interprétation : niveau-niveau (unités), log-niveau (% pour une unité), log-log (élasticité).