Licence Fondamentale / Professionnelle — Semestre S1/S2 — Système universitaire marocain Statistique descriptive (univariée et bivariée), probabilités, lois usuelles, échantillonnage et estimation.
💡 Comment lire ce cours ? Toutes les formules sont écrites en LaTeX. Chaque chapitre contient : le cours ➜ un exercice ➜ sa correction détaillée.
| N° | Chapitre | Notions clés |
|---|---|---|
| 1 | Vocabulaire et tableaux statistiques | Population, caractère, effectifs, fréquences, classes |
| 2 | Les caractéristiques de tendance centrale | Mode, médiane, moyenne arithmétique, quartiles |
| 3 | Les caractéristiques de dispersion et de forme | Variance, écart-type, coefficient de variation, concentration |
| 4 | Les indices statistiques | Indices élémentaires, indices synthétiques (Laspeyres, Paasche) |
| 5 | La statistique bivariée : corrélation et régression | Covariance, coefficient de corrélation, droite des moindres carrés |
| 6 | Les fondements du calcul des probabilités | Événements, probabilité conditionnelle, indépendance, Bayes |
| 7 | Variables aléatoires et lois usuelles | Espérance, variance, binomiale, Poisson, normale |
| 8 | Échantillonnage et estimation | Loi de la moyenne empirique, intervalle de confiance |
| — | Formulaire final + Conseils examen | Synthèse de toutes les formules |
| Terme | Définition |
|---|---|
| Population | Ensemble des éléments étudiés (ex. les entreprises d'un secteur) |
| Individu (unité statistique) | Un élément de la population |
| Échantillon | Sous-ensemble de la population effectivement observé |
| Caractère (variable) | Propriété étudiée sur chaque individu |
| Modalité | Valeur prise par le caractère |
| Type | Sous-type | Exemple |
|---|---|---|
| Qualitatif | Nominal (pas d'ordre) | Secteur d'activité, sexe |
| Qualitatif | Ordinal (ordonné) | Niveau de satisfaction |
| Quantitatif | Discret (valeurs isolées) | Nombre d'enfants, nombre de salariés |
| Quantitatif | Continu (regroupé en classes) | Salaire, chiffre d'affaires |
Pour une modalité $x_i$ d'effectif $n_i$ dans une population de taille $N$ :
$$f_i = \frac{n_i}{N} \qquad \text{avec} \qquad \sum_{i=1}^{k} n_i = N \quad \text{et} \quad \sum_{i=1}^{k} f_i = 1$$
L'effectif cumulé croissant $N_i$ est la somme des effectifs jusqu'à la modalité $i$ incluse ; il sert au calcul de la médiane et des quartiles.
Les données sont regroupées en classes $[e_{i-1} ; e_i[$ :
Question — Les salaires mensuels (en DH) de 50 employés sont répartis ainsi : [3000 ; 5000[ : 20 employés ; [5000 ; 6000[ : 20 employés ; [6000 ; 10000[ : 10 employés. Peut-on construire l'histogramme directement à partir des effectifs ? Calculez ce qu'il faut porter en ordonnée.
Non : les amplitudes sont inégales (2000, 1000, 4000), il faut donc utiliser la densité $d_i = n_i / a_i$, sinon la surface des rectangles ne serait plus proportionnelle aux effectifs.
| Classe | $n_i$ | $a_i$ | $d_i = n_i/a_i$ |
|---|---|---|---|
| [3000 ; 5000[ | 20 | 2000 | 0,010 |
| [5000 ; 6000[ | 20 | 1000 | 0,020 |
| [6000 ; 10000[ | 10 | 4000 | 0,0025 |
C'est bien la classe [5000 ; 6000[ qui est la plus « dense » : elle concentre 20 employés sur seulement 1000 DH d'amplitude.
Le mode est la modalité de plus grand effectif. Pour une variable continue, on parle de classe modale (celle de plus forte densité si les amplitudes sont inégales).
La médiane $M_e$ partage la population en deux parties d'effectifs égaux. Pour une variable continue, on l'obtient par interpolation linéaire dans la classe médiane $[e_{i-1} ; e_i[$ :
$$M_e = e_{i-1} + a_i \times \frac{\frac{N}{2} - N_{i-1}}{n_i}$$
où $N_{i-1}$ est l'effectif cumulé avant la classe médiane.
$$\bar{x} = \frac{1}{N}\sum_{i=1}^{k} n_i x_i = \sum_{i=1}^{k} f_i x_i$$
Pour une variable continue, on remplace $x_i$ par le centre de classe $c_i$.
Les quartiles $Q_1$, $Q_2 = M_e$, $Q_3$ partagent la population en quatre parties égales. Même formule d'interpolation en remplaçant $N/2$ par $N/4$ et $3N/4$.
| Indicateur | Avantage | Limite |
|---|---|---|
| Mode | Simple, seul possible pour un caractère qualitatif | Peut ne pas être unique |
| Médiane | Insensible aux valeurs extrêmes | Ignore l'information des valeurs éloignées |
| Moyenne | Utilise toute l'information, base des calculs ultérieurs | Très sensible aux valeurs aberrantes |
Question — Reprenez la distribution de l'exercice 1 (50 employés). Calculez le salaire moyen et le salaire médian, puis commentez l'écart entre les deux.
Moyenne (centres de classes : 4000, 5500, 8000) :
$$\bar{x} = \frac{20(4000) + 20(5500) + 10(8000)}{50} = \frac{80\,000 + 110\,000 + 80\,000}{50} = \frac{270\,000}{50} = 5400 \text{ DH}$$
Médiane : $N/2 = 25$. Effectifs cumulés : 20 ; 40 ; 50 → la classe médiane est [5000 ; 6000[.
$$M_e = 5000 + 1000 \times \frac{25 - 20}{20} = 5000 + 250 = 5250 \text{ DH}$$
Commentaire : $\bar{x} > M_e$, la distribution est étalée à droite (asymétrie positive) : une minorité de hauts salaires (classe [6000 ; 10000[) tire la moyenne vers le haut. La médiane décrit ici mieux le salarié « typique ».
$$E = x_{\max} - x_{\min} \qquad ; \qquad IQ = Q_3 - Q_1$$
$$V(x) = \frac{1}{N}\sum n_i (x_i - \bar{x})^2 = \underbrace{\frac{1}{N}\sum n_i x_i^2 - \bar{x}^2}_{\text{formule développée (à privilégier)}}$$
$$\sigma_x = \sqrt{V(x)}$$
$$CV = \frac{\sigma_x}{\bar{x}} \times 100$$
Le $CV$ est sans unité : c'est le seul indicateur permettant de comparer la dispersion de deux séries exprimées dans des unités différentes ou d'ordres de grandeur très différents. Une série est d'autant plus homogène que son $CV$ est faible (usuellement $CV < 15\%$).
| Situation | Forme de la distribution |
|---|---|
| $\bar{x} = M_e = M_o$ | Distribution symétrique |
| $\bar{x} > M_e > M_o$ | Étalement à droite (asymétrie positive) |
| $\bar{x} < M_e < M_o$ | Étalement à gauche (asymétrie négative) |
La courbe de Lorenz relie les fréquences cumulées des individus aux fréquences cumulées de la masse (revenus, CA...). L'indice de Gini $G$ vaut le double de l'aire entre la courbe et la diagonale d'équirépartition :
$$0 \leq G \leq 1$$
$G = 0$ : équirépartition parfaite ; $G$ proche de 1 : concentration extrême. C'est l'outil de référence pour mesurer les inégalités de revenus.
Question — Deux agences bancaires ont un montant moyen de crédit de 120 000 DH ($\sigma = 18\,000$) pour l'agence A et de 45 000 DH ($\sigma = 9\,000$) pour l'agence B. Quelle agence a la clientèle la plus homogène ?
L'écart-type seul est trompeur (A a le plus grand écart-type mais aussi la plus grande moyenne). On compare les coefficients de variation :
$$CV_A = \frac{18\,000}{120\,000} \times 100 = 15\% \qquad CV_B = \frac{9\,000}{45\,000} \times 100 = 20\%$$
$CV_A < CV_B$ : c'est l'agence A qui a la clientèle la plus homogène, malgré un écart-type absolu deux fois plus élevé.
$$I_{t/0} = \frac{x_t}{x_0} \times 100$$
Un indice de 112 signifie une hausse de 12 % entre la date de base 0 et la date $t$.
| Propriété | Formule |
|---|---|
| Réversibilité | $I_{t/0} \times I_{0/t} = 100^2$ (en base 100) |
| Transitivité (circularité) | $I_{2/0} = \dfrac{I_{2/1} \times I_{1/0}}{100}$ |
| Indice | Formule | Pondération |
|---|---|---|
| Laspeyres prix | $L_p = \dfrac{\sum p_t q_0}{\sum p_0 q_0} \times 100$ | Quantités de la période de base |
| Paasche prix | $P_p = \dfrac{\sum p_t q_t}{\sum p_0 q_t} \times 100$ | Quantités de la période courante |
| Fisher | $F = \sqrt{L_p \times P_p}$ | Moyenne géométrique des deux |
L'indice des prix à la consommation (IPC) publié par le HCP au Maroc est un indice de type Laspeyres.
$$TCAM = \left( \frac{x_n}{x_0} \right)^{\frac{1}{n}} - 1$$
Question — Le chiffre d'affaires d'une entreprise passe de 4 000 000 DH en 2019 à 6 500 000 DH en 2024. Calculez l'indice base 100 en 2019 et le taux de croissance annuel moyen.
Indice : $I_{2024/2019} = \dfrac{6\,500\,000}{4\,000\,000} \times 100 = 162,5$ → hausse de 62,5 % sur la période.
TCAM sur $n = 5$ ans :
$$TCAM = \left( \frac{6\,500\,000}{4\,000\,000} \right)^{1/5} - 1 = (1{,}625)^{0,2} - 1 \approx 0{,}1020$$
Soit environ 10,2 % par an. Attention à ne jamais diviser 62,5 % par 5 (ce qui donnerait 12,5 %) : cela ignorerait l'effet de composition des taux.
$$\text{Cov}(x,y) = \frac{1}{N}\sum (x_i - \bar{x})(y_i - \bar{y}) = \frac{1}{N}\sum x_i y_i - \bar{x}\,\bar{y}$$
$$r = \frac{\text{Cov}(x,y)}{\sigma_x \, \sigma_y} \qquad \text{avec} \qquad -1 \leq r \leq 1$$
| Valeur de $\lvert r \rvert$ | Interprétation |
|---|---|
| Proche de 1 | Liaison linéaire forte |
| Entre 0,5 et 0,8 | Liaison linéaire moyenne |
| Proche de 0 | Absence de liaison linéaire (une liaison non linéaire reste possible) |
⚠️ Corrélation n'est pas causalité : deux variables peuvent être fortement corrélées à cause d'une troisième variable (corrélation fallacieuse).
Droite de $y$ en $x$ : $y = ax + b$ avec
$$a = \frac{\text{Cov}(x,y)}{V(x)} \qquad ; \qquad b = \bar{y} - a\bar{x}$$
La droite passe toujours par le point moyen $(\bar{x} ; \bar{y})$.
$$R^2 = r^2$$
$R^2$ mesure la part de la variance de $y$ expliquée par $x$. Un $R^2 = 0{,}81$ signifie que 81 % des variations de $y$ sont expliquées par le modèle.
Question — On observe pour 5 mois les dépenses publicitaires $x$ (en milliers de DH) et les ventes $y$ (en milliers de DH) : $\bar{x} = 10$, $\bar{y} = 50$, $\sigma_x = 4$, $\sigma_y = 12$, $\text{Cov}(x,y) = 40$. Déterminez le coefficient de corrélation, la droite de régression de $y$ en $x$, et prévoyez les ventes pour une dépense de 14.
Corrélation :
$$r = \frac{40}{4 \times 12} = \frac{40}{48} \approx 0{,}833$$
Corrélation positive forte ; $R^2 = 0{,}694$ → environ 69 % des variations des ventes sont expliquées par la publicité.
Droite de régression : $V(x) = \sigma_x^2 = 16$
$$a = \frac{40}{16} = 2{,}5 \qquad ; \qquad b = 50 - 2{,}5 \times 10 = 25$$
$$y = 2{,}5x + 25$$
Prévision pour $x = 14$ : $y = 2{,}5(14) + 25 = 60$, soit 60 000 DH de ventes prévues. Interprétation de $a$ : 1 000 DH de publicité supplémentaire est associé à 2 500 DH de ventes en plus.
| Terme | Définition |
|---|---|
| Expérience aléatoire | Expérience dont le résultat n'est pas prévisible avec certitude |
| Univers $\Omega$ | Ensemble de tous les résultats possibles |
| Événement | Sous-ensemble de $\Omega$ |
| Événements incompatibles | $A \cap B = \varnothing$ |
$$0 \leq P(A) \leq 1 \qquad ; \qquad P(\Omega) = 1 \qquad ; \qquad P(\bar{A}) = 1 - P(A)$$
$$P(A \cup B) = P(A) + P(B) - P(A \cap B)$$
En situation d'équiprobabilité :
$$P(A) = \frac{\text{nombre de cas favorables}}{\text{nombre de cas possibles}}$$
$$P(A/B) = \frac{P(A \cap B)}{P(B)} \quad \text{si } P(B) \neq 0 \qquad \Longrightarrow \qquad P(A \cap B) = P(A/B) \times P(B)$$
$A$ et $B$ sont indépendants si $P(A \cap B) = P(A) \times P(B)$, ce qui équivaut à $P(A/B) = P(A)$.
Si $\{B_1, ..., B_n\}$ forme une partition de $\Omega$ :
$$P(A) = \sum_{i} P(A/B_i)\,P(B_i)$$
$$P(B_i/A) = \frac{P(A/B_i)\,P(B_i)}{\sum_j P(A/B_j)\,P(B_j)}$$
Question — Une entreprise s'approvisionne auprès de deux fournisseurs : F1 fournit 60 % des pièces avec 2 % de défectueuses, F2 fournit 40 % des pièces avec 5 % de défectueuses. (a) Quelle est la probabilité qu'une pièce prise au hasard soit défectueuse ? (b) Une pièce est défectueuse : quelle est la probabilité qu'elle provienne de F2 ?
(a) Probabilités totales :
$$P(D) = P(D/F_1)P(F_1) + P(D/F_2)P(F_2) = 0{,}02 \times 0{,}6 + 0{,}05 \times 0{,}4 = 0{,}012 + 0{,}020 = 0{,}032$$
Soit 3,2 % de pièces défectueuses.
(b) Bayes :
$$P(F_2/D) = \frac{0{,}020}{0{,}032} = 0{,}625$$
62,5 % des pièces défectueuses proviennent de F2, alors que F2 ne fournit que 40 % des pièces : ce fournisseur est bien surreprésenté parmi les défauts.
Pour une variable aléatoire discrète $X$ :
$$E(X) = \sum_i x_i \, P(X = x_i) \qquad ; \qquad V(X) = E(X^2) - [E(X)]^2$$
Propriétés : $E(aX + b) = aE(X) + b$ et $V(aX + b) = a^2 V(X)$.
| Loi | Conditions | $E(X)$ | $V(X)$ |
|---|---|---|---|
| Bernoulli $\mathcal{B}(p)$ | Une épreuve, succès/échec | $p$ | $p(1-p)$ |
| Binomiale $\mathcal{B}(n,p)$ | $n$ épreuves indépendantes, $p$ constante | $np$ | $np(1-p)$ |
| Poisson $\mathcal{P}(\lambda)$ | Événements rares sur une période | $\lambda$ | $\lambda$ |
$$P(X = k) = C_n^k \, p^k (1-p)^{n-k} \quad \text{(binomiale)} \qquad ; \qquad P(X = k) = e^{-\lambda}\frac{\lambda^k}{k!} \quad \text{(Poisson)}$$
$X \sim \mathcal{N}(\mu ; \sigma)$. On se ramène à la loi normale centrée réduite $T \sim \mathcal{N}(0 ; 1)$ par le changement de variable :
$$T = \frac{X - \mu}{\sigma}$$
Valeurs à mémoriser : $P(\mu - \sigma < X < \mu + \sigma) \approx 68\%$ ; $\pm 2\sigma \approx 95\%$ ; $\pm 3\sigma \approx 99{,}7\%$.
| De | Vers | Conditions |
|---|---|---|
| Binomiale | Poisson $\lambda = np$ | $n \geq 30$, $p \leq 0{,}1$, $np < 5$ |
| Binomiale | Normale $\mathcal{N}(np ; \sqrt{np(1-p)})$ | $n \geq 30$, $np \geq 5$, $n(1-p) \geq 5$ |
Question — Un centre d'appels reçoit en moyenne 3 réclamations par heure, suivant une loi de Poisson. Calculez la probabilité de recevoir exactement 2 réclamations en une heure, puis celle d'en recevoir au moins une.
Avec $\lambda = 3$ :
$$P(X = 2) = e^{-3}\frac{3^2}{2!} = e^{-3} \times 4{,}5 \approx 0{,}0498 \times 4{,}5 \approx 0{,}224$$
Soit 22,4 %.
$$P(X \geq 1) = 1 - P(X = 0) = 1 - e^{-3} \approx 1 - 0{,}0498 = 0{,}950$$
Soit 95,0 %. Le réflexe « au moins un = 1 − aucun » évite une somme infinie.
Si l'on prélève des échantillons de taille $n$ dans une population de moyenne $\mu$ et d'écart-type $\sigma$ :
$$E(\bar{X}) = \mu \qquad ; \qquad \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}}$$
$\sigma/\sqrt{n}$ est l'erreur-type : la précision s'améliore comme la racine carrée de la taille de l'échantillon (quadrupler $n$ divise l'erreur par 2). D'après le théorème central limite, $\bar{X}$ suit approximativement une loi normale dès que $n \geq 30$, quelle que soit la loi de la population.
| Paramètre | Estimateur | Remarque |
|---|---|---|
| Moyenne $\mu$ | $\bar{x}$ | Sans biais |
| Proportion $p$ | $f$ (fréquence observée) | Sans biais |
| Variance $\sigma^2$ | $s^2 = \dfrac{n}{n-1}\,\sigma_e^2$ | Correction de biais : diviser par $n-1$ |
$$IC = \left[ \bar{x} - t\frac{s}{\sqrt{n}} \; ; \; \bar{x} + t\frac{s}{\sqrt{n}} \right]$$
où $t = 1{,}96$ au seuil de confiance de 95 % et $t = 2{,}58$ à 99 % (grands échantillons).
$$IC = \left[ f - t\sqrt{\frac{f(1-f)}{n}} \; ; \; f + t\sqrt{\frac{f(1-f)}{n}} \right]$$
Question — Sur un échantillon de 400 clients, 60 % se déclarent satisfaits. Déterminez l'intervalle de confiance de la proportion de clients satisfaits au seuil de 95 %.
$f = 0{,}60$, $n = 400$, $t = 1{,}96$ :
$$\sqrt{\frac{0{,}6 \times 0{,}4}{400}} = \sqrt{\frac{0{,}24}{400}} = \sqrt{0{,}0006} \approx 0{,}0245$$
$$IC = [0{,}60 - 1{,}96 \times 0{,}0245 \; ; \; 0{,}60 + 1{,}96 \times 0{,}0245] = [0{,}552 \; ; \; 0{,}648]$$
Au seuil de 95 %, la proportion de clients satisfaits dans la population est comprise entre 55,2 % et 64,8 % (marge d'erreur de ± 4,8 points).
| Notion | Formule |
|---|---|
| Fréquence | $f_i = n_i / N$ |
| Médiane (continue) | $M_e = e_{i-1} + a_i \dfrac{N/2 - N_{i-1}}{n_i}$ |
| Moyenne | $\bar{x} = \dfrac{1}{N}\sum n_i x_i$ |
| Variance | $V(x) = \dfrac{1}{N}\sum n_i x_i^2 - \bar{x}^2$ |
| Coefficient de variation | $CV = \sigma_x / \bar{x}$ |
| Laspeyres prix | $L_p = \dfrac{\sum p_t q_0}{\sum p_0 q_0} \times 100$ |
| Covariance | $\text{Cov}(x,y) = \dfrac{1}{N}\sum x_i y_i - \bar{x}\bar{y}$ |
| Corrélation | $r = \text{Cov}(x,y) / (\sigma_x \sigma_y)$ |
| Régression | $a = \text{Cov}(x,y)/V(x)$ ; $b = \bar{y} - a\bar{x}$ |
| Bayes | $P(B_i/A) = \dfrac{P(A/B_i)P(B_i)}{\sum_j P(A/B_j)P(B_j)}$ |
| Binomiale | $P(X=k) = C_n^k p^k (1-p)^{n-k}$ ; $E = np$ ; $V = np(1-p)$ |
| Poisson | $P(X=k) = e^{-\lambda}\lambda^k / k!$ ; $E = V = \lambda$ |
| Erreur-type | $\sigma_{\bar{X}} = \sigma / \sqrt{n}$ |
| IC moyenne (95 %) | $\bar{x} \pm 1{,}96\, s/\sqrt{n}$ |
Document de révision — Module Statistiques et Probabilités (Licence) — Conforme au programme marocain des filières Économie & Gestion.