Cours — Statistiques et Probabilités

📖 Statistiques et Probabilités

📊 STATISTIQUES ET PROBABILITÉS — Cours Complet

Licence Fondamentale / Professionnelle — Semestre S1/S2 — Système universitaire marocain Statistique descriptive (univariée et bivariée), probabilités, lois usuelles, échantillonnage et estimation.

💡 Comment lire ce cours ? Toutes les formules sont écrites en LaTeX. Chaque chapitre contient : le cours ➜ un exercice ➜ sa correction détaillée.


🗺️ PLAN DU COURS

Chapitre Notions clés
1 Vocabulaire et tableaux statistiques Population, caractère, effectifs, fréquences, classes
2 Les caractéristiques de tendance centrale Mode, médiane, moyenne arithmétique, quartiles
3 Les caractéristiques de dispersion et de forme Variance, écart-type, coefficient de variation, concentration
4 Les indices statistiques Indices élémentaires, indices synthétiques (Laspeyres, Paasche)
5 La statistique bivariée : corrélation et régression Covariance, coefficient de corrélation, droite des moindres carrés
6 Les fondements du calcul des probabilités Événements, probabilité conditionnelle, indépendance, Bayes
7 Variables aléatoires et lois usuelles Espérance, variance, binomiale, Poisson, normale
8 Échantillonnage et estimation Loi de la moyenne empirique, intervalle de confiance
Formulaire final + Conseils examen Synthèse de toutes les formules

CHAPITRE 1 — VOCABULAIRE ET TABLEAUX STATISTIQUES

1.1 Définitions de base

Terme Définition
Population Ensemble des éléments étudiés (ex. les entreprises d'un secteur)
Individu (unité statistique) Un élément de la population
Échantillon Sous-ensemble de la population effectivement observé
Caractère (variable) Propriété étudiée sur chaque individu
Modalité Valeur prise par le caractère

1.2 Typologie des caractères

Type Sous-type Exemple
Qualitatif Nominal (pas d'ordre) Secteur d'activité, sexe
Qualitatif Ordinal (ordonné) Niveau de satisfaction
Quantitatif Discret (valeurs isolées) Nombre d'enfants, nombre de salariés
Quantitatif Continu (regroupé en classes) Salaire, chiffre d'affaires

1.3 Effectifs et fréquences

Pour une modalité $x_i$ d'effectif $n_i$ dans une population de taille $N$ :

$$f_i = \frac{n_i}{N} \qquad \text{avec} \qquad \sum_{i=1}^{k} n_i = N \quad \text{et} \quad \sum_{i=1}^{k} f_i = 1$$

L'effectif cumulé croissant $N_i$ est la somme des effectifs jusqu'à la modalité $i$ incluse ; il sert au calcul de la médiane et des quartiles.

1.4 Le cas des variables continues

Les données sont regroupées en classes $[e_{i-1} ; e_i[$ :

  • Amplitude de la classe : $a_i = e_i - e_{i-1}$
  • Centre de la classe : $c_i = \dfrac{e_{i-1} + e_i}{2}$
  • Densité : $d_i = \dfrac{n_i}{a_i}$ — indispensable quand les amplitudes sont inégales (l'histogramme se construit alors avec la densité en ordonnée, non l'effectif).

✏️ EXERCICE 1

Question — Les salaires mensuels (en DH) de 50 employés sont répartis ainsi : [3000 ; 5000[ : 20 employés ; [5000 ; 6000[ : 20 employés ; [6000 ; 10000[ : 10 employés. Peut-on construire l'histogramme directement à partir des effectifs ? Calculez ce qu'il faut porter en ordonnée.

✅ CORRECTION 1

Non : les amplitudes sont inégales (2000, 1000, 4000), il faut donc utiliser la densité $d_i = n_i / a_i$, sinon la surface des rectangles ne serait plus proportionnelle aux effectifs.

Classe $n_i$ $a_i$ $d_i = n_i/a_i$
[3000 ; 5000[ 20 2000 0,010
[5000 ; 6000[ 20 1000 0,020
[6000 ; 10000[ 10 4000 0,0025

C'est bien la classe [5000 ; 6000[ qui est la plus « dense » : elle concentre 20 employés sur seulement 1000 DH d'amplitude.


CHAPITRE 2 — LES CARACTÉRISTIQUES DE TENDANCE CENTRALE

2.1 Le mode

Le mode est la modalité de plus grand effectif. Pour une variable continue, on parle de classe modale (celle de plus forte densité si les amplitudes sont inégales).

2.2 La médiane

La médiane $M_e$ partage la population en deux parties d'effectifs égaux. Pour une variable continue, on l'obtient par interpolation linéaire dans la classe médiane $[e_{i-1} ; e_i[$ :

$$M_e = e_{i-1} + a_i \times \frac{\frac{N}{2} - N_{i-1}}{n_i}$$

où $N_{i-1}$ est l'effectif cumulé avant la classe médiane.

2.3 La moyenne arithmétique

$$\bar{x} = \frac{1}{N}\sum_{i=1}^{k} n_i x_i = \sum_{i=1}^{k} f_i x_i$$

Pour une variable continue, on remplace $x_i$ par le centre de classe $c_i$.

2.4 Les quantiles

Les quartiles $Q_1$, $Q_2 = M_e$, $Q_3$ partagent la population en quatre parties égales. Même formule d'interpolation en remplaçant $N/2$ par $N/4$ et $3N/4$.

2.5 Comparaison

Indicateur Avantage Limite
Mode Simple, seul possible pour un caractère qualitatif Peut ne pas être unique
Médiane Insensible aux valeurs extrêmes Ignore l'information des valeurs éloignées
Moyenne Utilise toute l'information, base des calculs ultérieurs Très sensible aux valeurs aberrantes

✏️ EXERCICE 2

Question — Reprenez la distribution de l'exercice 1 (50 employés). Calculez le salaire moyen et le salaire médian, puis commentez l'écart entre les deux.

✅ CORRECTION 2

Moyenne (centres de classes : 4000, 5500, 8000) :

$$\bar{x} = \frac{20(4000) + 20(5500) + 10(8000)}{50} = \frac{80\,000 + 110\,000 + 80\,000}{50} = \frac{270\,000}{50} = 5400 \text{ DH}$$

Médiane : $N/2 = 25$. Effectifs cumulés : 20 ; 40 ; 50 → la classe médiane est [5000 ; 6000[.

$$M_e = 5000 + 1000 \times \frac{25 - 20}{20} = 5000 + 250 = 5250 \text{ DH}$$

Commentaire : $\bar{x} > M_e$, la distribution est étalée à droite (asymétrie positive) : une minorité de hauts salaires (classe [6000 ; 10000[) tire la moyenne vers le haut. La médiane décrit ici mieux le salarié « typique ».


CHAPITRE 3 — LES CARACTÉRISTIQUES DE DISPERSION ET DE FORME

3.1 Étendue et intervalle interquartile

$$E = x_{\max} - x_{\min} \qquad ; \qquad IQ = Q_3 - Q_1$$

3.2 Variance et écart-type

$$V(x) = \frac{1}{N}\sum n_i (x_i - \bar{x})^2 = \underbrace{\frac{1}{N}\sum n_i x_i^2 - \bar{x}^2}_{\text{formule développée (à privilégier)}}$$

$$\sigma_x = \sqrt{V(x)}$$

3.3 Le coefficient de variation

$$CV = \frac{\sigma_x}{\bar{x}} \times 100$$

Le $CV$ est sans unité : c'est le seul indicateur permettant de comparer la dispersion de deux séries exprimées dans des unités différentes ou d'ordres de grandeur très différents. Une série est d'autant plus homogène que son $CV$ est faible (usuellement $CV < 15\%$).

3.4 Asymétrie (skewness)

Situation Forme de la distribution
$\bar{x} = M_e = M_o$ Distribution symétrique
$\bar{x} > M_e > M_o$ Étalement à droite (asymétrie positive)
$\bar{x} < M_e < M_o$ Étalement à gauche (asymétrie négative)

3.5 La concentration (courbe de Lorenz et indice de Gini)

La courbe de Lorenz relie les fréquences cumulées des individus aux fréquences cumulées de la masse (revenus, CA...). L'indice de Gini $G$ vaut le double de l'aire entre la courbe et la diagonale d'équirépartition :

$$0 \leq G \leq 1$$

$G = 0$ : équirépartition parfaite ; $G$ proche de 1 : concentration extrême. C'est l'outil de référence pour mesurer les inégalités de revenus.


✏️ EXERCICE 3

Question — Deux agences bancaires ont un montant moyen de crédit de 120 000 DH ($\sigma = 18\,000$) pour l'agence A et de 45 000 DH ($\sigma = 9\,000$) pour l'agence B. Quelle agence a la clientèle la plus homogène ?

✅ CORRECTION 3

L'écart-type seul est trompeur (A a le plus grand écart-type mais aussi la plus grande moyenne). On compare les coefficients de variation :

$$CV_A = \frac{18\,000}{120\,000} \times 100 = 15\% \qquad CV_B = \frac{9\,000}{45\,000} \times 100 = 20\%$$

$CV_A < CV_B$ : c'est l'agence A qui a la clientèle la plus homogène, malgré un écart-type absolu deux fois plus élevé.


CHAPITRE 4 — LES INDICES STATISTIQUES

4.1 Indice élémentaire

$$I_{t/0} = \frac{x_t}{x_0} \times 100$$

Un indice de 112 signifie une hausse de 12 % entre la date de base 0 et la date $t$.

4.2 Propriétés

Propriété Formule
Réversibilité $I_{t/0} \times I_{0/t} = 100^2$ (en base 100)
Transitivité (circularité) $I_{2/0} = \dfrac{I_{2/1} \times I_{1/0}}{100}$

4.3 Indices synthétiques de prix

Indice Formule Pondération
Laspeyres prix $L_p = \dfrac{\sum p_t q_0}{\sum p_0 q_0} \times 100$ Quantités de la période de base
Paasche prix $P_p = \dfrac{\sum p_t q_t}{\sum p_0 q_t} \times 100$ Quantités de la période courante
Fisher $F = \sqrt{L_p \times P_p}$ Moyenne géométrique des deux

L'indice des prix à la consommation (IPC) publié par le HCP au Maroc est un indice de type Laspeyres.

4.4 Taux de croissance annuel moyen (TCAM)

$$TCAM = \left( \frac{x_n}{x_0} \right)^{\frac{1}{n}} - 1$$


✏️ EXERCICE 4

Question — Le chiffre d'affaires d'une entreprise passe de 4 000 000 DH en 2019 à 6 500 000 DH en 2024. Calculez l'indice base 100 en 2019 et le taux de croissance annuel moyen.

✅ CORRECTION 4

Indice : $I_{2024/2019} = \dfrac{6\,500\,000}{4\,000\,000} \times 100 = 162,5$ → hausse de 62,5 % sur la période.

TCAM sur $n = 5$ ans :

$$TCAM = \left( \frac{6\,500\,000}{4\,000\,000} \right)^{1/5} - 1 = (1{,}625)^{0,2} - 1 \approx 0{,}1020$$

Soit environ 10,2 % par an. Attention à ne jamais diviser 62,5 % par 5 (ce qui donnerait 12,5 %) : cela ignorerait l'effet de composition des taux.


CHAPITRE 5 — LA STATISTIQUE BIVARIÉE : CORRÉLATION ET RÉGRESSION

5.1 La covariance

$$\text{Cov}(x,y) = \frac{1}{N}\sum (x_i - \bar{x})(y_i - \bar{y}) = \frac{1}{N}\sum x_i y_i - \bar{x}\,\bar{y}$$

5.2 Le coefficient de corrélation linéaire

$$r = \frac{\text{Cov}(x,y)}{\sigma_x \, \sigma_y} \qquad \text{avec} \qquad -1 \leq r \leq 1$$

Valeur de $\lvert r \rvert$ Interprétation
Proche de 1 Liaison linéaire forte
Entre 0,5 et 0,8 Liaison linéaire moyenne
Proche de 0 Absence de liaison linéaire (une liaison non linéaire reste possible)

⚠️ Corrélation n'est pas causalité : deux variables peuvent être fortement corrélées à cause d'une troisième variable (corrélation fallacieuse).

5.3 La droite de régression des moindres carrés

Droite de $y$ en $x$ : $y = ax + b$ avec

$$a = \frac{\text{Cov}(x,y)}{V(x)} \qquad ; \qquad b = \bar{y} - a\bar{x}$$

La droite passe toujours par le point moyen $(\bar{x} ; \bar{y})$.

5.4 Le coefficient de détermination

$$R^2 = r^2$$

$R^2$ mesure la part de la variance de $y$ expliquée par $x$. Un $R^2 = 0{,}81$ signifie que 81 % des variations de $y$ sont expliquées par le modèle.


✏️ EXERCICE 5

Question — On observe pour 5 mois les dépenses publicitaires $x$ (en milliers de DH) et les ventes $y$ (en milliers de DH) : $\bar{x} = 10$, $\bar{y} = 50$, $\sigma_x = 4$, $\sigma_y = 12$, $\text{Cov}(x,y) = 40$. Déterminez le coefficient de corrélation, la droite de régression de $y$ en $x$, et prévoyez les ventes pour une dépense de 14.

✅ CORRECTION 5

Corrélation :

$$r = \frac{40}{4 \times 12} = \frac{40}{48} \approx 0{,}833$$

Corrélation positive forte ; $R^2 = 0{,}694$ → environ 69 % des variations des ventes sont expliquées par la publicité.

Droite de régression : $V(x) = \sigma_x^2 = 16$

$$a = \frac{40}{16} = 2{,}5 \qquad ; \qquad b = 50 - 2{,}5 \times 10 = 25$$

$$y = 2{,}5x + 25$$

Prévision pour $x = 14$ : $y = 2{,}5(14) + 25 = 60$, soit 60 000 DH de ventes prévues. Interprétation de $a$ : 1 000 DH de publicité supplémentaire est associé à 2 500 DH de ventes en plus.


CHAPITRE 6 — LES FONDEMENTS DU CALCUL DES PROBABILITÉS

6.1 Vocabulaire

Terme Définition
Expérience aléatoire Expérience dont le résultat n'est pas prévisible avec certitude
Univers $\Omega$ Ensemble de tous les résultats possibles
Événement Sous-ensemble de $\Omega$
Événements incompatibles $A \cap B = \varnothing$

6.2 Axiomes et règles de calcul

$$0 \leq P(A) \leq 1 \qquad ; \qquad P(\Omega) = 1 \qquad ; \qquad P(\bar{A}) = 1 - P(A)$$

$$P(A \cup B) = P(A) + P(B) - P(A \cap B)$$

En situation d'équiprobabilité :

$$P(A) = \frac{\text{nombre de cas favorables}}{\text{nombre de cas possibles}}$$

6.3 Probabilité conditionnelle et indépendance

$$P(A/B) = \frac{P(A \cap B)}{P(B)} \quad \text{si } P(B) \neq 0 \qquad \Longrightarrow \qquad P(A \cap B) = P(A/B) \times P(B)$$

$A$ et $B$ sont indépendants si $P(A \cap B) = P(A) \times P(B)$, ce qui équivaut à $P(A/B) = P(A)$.

6.4 Probabilités totales et formule de Bayes

Si $\{B_1, ..., B_n\}$ forme une partition de $\Omega$ :

$$P(A) = \sum_{i} P(A/B_i)\,P(B_i)$$

$$P(B_i/A) = \frac{P(A/B_i)\,P(B_i)}{\sum_j P(A/B_j)\,P(B_j)}$$


✏️ EXERCICE 6

Question — Une entreprise s'approvisionne auprès de deux fournisseurs : F1 fournit 60 % des pièces avec 2 % de défectueuses, F2 fournit 40 % des pièces avec 5 % de défectueuses. (a) Quelle est la probabilité qu'une pièce prise au hasard soit défectueuse ? (b) Une pièce est défectueuse : quelle est la probabilité qu'elle provienne de F2 ?

✅ CORRECTION 6

(a) Probabilités totales :

$$P(D) = P(D/F_1)P(F_1) + P(D/F_2)P(F_2) = 0{,}02 \times 0{,}6 + 0{,}05 \times 0{,}4 = 0{,}012 + 0{,}020 = 0{,}032$$

Soit 3,2 % de pièces défectueuses.

(b) Bayes :

$$P(F_2/D) = \frac{0{,}020}{0{,}032} = 0{,}625$$

62,5 % des pièces défectueuses proviennent de F2, alors que F2 ne fournit que 40 % des pièces : ce fournisseur est bien surreprésenté parmi les défauts.


CHAPITRE 7 — VARIABLES ALÉATOIRES ET LOIS USUELLES

7.1 Espérance et variance

Pour une variable aléatoire discrète $X$ :

$$E(X) = \sum_i x_i \, P(X = x_i) \qquad ; \qquad V(X) = E(X^2) - [E(X)]^2$$

Propriétés : $E(aX + b) = aE(X) + b$ et $V(aX + b) = a^2 V(X)$.

7.2 Les lois discrètes usuelles

Loi Conditions $E(X)$ $V(X)$
Bernoulli $\mathcal{B}(p)$ Une épreuve, succès/échec $p$ $p(1-p)$
Binomiale $\mathcal{B}(n,p)$ $n$ épreuves indépendantes, $p$ constante $np$ $np(1-p)$
Poisson $\mathcal{P}(\lambda)$ Événements rares sur une période $\lambda$ $\lambda$

$$P(X = k) = C_n^k \, p^k (1-p)^{n-k} \quad \text{(binomiale)} \qquad ; \qquad P(X = k) = e^{-\lambda}\frac{\lambda^k}{k!} \quad \text{(Poisson)}$$

7.3 La loi normale

$X \sim \mathcal{N}(\mu ; \sigma)$. On se ramène à la loi normale centrée réduite $T \sim \mathcal{N}(0 ; 1)$ par le changement de variable :

$$T = \frac{X - \mu}{\sigma}$$

Valeurs à mémoriser : $P(\mu - \sigma < X < \mu + \sigma) \approx 68\%$ ; $\pm 2\sigma \approx 95\%$ ; $\pm 3\sigma \approx 99{,}7\%$.

7.4 Approximations classiques

De Vers Conditions
Binomiale Poisson $\lambda = np$ $n \geq 30$, $p \leq 0{,}1$, $np < 5$
Binomiale Normale $\mathcal{N}(np ; \sqrt{np(1-p)})$ $n \geq 30$, $np \geq 5$, $n(1-p) \geq 5$

✏️ EXERCICE 7

Question — Un centre d'appels reçoit en moyenne 3 réclamations par heure, suivant une loi de Poisson. Calculez la probabilité de recevoir exactement 2 réclamations en une heure, puis celle d'en recevoir au moins une.

✅ CORRECTION 7

Avec $\lambda = 3$ :

$$P(X = 2) = e^{-3}\frac{3^2}{2!} = e^{-3} \times 4{,}5 \approx 0{,}0498 \times 4{,}5 \approx 0{,}224$$

Soit 22,4 %.

$$P(X \geq 1) = 1 - P(X = 0) = 1 - e^{-3} \approx 1 - 0{,}0498 = 0{,}950$$

Soit 95,0 %. Le réflexe « au moins un = 1 − aucun » évite une somme infinie.


CHAPITRE 8 — ÉCHANTILLONNAGE ET ESTIMATION

8.1 Distribution de la moyenne empirique

Si l'on prélève des échantillons de taille $n$ dans une population de moyenne $\mu$ et d'écart-type $\sigma$ :

$$E(\bar{X}) = \mu \qquad ; \qquad \sigma_{\bar{X}} = \frac{\sigma}{\sqrt{n}}$$

$\sigma/\sqrt{n}$ est l'erreur-type : la précision s'améliore comme la racine carrée de la taille de l'échantillon (quadrupler $n$ divise l'erreur par 2). D'après le théorème central limite, $\bar{X}$ suit approximativement une loi normale dès que $n \geq 30$, quelle que soit la loi de la population.

8.2 Estimation ponctuelle

Paramètre Estimateur Remarque
Moyenne $\mu$ $\bar{x}$ Sans biais
Proportion $p$ $f$ (fréquence observée) Sans biais
Variance $\sigma^2$ $s^2 = \dfrac{n}{n-1}\,\sigma_e^2$ Correction de biais : diviser par $n-1$

8.3 Intervalle de confiance d'une moyenne

$$IC = \left[ \bar{x} - t\frac{s}{\sqrt{n}} \; ; \; \bar{x} + t\frac{s}{\sqrt{n}} \right]$$

où $t = 1{,}96$ au seuil de confiance de 95 % et $t = 2{,}58$ à 99 % (grands échantillons).

8.4 Intervalle de confiance d'une proportion

$$IC = \left[ f - t\sqrt{\frac{f(1-f)}{n}} \; ; \; f + t\sqrt{\frac{f(1-f)}{n}} \right]$$


✏️ EXERCICE 8

Question — Sur un échantillon de 400 clients, 60 % se déclarent satisfaits. Déterminez l'intervalle de confiance de la proportion de clients satisfaits au seuil de 95 %.

✅ CORRECTION 8

$f = 0{,}60$, $n = 400$, $t = 1{,}96$ :

$$\sqrt{\frac{0{,}6 \times 0{,}4}{400}} = \sqrt{\frac{0{,}24}{400}} = \sqrt{0{,}0006} \approx 0{,}0245$$

$$IC = [0{,}60 - 1{,}96 \times 0{,}0245 \; ; \; 0{,}60 + 1{,}96 \times 0{,}0245] = [0{,}552 \; ; \; 0{,}648]$$

Au seuil de 95 %, la proportion de clients satisfaits dans la population est comprise entre 55,2 % et 64,8 % (marge d'erreur de ± 4,8 points).


📐 FORMULAIRE FINAL

Notion Formule
Fréquence $f_i = n_i / N$
Médiane (continue) $M_e = e_{i-1} + a_i \dfrac{N/2 - N_{i-1}}{n_i}$
Moyenne $\bar{x} = \dfrac{1}{N}\sum n_i x_i$
Variance $V(x) = \dfrac{1}{N}\sum n_i x_i^2 - \bar{x}^2$
Coefficient de variation $CV = \sigma_x / \bar{x}$
Laspeyres prix $L_p = \dfrac{\sum p_t q_0}{\sum p_0 q_0} \times 100$
Covariance $\text{Cov}(x,y) = \dfrac{1}{N}\sum x_i y_i - \bar{x}\bar{y}$
Corrélation $r = \text{Cov}(x,y) / (\sigma_x \sigma_y)$
Régression $a = \text{Cov}(x,y)/V(x)$ ; $b = \bar{y} - a\bar{x}$
Bayes $P(B_i/A) = \dfrac{P(A/B_i)P(B_i)}{\sum_j P(A/B_j)P(B_j)}$
Binomiale $P(X=k) = C_n^k p^k (1-p)^{n-k}$ ; $E = np$ ; $V = np(1-p)$
Poisson $P(X=k) = e^{-\lambda}\lambda^k / k!$ ; $E = V = \lambda$
Erreur-type $\sigma_{\bar{X}} = \sigma / \sqrt{n}$
IC moyenne (95 %) $\bar{x} \pm 1{,}96\, s/\sqrt{n}$

💡 Conseils pour l'examen

  • Vérifiez toujours l'égalité des amplitudes de classes avant de tracer un histogramme ou de repérer la classe modale : sinon, raisonnez en densité.
  • Utilisez la formule développée de la variance ($\frac{1}{N}\sum n_i x_i^2 - \bar{x}^2$) : elle est bien plus rapide que la formule par écarts.
  • Ne comparez jamais deux dispersions par les écarts-types si les moyennes diffèrent : passez par le coefficient de variation.
  • En probabilités, repérez les mots-clés : « sachant que » ➜ probabilité conditionnelle ; « au moins un » ➜ passer par l'événement contraire ; « $n$ tirages indépendants » ➜ loi binomiale.
  • Pour un intervalle de confiance, précisez toujours le seuil et interprétez le résultat en une phrase : un IC sans interprétation perd la moitié des points.

Document de révision — Module Statistiques et Probabilités (Licence) — Conforme au programme marocain des filières Économie & Gestion.

← Retour à tous les cours