Exemples de questions et discussion sur la régression linéaire
La régression linéaire est une méthode statistique permettant de déterminer la relation entre deux variables ou plus. Cette méthode est largement utilisée dans divers domaines, notamment l'économie, le commerce, les sciences sociales et les sciences naturelles. Dans cet article, nous aborderons la régression linéaire, son calcul et proposerons plusieurs exemples commentés afin d'approfondir la compréhension de ce concept.
Comprendre la régression linéaire
La régression linéaire est une méthode analytique utilisée pour modéliser la relation entre une ou plusieurs variables indépendantes (prédicteurs) et une variable dépendante (réponse). La régression linéaire simple ne comporte qu'une seule variable indépendante et une seule variable dépendante, tandis que la régression linéaire multiple en comporte plusieurs.
L'équation d'une droite de régression linéaire simple est :
\[ Y = a + bX \]
De mana:
– \( Y \) est la variable dépendante.
– \( X \) est la variable indépendante.
– \( a \) est l'ordonnée à l'origine, qui est la valeur de Y lorsque X = 0.
– \( b \) est le coefficient de régression, c’est-à-dire combien Y change si X change d’une unité.
Étapes de la régression linéaire
1. Collecte des données : Commencez par collecter les données à analyser.
2. Représentation graphique des données : Créez un nuage de points pour déterminer s’il existe une relation linéaire entre les variables.
3. Calcul du coefficient de régression : utilisez la méthode des moindres carrés pour déterminer la meilleure droite.
4. Test du modèle : Testez la signification des coefficients de régression avec un test t et déterminez la valeur R² pour voir dans quelle mesure le modèle s’adapte aux données.
Exemples de questions et discussion
Exemple de question 1 : Régression linéaire simple
Question:
Un chercheur souhaite connaître la relation entre le nombre d'heures d'étude (X) et les notes obtenues aux examens par les étudiants (Y). Les données obtenues sont les suivantes :
| Heures d'étude (X) | Note à l'examen (Y) |
|——————–|——————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
Établissez une équation de régression linéaire à partir de ces données !
Discussion:
1. Calcul de la moyenne :
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. Calcul du coefficient de régression \( b \) :
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
∑ (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
∑ (Xᵢ – X̄)² = (2 – 5)² + (3 – 5)² + (5 – 5)² + (7 – 5)² + (8 – 5)²
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \approx 3.08
\]
3. Calcul de l'ordonnée à l'origine \( a \) :
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 × 5 = 80 – 15.4 = 64.6
\]
4. Équation de régression :
\[
Y = 64.6 + 3.08X
\]
L'équation de régression linéaire des données est donc : \( Y = 64.6 + 3.08X \). Cela signifie que chaque heure d'étude supplémentaire devrait augmenter la note au test de 3.08 points.
Exemple de question 2 : Test modèle et interprétation
Question:
En reprenant les mêmes données, calculez la valeur du coefficient de détermination (R²) pour mesurer la qualité de l'ajustement du modèle aux données. Testez également la significativité du coefficient de régression b.
Discussion:
1. Calculer la somme totale des carrés (SST), la somme des carrés de la régression (SSR) et la somme des carrés des erreurs (SSE) :
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
SST = (70 – 80)² + (75 – 80)² + (80 – 80)² + (85 – 80)² + (90 – 80)² = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \sum (\hat{Y}_i – \bar{Y})^2
\]
Où \( \hat{Y}_i \) est la valeur prédite de l'équation de régression :
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
\bar{Y} = 80
\]
\[
SSR = (67.76 – 80)² + (70.84 – 80)² + (76.0 – 80)² + (82.16 – 80)² + (85.24 – 80)²
\]
\[
SSR = (-12.24)² + (-9.16)² + (-4.0)² + 2.16² + 5.24² = 149.8
\]
2. Calcul de la SSE :
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
3. Calcul du R² :
\[
R² = SSR/SST = 149.8/250 ≈ 0.6
\]
Un coefficient de détermination (R²) de 0.6 indique que ce modèle explique environ 60 % de la variation des données. Cela signifie que la droite de régression s'ajuste assez bien aux données.
4. Test t de signification du coefficient \( b \) :
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = \sqrt{33.4} / \sqrt{26} \approx 1.13
\]
\[
t = \frac{3.08}{1.13} \approx 2.73
\]
Avec une statistique t d'environ 2.73, si l'on utilise un seuil de signification courant (α = 0.05), on la compare à la valeur critique de t. Par exemple, pour 3 degrés de liberté, la valeur critique de t est d'environ 2.353. Alors, t observé > t critique, ce qui indique que le coefficient est significatif.
conclusion
Dans cet article, nous avons abordé les principes fondamentaux de la régression linéaire, le calcul du coefficient de régression et de l'ordonnée à l'origine, ainsi que l'interprétation des résultats à l'aide d'exemples concrets. La pratique régulière sur différents jeux de données est essentielle pour maîtriser cette méthode. La régression linéaire est un outil précieux en analyse de données et permet de mieux comprendre les relations entre les variables.