Exemple de question de discussion sur le coefficient de détermination

Exemple de question de discussion sur le coefficient de détermination

Le coefficient de détermination (R²) est un paramètre important en analyse de régression ; il indique dans quelle mesure un modèle de régression explique la variabilité réelle des données. Dans cet article, nous expliquerons le concept du coefficient de détermination à travers un exemple détaillé et une discussion approfondie.

Concept de base du coefficient de détermination

Le coefficient de détermination ou \( R^2 \) est mesuré sur une échelle de 0 à 1, où :

– \( R^2 = 0 \) indique que le modèle de régression n’est pas du tout capable d’expliquer la variabilité des données.
– \( R^2 = 1 \) montre que le modèle de régression est capable d'expliquer parfaitement toute la variabilité des données.

La formule de base pour calculer le coefficient de détermination est :

\[ R^2 = 1 – \frac{SSR}{SST} \]

De mana:
– La SSR (Somme des Résidus au Carré) est la somme des carrés des différences entre les valeurs prédites par le modèle et les valeurs réelles.
– La SST (Somme Totale des Carrés) correspond à la somme des carrés des différences entre la valeur réelle et la moyenne des valeurs réelles.

Exemple de problème

Prenons un exemple pour mieux comprendre le calcul du coefficient de détermination.

Exemple de problème :

Supposons que nous disposions de données sur le nombre d'heures d'étude (X) et les notes aux examens (Y) de 10 étudiants :

| Étudiants | Heures d'étude (X) | Note à l'examen (Y) |
|——-|——————–|——————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |

À LIRE AUSSI  Vecteurs équivalents dans le système de coordonnées cartésiennes

Nous allons créer un modèle de régression linéaire simple où les notes d'examen (Y) sont prédites en fonction des heures d'étude (X).

Discussion

1. Construction d'un modèle de régression linéaire simple

Un modèle de régression linéaire simple a la forme suivante :

\[ Y = a + bX \]

De mana:
– \( Y \) est le score prédit au test.
– \( X \) représente le nombre d’heures d’étude.
– \( a \) est l'ordonnée à l'origine (le point d'intersection sur l'axe Y lorsque X = 0).
– \( b \) est la pente (inclinaison de la droite de régression).

Pour calculer les paramètres \( a \) et \( b \), nous utilisons la formule suivante :

\[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
\[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]

Où \( n \) est le nombre de données (dans ce cas n = 10).

À partir du tableau, nous pouvons calculer :
– \(\sum{X} = 36\)
– \(\sum{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\sum{Y^2} = 50428\)
– \(\sum{XY} = 2576\)

Calculons d'abord b :

\[ b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
\[ b = \frac{25760 – 25344}{1400 – 1296} \]
\[ b = \frac{416}{104} \]
\[ b = 4 \]

Ensuite, nous calculons un :

\[ a = \frac{704 – 4(36)}{10} \]
\[ a = \frac{704 – 144}{10} \]
\[ a = \frac{560}{10} \]
\[ a = 56 \]

À LIRE AUSSI  Exemple de questions de discussion sur la taille du placement

Le modèle de régression linéaire obtenu est donc :

\[ Y = 56 + 4X \]

2. Calculer la valeur prédite (Y')

Ensuite, nous calculons la valeur prédite \( Y' \) pour chaque \( X \) :

| Étudiants | Heures d'étude (X) | Note à l'examen (Y) | Note prévue (Y') |
|——-|——————–|——————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |

3. Calcul du SSR et du SST

Ensuite, nous calculons SSR et SST pour obtenir \( R^2 \).

RSS :

\[ SSR = \sum{(Y – Y')^2} \]
\[ SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
\[ SSR = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
[ SSR = 454 ]

À LIRE AUSSI  Valeur attendue de la distribution normale

SST :

\[ SST = \somme{(Y – \bar{Y})^2} \]
De mana:
\[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]

\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[ SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
\[ SST = 1107.44 \]

4. Calcul du coefficient de détermination \( R^2 \) :

\[ R^2 = 1 – \frac{SSR}{SST} \]
\[ R^2 = 1 – \frac{454}{1107.44} \]
\[ R^2 = 1 – 0.41 \]
\[ R^2 = 0.59 \]

conclusion

Le calcul ci-dessus nous a permis d'obtenir un coefficient de détermination (R² = 0.59). Cela indique que le modèle de régression linéaire que nous avons créé explique environ 59 % de la variabilité des notes d'examen en fonction du temps d'étude. Les 41 % restants pourraient être dus à d'autres facteurs non inclus dans le modèle.

En comprenant les étapes et les calculs ci-dessus, on saisit l'importance du coefficient de détermination pour évaluer la capacité du modèle de régression à expliquer la variabilité réelle des données. Il s'agit d'un outil très utile en analyse statistique et en modélisation des données.

Laissez un commentaire