Détermination du coefficient de corrélation : introduction, méthodes et applications
Le coefficient de corrélation est une mesure statistique qui détermine la force de la relation entre deux variables dans un ensemble de données. Les coefficients de corrélation varient de -1 à 1. Une valeur proche de 1 ou de -1 indique une forte corrélation entre les deux variables. Une valeur proche de 0 indique une absence de corrélation. Cet article présente le coefficient de corrélation, ses méthodes de calcul, son interprétation et ses applications dans divers domaines.
Introduction au coefficient de corrélation
Le coefficient de corrélation nous donne une représentation numérique du degré de relation entre deux variables. Les coefficients de corrélation se divisent en deux types principaux selon le sens de la relation :
1. Coefficient de corrélation positif : indique que lorsqu’une variable augmente, l’autre variable augmente également.
2. Coefficient de corrélation négatif : indique que lorsqu’une variable augmente, l’autre variable diminue.
La relation entre deux variables peut également être divisée en trois types en fonction de la force de cette relation :
1. Forte corrélation : le coefficient est proche de -1 ou de 1.
2. Corrélation modérée : Le coefficient est compris entre -0.5 et -1 ou entre 0.5 et 1.
3. Faible corrélation : le coefficient est proche de 0.
Méthode de calcul du coefficient de corrélation
Plusieurs méthodes courantes permettent de calculer le coefficient de corrélation, notamment les corrélations de Pearson, de Spearman et de Kendall. Examinons chacune de ces méthodes plus en détail.
1. Corrélation de Pearson
Le coefficient de corrélation de Pearson est souvent utilisé lorsque les deux variables sont continues et suivent une loi normale. Sa formule est la suivante :
\[ r = \frac {n(\Sigma xy) – (\Sigma x)(\Sigma y)}{ \sqrt{ [n \Sigma x^2 – (\Sigma x)^2] [n \Sigma y^2 – (\Sigma y)^2 ] } } \]
De mana:
– \( r \) = coefficient de corrélation,
– \( n \) = nombre de paires de données,
– \( \Sigma xy \) = la somme des produits des paires de données \( x \) et \( y \),
– \( \Sigma x \) = somme des valeurs \( x \),
– \( \Sigma y \) = somme des valeurs \( y \),
– \( \Sigma x^2 \) = somme des carrés de \( x \),
– \( \Sigma y^2 \) = somme des carrés de \( y \).
2. Corrélation de rang de Spearman
Le coefficient de corrélation de Spearman est utilisé pour les données ordinales ou lorsque l'hypothèse de normalité n'est pas vérifiée. La corrélation de Spearman repose sur le classement des valeurs des données plutôt que sur leurs valeurs absolues. La formule du coefficient de corrélation de Spearman est :
\[ \rho = 1 – \frac {6\Sigma d_i^2}{n(n^2-1)} \]
De mana:
– \( \rho \) = coefficient de corrélation de Spearman,
– \( d_i \) = différence entre les classements des paires de données \( x \) et \( y \),
– \( n \) = nombre de paires de données.
3. Corrélation Tau de Kendall
Le coefficient de corrélation de Kendall mesure la force de la relation entre deux variables ordinales. Contrairement à celui de Spearman, la corrélation de Kendall s'intéresse davantage au nombre de paires concordantes et discordantes. La formule du coefficient de corrélation de Kendall est :
\[ \tau = \frac{ (C – D)} { \sqrt{(C + D + T) (C + D + U) } } \]
De mana:
– \( \tau \) = coefficient de corrélation de Kendall,
– \( C \) = nombre de paires concordantes,
– \( D \) = nombre de paires discordantes,
– \( T \) = nombre de paires de séries dans la variable \( x \),
– \( U \) = nombre de paires de séries dans la variable \( y \).
Interprétation du coefficient de corrélation
L'interprétation du coefficient de corrélation dépend de la valeur du coefficient obtenu :
– Coefficient +1 : Relation positive parfaite.
– Coefficient de 0.7 à 0.9 : Forte corrélation positive.
– Coefficient 0.4 à 0.6 : Relation positive modérée.
– Coefficient 0.1 à 0.3 : Relation positive faible.
– Coefficient 0 : Aucune relation.
– Coefficient -0.1 à -0.3 : Relation négative faible.
– Coefficient -0.4 à -0.6 : Relation négative modérée.
– Coefficient -0.7 à -0.9 : Forte relation négative.
– Coefficient -1 : Relation négative parfaite.
Application du coefficient de corrélation
Le coefficient de corrélation trouve de nombreuses applications dans divers domaines, notamment l'économie, les sciences sociales, la santé, l'éducation, etc. Voici quelques exemples :
1. Économie : Déterminer la relation entre l'inflation et le chômage, ou entre les dépenses de consommation et le revenu.
2. Sciences sociales : Déterminer la relation entre l'éducation et le revenu, ou entre les médias sociaux et le bien-être psychologique.
3. Santé : Comparer la relation entre les habitudes tabagiques et les cas de cancer du poumon, ou entre un mode de vie actif et la santé cardiaque.
4. Éducation : Examiner la relation entre le temps d'étude et les résultats aux examens, ou entre la taille de la classe et la réussite des élèves.
Exemples pratiques utilisant des ensembles de données
Supposons que nous ayons un ensemble de données comprenant les résultats aux tests de mathématiques et le temps d'étude en heures de 10 étudiants, comme suit :
“`
Les élèves étudient leurs heures de cours et obtiennent leurs notes en mathématiques.
1 5 85
2 3 78
3 6 90
4 2 76
5 4 80
6 6 88
7 5 85
8 3 82
9 7 91
10 5 87
“`
Nous pouvons calculer le coefficient de corrélation de Pearson entre Study_Hours et Math_Score. En utilisant la formule de Pearson, nous calculons d'abord \( \Sigma x \), \( \Sigma y \), \( \Sigma xy \), \( \Sigma x^2 \), et \( \Sigma y^2 \), puis nous substituons ces valeurs dans la formule pour obtenir la valeur de \( r \).
conclusion
Le coefficient de corrélation est un outil puissant d'analyse de données permettant de déterminer la force et le sens de la relation entre deux variables. Comprendre le concept, les méthodes de calcul et l'interprétation du coefficient de corrélation est essentiel pour une analyse de données efficace. Une bonne compréhension de ce coefficient nous permet de mieux déterminer les corrélations entre les variables dans divers domaines et de prendre des décisions plus éclairées et fondées sur les données.