Test de Mann-Whitney en statistique
Les statistiques sont une branche des mathématiques qui s'intéresse à la collecte, à l'analyse, à l'interprétation et à la présentation des données. Elles sont utilisées dans divers domaines pour faciliter la prise de décisions fondées sur les données. Parmi les techniques statistiques fréquemment employées figure le test de Mann-Whitney (également appelé test U de Mann-Whitney ou test de Wilcoxon). Il s'agit d'une méthode non paramétrique permettant de déterminer s'il existe une différence significative entre deux groupes non appariés.
Introduction au test de Mann-Whitney
Le test de Mann-Whitney a été introduit par Henry Mann et Donald Whitney en 1947 comme alternative non paramétrique au test t. Cette méthode ne nécessite pas l'hypothèse de normalité. Elle est donc particulièrement utile lorsque les données ne suivent pas une distribution normale ou lorsque la taille de l'échantillon est trop petite pour vérifier cette hypothèse.
Principes de base du test de Mann-Whitney
Le test de Mann-Whitney est utilisé pour comparer les médianes de deux groupes. Son principe de base est le suivant :
1. Classement des observations : Toutes les données des deux groupes sont combinées et classées de la plus petite à la plus grande. En cas de valeurs identiques, chaque observation est classée selon la moyenne de son rang respectif.
2. Calcul du test statistique : La valeur du test statistique (U) est calculée à partir de la somme des rangs de chaque groupe. Il existe deux méthodes de calcul : l’une partant du premier groupe et l’autre du second.
– La formule générale pour U est :
\[
U_1 = n_1 × n_2 + (n_1 × (n_1 + 1))/2 – R_1
\]
Atau
\[
U_2 = n_1 × n_2 + (n_2 × (n_2 + 1))/2 – R_2
\]
Où:
– \(n_1\) et \(n_2\) représentent le nombre d'observations dans chaque groupe,
– \(R_1\) et \(R_2\) sont le nombre de rangs dans chaque groupe.
3. Test de signification : Le test de signification permet de déterminer la p-valeur. Lorsque la taille de l’échantillon est importante, la distribution U peut être approximée par une distribution normale.
Hypothèses du test de Mann-Whitney
Bien que le test de Mann-Whitney soit un test non paramétrique et ne nécessite pas l'hypothèse d'une distribution normale, plusieurs hypothèses connexes doivent être respectées pour la validité des résultats :
1. Indépendance : Chaque observation dans les deux groupes doit être indépendante de l'autre.
2. Échelle ordinale ou d'intervalle : les données doivent être sur une échelle ordinale ou d'intervalle. Cela signifie que les données peuvent être triées et contiennent des informations de classement.
3. Étendue de la distribution : La distribution des deux groupes doit avoir la même forme (même si la médiane peut être différente).
Étapes de la réalisation du test de Mann-Whitney
Voici les étapes généralement suivies pour effectuer le test de Mann-Whitney :
1. Fusion et tri des données : Fusionnez les données des deux groupes et triez-les. Attribuez un rang en fonction de l’ordre, en ajustant le rang en fonction de la valeur moyenne.
2. Calculer le nombre de classements : Calculez le nombre de classements pour chaque groupe.
3. Détermination de la valeur U des statistiques : Utilisez la formule expliquée précédemment pour calculer la valeur U pour les deux groupes.
4. Détermination de la valeur critique ou de la valeur p : Comparez la valeur U obtenue avec la valeur critique du tableau de distribution U (ou calculez la valeur p) pour déterminer si la différence entre les groupes est statistiquement significative.
Par exemple, supposons que nous ayons deux ensembles de données A et B. Ces données peuvent représenter deux thérapies différentes pour une maladie particulière, et nous voulons savoir si une thérapie est plus efficace que l'autre.
Contoh Praktis
Supposons que nous ayons deux groupes de thérapie :
– Thérapie A : [85, 90, 88, 75, 91]
– Thérapie B : [80, 78, 95, 87, 92]
1. Fusion et tri des données :
– Composite : [85, 90, 88, 75, 91, 80, 78, 95, 87, 92]
– Ordre et classement : [75(1), 78(2), 80(3), 85(4), 87(5), 88(6), 90(7), 91(8), 92(9), 95(10)]
2. Calcul du nombre de rangs :
– Nombre de séances de thérapie notées A : 4 + 7 + 6 + 1 + 8 = 26
– Nombre d'évaluations B en thérapie : 3 + 2 + 10 + 5 + 9 = 29
3. Calcul de la valeur U :
\[
U_A = n_1 × n_2 + (n_1 × (n_1 + 1))/2 – R_A = 5 × 5 + (5 × (5 + 1))/2 – 26 = 25 + 15 – 26 = 14
\]
\[
U_B = n_1 × n_2 + (n_2 × (n_2 + 1))/2 – R_B = 5 × 5 + (5 × (5 + 1))/2 – 29 = 25 + 15 – 29 = 11
\]
Choisissez une valeur U plus petite, à savoir U = 11.
4. Déterminer la signification :
Comparez la valeur U obtenue à la valeur U critique issue de la table de Mann-Whitney ou calculez la p-valeur. Si U est inférieure à la valeur critique ou si la p-valeur est inférieure à α (par exemple, 0,05), nous rejetons l'hypothèse nulle et concluons à une différence significative entre les deux groupes.
Avantages et limites du test de Mann-Whitney
Avantages:
1. Non paramétrique : ne nécessite pas l'hypothèse d'une distribution normale.
2. Flexibilité : Peut être utilisé lorsque les données sont sur une échelle ordinale ou comportent des valeurs aberrantes.
3. Simple et efficace : facile à calculer et à interpréter.
Inconvénients :
1. Perte d'efficacité : Dans une distribution normale, le test t est plus efficace.
2. Hypothèse d'une même forme de distribution : Ce test suppose que les deux groupes ont la même forme de distribution.
3. Limite sur les petits échantillons : la distribution asymptotique peut être moins précise sur de très petits échantillons.
conclusion
Le test de Mann-Whitney est un outil non paramétrique puissant et flexible permettant d'identifier les différences entre deux groupes non appariés. La compréhension de ses principes fondamentaux et de sa mise en œuvre permet d'utiliser ce test dans de nombreuses applications et divers domaines de recherche. Malgré certaines limitations, ses avantages dans certaines situations en font une méthode statistique très précieuse.