Test de Kruskal-Wallis en statistique

Test de Kruskal-Wallis en statistique

Le test de Kruskal-Wallis est une méthode statistique non paramétrique utilisée pour comparer les différences entre trois groupes ou plus. Dans de nombreuses études, les chercheurs cherchent à déterminer si plusieurs groupes présentent des valeurs significativement différentes pour une variable donnée. Si les données respectent les hypothèses de normalité et d'homogénéité des variances, l'analyse de la variance à un facteur (ANOVA) est généralement privilégiée. Cependant, lorsque ces hypothèses ne sont pas vérifiées — par exemple, si les données ne suivent pas une distribution normale, s'il existe des valeurs aberrantes extrêmes ou si l'échelle de mesure est ordinale —, le test de Kruskal-Wallis constitue une alternative puissante et largement utilisée.

Définition et concepts de base

Le test de Kruskal-Wallis (souvent noté test H de Kruskal-Wallis) est une extension du test U de Mann-Whitney, applicable à plus de deux groupes. Son principe de base est de comparer les rangs des données, et non leurs valeurs absolues. Étant donné qu'il repose sur les rangs, ce test ne nécessite pas une distribution normale et est relativement insensible aux valeurs aberrantes.

Intuitivement, si plusieurs groupes présentent la même distribution, les rangs des données entre les groupes seront mélangés aléatoirement. Inversement, si certains groupes tendent à avoir des valeurs plus élevées ou plus faibles, les rangs se regrouperont et produiront une statistique de test plus élevée.

Quand utilise-t-on le test de Kruskal-Wallis ?

Le test de Kruskal-Wallis est utilisé lorsque :

1. Le nombre de groupes est ≥ 3, et le chercheur souhaite comparer les différences de position centrale (généralement la médiane) entre les groupes.
2. Les données ne satisfont pas aux hypothèses de l'ANOVA, notamment à la normalité des résidus.
3. Échelles de données ordinales (par exemple, scores de satisfaction : très insatisfait à très satisfait) ou données d'intervalle/de rapport non normales.
4. Échantillons indépendants, ce qui signifie que les membres d'un groupe ne sont pas appariés ou liés à d'autres groupes.

Prenons un exemple : un chercheur souhaite comparer les niveaux de satisfaction des patients concernant les services offerts dans trois hôpitaux différents à l’aide d’une échelle de Likert de 1 à 5. Étant donné que les données sont ordinales, le test de Kruskal-Wallis est un choix approprié.

Hypothèses du test de Kruskal-Wallis

Bien que non paramétrique, le test de Kruskal-Wallis repose néanmoins sur plusieurs hypothèses importantes :

1. Indépendance de l'observation : les données de chaque groupe doivent provenir d'individus différents.
2. La variable de réponse doit être au moins ordinale : les données doivent être triables.
3. Les distributions entre les groupes doivent présenter des profils similaires : si elles sont très différentes, l’interprétation des différences peut s’avérer plus complexe. Ce test est souvent interprété comme une différence de médianes, mais cette interprétation est plus appropriée si les distributions sont similaires.

Hypothèse dans le test de Kruskal-Wallis

Dans le test de Kruskal-Wallis, l'hypothèse testée est :

– H0 (hypothèse nulle) : la distribution (ou médiane) de tous les groupes est la même.
– H1 (hypothèse alternative) : il existe au moins un groupe dont la distribution (ou la médiane) est différente.

Il convient de noter que lorsque l'hypothèse nulle (H0) est rejetée, le test de Kruskal-Wallis conclut simplement à l'existence d'une différence, sans préciser quels groupes sont concernés. Des analyses complémentaires (post-hoc) sont donc nécessaires.

Étapes du calcul

En résumé, les étapes du test de Kruskal-Wallis sont les suivantes :

1. Combinez toutes les données de tous les groupes.
2. Classez les valeurs de la plus petite à la plus grande. En cas d'égalité, utilisez le rang moyen.
3. Additionnez les classements de chaque groupe.
4. Calculez la statistique de test H.

La formule statistique générale de H est :

\[
H = \frac{12}{N(N+1)} \sum_{i=1}^{k} \frac{R_i^2}{n_i} – 3(N+1)
\]

Description:
– \(N\) = total de toutes les observations
– \(k\) = nombre de groupes
– \(n_i\) = nombre d'observations dans le i-ème groupe
– \(R_i\) = nombre de rangs dans le i-ème groupe

La valeur de H est ensuite comparée à la distribution du χ² à k-1 degrés de liberté. Si la p-valeur est inférieure au seuil de signification (par exemple, 0,05), alors H0 est rejetée.

Exemple illustratif

Supposons qu'un enseignant souhaite déterminer s'il existe une différence dans les résultats à un test statistique selon trois méthodes d'apprentissage : A, B et C. Après la collecte des données, il s'avère que les résultats ne suivent pas une distribution normale en raison de la présence de plusieurs valeurs extrêmes. L'enseignant utilise alors le test de Kruskal-Wallis.

Si les résultats du test indiquent une valeur p de 0,01 (inférieure à 0,05), on conclut à une différence significative entre au moins deux méthodes d'apprentissage. Cependant, l'enseignant ignore encore si la méthode A est supérieure à la méthode B ou à la méthode C. C'est là qu'une analyse post-hoc s'avère nécessaire.

Test post-hoc après Kruskal-Wallis

Si le test de Kruskal-Wallis est significatif, l'étape suivante consiste à effectuer des comparaisons par paires. Voici quelques méthodes courantes :

1. Test de Dunn : le plus souvent utilisé pour le test post-hoc de Kruskal-Wallis.
2. Test de Mann-Whitney par paires avec correction (Bonferroni, Holm ou Benjamini-Hochberg) pour contrôler les erreurs dues aux tests répétés.

L'objectif de cette correction est d'éviter une augmentation du risque d'erreur de type I (affirmer une différence alors qu'il n'y en a pas) due à la multiplication des comparaisons.

Taille de l'effet

Outre la signification statistique, de nombreuses études modernes mettent l'accent sur la taille de l'effet pour aider les lecteurs à comprendre l'ampleur de la différence. Voici quelques exemples de tailles d'effet souvent associées au modèle de Kruskal-Wallis :

– Eta-carré basé sur H (η²) :
\[
\eta^2 = \frac{H – k + 1}{N – k}
\]
– Epsilon au carré (ε²) comme alternative plus conservatrice.

La taille de l'effet permet d'interpréter si la différence est faible, moyenne ou importante, et pas seulement « significative ou non ».

Avantages et limites

Excès
1. Ne nécessite pas l'hypothèse de normalité.
2. Convient aux données ordinales.
3. Plus robuste face aux valeurs aberrantes que les méthodes paramétriques.

Limites
1. Ne montre pas quels groupes sont différents sans analyse post-hoc.
2. L'interprétation de la différence des médianes est la plus valable si la forme de distribution des groupes est similaire.
3. Si les données réelles sont normales et homogènes, l'ANOVA peut être plus puissante (puissance plus élevée).

Clôture

Le test de Kruskal-Wallis est un outil important en statistique inférentielle, notamment lorsque les chercheurs travaillent avec des données ne répondant pas aux hypothèses des méthodes paramétriques. Grâce à son approche basée sur les rangs, ce test permet des comparaisons plus souples de trois groupes ou plus, en particulier pour les données ordinales ou non normales. Cependant, son utilisation requiert une bonne compréhension des hypothèses, une interprétation des résultats et la nécessité d'analyses post-hoc pour identifier les paires de groupes réellement différentes. En combinant les valeurs p, les tailles d'effet et des analyses complémentaires appropriées, le test de Kruskal-Wallis peut fournir des conclusions robustes et pertinentes dans divers domaines de recherche, de la santé et l'éducation au commerce et aux sciences sociales.

Laissez un commentaire