Testul Mann-Whitney în statistică
Statistica este o ramură a matematicii care se ocupă cu colectarea, analiza, interpretarea și prezentarea datelor. Statistica este utilizată în diverse domenii pentru a lua decizii bazate pe date. O tehnică frecvent utilizată în statistică este testul Mann-Whitney (cunoscut și sub numele de testul Mann-Whitney U sau testul Wilcoxon de sumă a rangurilor). Aceasta este o metodă neparametrică utilizată pentru a determina dacă există o diferență semnificativă între două grupuri nepereche.
Introducere în testul Mann-Whitney
Testul Mann-Whitney a fost introdus de Henry Mann și Donald Whitney în 1947 ca o alternativă neparametrică la testul t. Această metodă nu necesită presupunerea normalității. Prin urmare, este deosebit de utilă atunci când datele nu urmează o distribuție normală sau când dimensiunea eșantionului este prea mică pentru a valida presupunerea normalității.
Principiile de bază ale testului Mann-Whitney
Testul Mann-Whitney este utilizat pentru a compara medianele a două grupuri. Principiul de bază este:
1. Observație privind clasamentul: Toate datele din ambele grupuri sunt combinate și clasate de la cea mai mică la cea mai mare. Dacă există valori identice, fiecare observație este clasată după media clasamentului corespunzător.
2. Calculul testului statistic: Valoarea testului statistic (U) se calculează pe baza sumei clasamentelor pentru fiecare grup. Există două modalități de calcul: una care începe cu primul grup și cealaltă cu al doilea grup.
Formula generală pentru U este:
\[
U₂ = n₁ × n₂ + \frac{n₂ × (n₂ + 1)}{1} – R₂
\]
sau
\[
U₂ = n₁ × n₂ + \frac{n₂ × (n₂ + 1)}{2} – R₂
\]
Unde:
– \(n_1\) și \(n_2\) sunt numărul de observații din fiecare grup,
– \(R_1\) și \(R_2\) reprezintă numărul de ranguri din fiecare grup.
3. Testul de semnificație: Testul de semnificație este efectuat pentru a determina valoarea p. În condiții de eșantion mare, distribuția U poate fi aproximată printr-o distribuție normală.
Ipoteze în testul Mann-Whitney
Deși testul Mann-Whitney este un test neparametric și nu necesită ipoteza unei distribuții normale, există câteva ipoteze conexe care trebuie îndeplinite pentru validitatea rezultatelor:
1. Independență: Fiecare observație din ambele grupuri trebuie să fie independentă una de cealaltă.
2. Scală ordinală sau de interval: Datele trebuie să fie pe o scală ordinală sau de interval. Aceasta înseamnă că datele pot fi sortate și conțin informații de clasificare.
3. Interval de distribuție: Distribuția ambelor grupuri trebuie să aibă aceeași formă (deși mediana poate fi diferită).
Pașii în efectuarea testului Mann-Whitney
Următorii sunt pașii care se parcurg de obicei pentru efectuarea testului Mann-Whitney:
1. Combinarea și sortarea datelor: Combinați datele din ambele grupuri și sortați-le în general. Clasamentele sunt atribuite în funcție de ordine, cu ajustări pentru rang legat de valoarea medie.
2. Calculați numărul de clasamente: Calculați numărul de clasamente pentru fiecare grupă.
3. Determinarea valorii U a statisticilor: Folosiți formula explicată anterior pentru a calcula valoarea U pentru ambele grupuri.
4. Determinarea valorii critice sau a valorii p: Comparați valoarea U obținută cu valoarea critică din tabelul de distribuție U (sau calculați valoarea p) pentru a determina dacă diferența dintre grupuri este semnificativă statistic.
De exemplu, să presupunem că avem două seturi de date A și B. Aceste date pot reprezenta două terapii diferite pentru o anumită boală și dorim să știm dacă o terapie este mai eficientă decât cealaltă.
Exemplu practic
Să presupunem că avem două grupuri de terapie:
– Terapia A: [85, 90, 88, 75, 91]
– Terapia B: [80, 78, 95, 87, 92]
1. Îmbinarea și sortarea datelor:
– Compus: [85, 90, 88, 75, 91, 80, 78, 95, 87, 92]
– Ordine și clasament: [75(1), 78(2), 80(3), 85(4), 87(5), 88(6), 90(7), 91(8), 92(9), 95(10)]
2. Calcularea numărului de ranguri:
– Numărul de evaluări ale terapiei A: 4 + 7 + 6 + 1 + 8 = 26
– Numărul de evaluări ale terapiei B: 3 + 2 + 10 + 5 + 9 = 29
3. Calcularea valorii U:
\[
U_A = n_1 × n_2 + \frac{n_1 × (n_1 + 1)}{2} – R_A = 5 × 5 + \frac{5 × (5 + 1)}{2} – 26 = 25 + 15 – 26 = 14
\]
\[
U_B = n_1 × n_2 + \frac{n_2 \times (n_2 + 1)}{2} – R_B = 5 \times 5 + \frac{5 \times (5 + 1)}{2} – 29 = 25 + 15 – 29 = 11
\]
Alegeți o valoare U mai mică, și anume U = 11.
4. Determinarea semnificației:
Comparați valoarea U obținută cu valoarea U critică din tabelul de distribuție Mann-Whitney sau calculați valoarea p. Dacă U este mai mic decât valoarea critică sau valoarea p este mai mică decât alfa (de exemplu, 0,05), respingem ipoteza nulă și concluzionăm că există o diferență semnificativă între cele două grupuri.
Avantajele și limitele testului Mann-Whitney
Avantaje:
1. Neparametric: Nu necesită ipoteza unei distribuții normale.
2. Flexibilitate: Poate fi utilizată atunci când datele sunt la o scară ordinară sau au valori aberante.
3. Simplu și eficient: Ușor de calculat și interpretat.
Keterbatasan:
1. Pierderea eficienței: Într-o distribuție normală, testul t este mai eficient.
2. Presupunerea aceleiași forme de distribuție: Acest test presupune aceeași formă de distribuție între cele două grupuri.
3. Limită pe eșantioane mici: Distribuția asimptotică poate fi mai puțin precisă pe eșantioane foarte mici.
Concluzie
Testul Mann-Whitney este un instrument nonparametric puternic și flexibil pentru identificarea diferențelor dintre două grupuri nepereche. Prin înțelegerea principiilor sale de bază și a pașilor de implementare, putem utiliza acest test într-o varietate de aplicații în diverse domenii de cercetare. Deși are unele limitări, avantajele sale în anumite circumstanțe îl fac o metodă foarte valoroasă în statistică.