Тэст Манна-Уітні ў статыстыцы
Статыстыка — гэта раздзел матэматыкі, які займаецца зборам, аналізам, інтэрпрэтацыяй і прадстаўленнем дадзеных. Статыстыка выкарыстоўваецца ў розных галінах для прыняцця рашэнняў на аснове дадзеных. Адным з часта выкарыстоўваных метадаў у статыстыцы з'яўляецца тэст Манна-Уітні (таксама вядомы як U-тэст Манна-Уітні або рангавы тэст Уілксана). Гэта непараметрычны метад, які выкарыстоўваецца для вызначэння таго, ці ёсць значная розніца паміж двума няпарнымі групамі.
Уводзіны ў тэст Манна-Уітні
Тэст Манна-Уітні быў прапанаваны Генры Манам і Дональдам Уітні ў 1947 годзе як непараметрычная альтэрнатыва t-крытэрыю. Гэты метад не патрабуе дапушчэння нармальнасці. Таму ён асабліва карысны, калі дадзеныя не адпавядаюць нармальнаму размеркаванню або калі памер выбаркі занадта малы для праверкі дапушчэння нармальнасці.
Асноўныя прынцыпы тэсту Манна-Уітні
Для параўнання медыяны дзвюх груп выкарыстоўваецца тэст Манна-Уітні. Асноўны прынцып наступны:
1. Ранжыраванне назіранняў: Усе дадзеныя з абедзвюх груп аб'ядноўваюцца і ранжыруюцца ад найменшага да найбольшага. Калі значэнні аднолькавыя, кожнае назіранне ранжыруецца па сярэднім значэнні яго належнага рангу.
2. Разлік статыстычнага тэсту: Значэнне статыстычнага тэсту (U) разлічваецца на аснове сумы рангаў для кожнай групы. Існуе два спосабы разліку: адзін пачынаецца з першай групы, а другі — з другой групы.
– Агульная формула для U:
\[
U_1 = n_1 × n_2 + \frac{n_1 × (n_1 + 1)}{2} – R_1
\]
або
\[
U_2 = n_1 × n_2 + \frac{n_2 × (n_2 + 1)}{2} – R_2
\]
Дзе:
– \(n_1\) і \(n_2\) — колькасць назіранняў у кожнай групе,
– \(R_1\) і \(R_2\) — колькасць рангаў у кожнай групе.
3. Тэст на значнасць: Тэст на значнасць праводзіцца для вызначэння p-значэння. Ва ўмовах вялікага памеру выбаркі U-размеркаванне можна апраксімаваць нармальным размеркаваннем.
Дапушчэнні ў тэсце Манна-Уітні
Нягледзячы на тое, што тэст Манна-Уітні з'яўляецца непараметрычным тэстам і не патрабуе дапушчэння нармальнага размеркавання, для слушнасці вынікаў неабходна выканаць некалькі звязаных з гэтым дапушчэнняў:
1. Незалежнасць: Кожнае назіранне ў абедзвюх групах павінна быць незалежным адно ад аднаго.
2. Парадкавая або інтэрвальная шкала: Дадзеныя павінны быць на парадкавай або інтэрвальнай шкале. Гэта азначае, што даныя можна сартаваць, і яны ўтрымліваюць інфармацыю аб ранжыраванні.
3. Дыяпазон размеркавання: Размеркаванне абедзвюх груп павінна мець аднолькавую форму (хаця медыяна можа адрознівацца).
Этапы правядзення тэсту Манна-Уітні
Ніжэй прыведзены звычайныя крокі для правядзення тэсту Манна-Уітні:
1. Аб'яднанне і сартаванне дадзеных: аб'яднайце дадзеныя з абедзвюх груп і адсартуйце іх у цэлым. Рэйтынгі прысвойваюцца ў адпаведнасці з парадкам з карэкціроўкай рангу, прывязанай да сярэдняга значэння.
2. Разлічыце колькасць рангаў: Разлічыце колькасць рангаў для кожнай групы.
3. Вызначэнне каэфіцыента прапускання паветра (U-value) па статыстыцы: выкарыстоўвайце формулу, растлумачаную раней, для разліку U-value для абедзвюх груп.
4. Вызначэнне крытычнага значэння або p-значэння: параўнайце атрыманае U-значэнне з крытычным значэннем з табліцы U-размеркавання (або разлічыце p-значэнне), каб вызначыць, ці з'яўляецца розніца паміж групамі статыстычна значнай.
Напрыклад, дапусцім, што ў нас ёсць два наборы дадзеных А і В. Гэтыя дадзеныя могуць прадстаўляць два розныя метады лячэння пэўнага захворвання, і мы хочам ведаць, ці з'яўляецца адзін з іх больш эфектыўным, чым іншы.
Практыка Контох
Дапусцім, у нас ёсць дзве тэрапеўтычныя групы:
– Тэрапія А: [85, 90, 88, 75, 91]
– Тэрапія B: [80, 78, 95, 87, 92]
1. Аб'яднанне і сартаванне дадзеных:
– Кампазітны: [85, 90, 88, 75, 91, 80, 78, 95, 87, 92]
– Парадак і рэйтынг: [75(1), 78(2), 80(3), 85(4), 87(5), 88(6), 90(7), 91(8), 92(9), 95(10)]
2. Разлік колькасці рангаў:
– Колькасць адзнак тэрапіі А: 4 + 7 + 6 + 1 + 8 = 26
– Колькасць адзнак тэрапіі B: 3 + 2 + 10 + 5 + 9 = 29
3. Разлік значэння U:
\[
U_A = n_1 × n_2 + \frac{n_1 \times (n_1 + 1)}{2} – R_A = 5 \times 5 + \frac{5 \times (5 + 1)}{2} – 26 = 25 + 15 – 26 = 14
\]
\[
U_B = n_1 × n_2 + \frac{n_2 \times (n_2 + 1)}{2} – R_B = 5 \times 5 + \frac{5 \times (5 + 1)}{2} – 29 = 25 + 15 – 29 = 11
\]
Выберыце меншае значэнне U, а менавіта U = 11.
4. Вызначэнне значнасці:
Параўнайце атрыманае значэнне U з крытычным значэннем U з табліцы размеркавання Манна-Уітні або вылічыце p-значэнне. Калі U меншае за крытычнае значэнне або p-значэнне ніжэйшае за альфа (напрыклад, 0,05), мы адхіляем нулявую гіпотэзу і робім выснову, што паміж дзвюма групамі існуе значная розніца.
Перавагі і абмежаванні тэсту Манна-Уітні
Перавага:
1. Непараметрычнае: не патрабуе дапушчэння нармальнага размеркавання.
2. Гнуткасць: можа выкарыстоўвацца, калі дадзеныя знаходзяцца ў парадкавым маштабе або маюць выкіды.
3. Просты і эфектыўны: лёгка разлічыць і інтэрпрэтаваць.
Кетэрбатасан:
1. Страта эфектыўнасці: Пры нармальным размеркаванні t-крытэрый больш эфектыўны.
2. Дапушчэнне аднолькавай формы размеркавання: Гэты тэст мяркуе аднолькавую форму размеркавання паміж дзвюма групамі.
3. Абмежавана на малых памерах выбаркі: Асімптатычнае размеркаванне можа быць менш дакладным на вельмі малых выбарках.
Выснова
Тэст Манна-Уітні — гэта магутны і гнуткі непараметрычны інструмент для выяўлення адрозненняў паміж двума няпарнымі групамі. Разумеючы яго асноўныя прынцыпы і этапы рэалізацыі, мы можам выкарыстоўваць гэты тэст у розных сферах даследаванняў. Нягледзячы на некаторыя абмежаванні, яго перавагі пры пэўных абставінах робяць яго вельмі каштоўным метадам у статыстыцы.