Тэст статыстычнай значнасці

Тэст на статыстычную значнасць

У колькасных даследаваннях адно з найбольш распаўсюджаных пытанняў: ці сапраўды назіраныя адрозненні або ўзаемасувязі ў дадзеных «рэальныя», ці яны проста супадзенне, выкліканае выпадковымі зменамі? Каб адказаць на гэтае пытанне, даследчыкі выкарыстоўваюць тэсты статыстычнай значнасці. Гэтыя тэсты дапамагаюць вызначыць, ці дастаткова моцныя вынікі, атрыманыя з выбаркі, каб іх можна было абагульніць на генеральную сукупнасць, зыходзячы з пэўнай сістэмы верагоднасці. Хоць тэрміналогія можа здацца тэхнічнай, асноўная канцэпцыя простая: мы параўноўваем тое, што назіраем, з тым, што адбылося б, калі б эфекту не было.

Вызначэнне і мэта

Тэст статыстычнай значнасці — гэта фармальная працэдура, якая выкарыстоўваецца для ацэнкі доказаў з дадзеных на карысць сцвярджэння (гіпотэзы) аб папуляцыі. Яго асноўная мэта — вызначыць, ці з'яўляецца эфект — напрыклад, розніца паміж сярэднімі значэннямі дзвюх груп, карэляцыя паміж двума зменнымі або эфект лячэння — дастаткова вялікім і паслядоўным, каб яго выпадковае ўзнікненне было малаверагодным.

На практыцы тэсты значнасці не «даказваюць» праўдзівасць тэорыі, а хутчэй даюць вымярэнне таго, наколькі моцна дадзеныя абвяргаюць пэўнае меркаванне. Тут важна разумець, што статыстыка працуе ў сферы нявызначанасці. Няма абсалютнай упэўненасці, а хутчэй ёсць ступень упэўненасці, якая падмацоўваецца дадзенымі.

Нулявая гіпотэза і альтэрнатыўная гіпотэза

Тэсты значнасці звычайна грунтуюцца на двух сцвярджэннях:

1. Нулявая гіпотэза (H₀): сцвярджае, што няма адрозненняў, сувязі або ўплыву. Напрыклад: «Сярэдні бал у класе А такі ж, як у класе B», або «Няма сувязі паміж колькасцю гадзін вучобы і вынікамі экзаменаў».
2. Альтэрнатыўная гіпотэза (H1 або H2): сцвярджае, што існуе розніца, сувязь або ўплыў. Напрыклад: «Сярэдні бал па класе А адрозніваецца ад класа B» або «Існуе сувязь паміж колькасцю гадзін вучобы і вынікамі экзаменаў».

Тэсты значнасці працуюць з першапачатковым меркаваннем, што H₀ праўдзівы. Затым дадзеныя аналізуюцца, каб высветліць, ці з'яўляюцца вынікі надзвычай рэдкімі, калі H₀ праўдзівы. Калі яны рэдкія, мы схільныя адхіляць H₀.

Значэнне p (p-значэнне) і яго значэнне

Цэнтральным паняццем у праверцы значнасці з'яўляецца p-значэнне. Проста кажучы, p-значэнне — гэта верагоднасць атрымання выніку, прынамсі такога ж экстрэмальнага, як назіраны ў дадзеных, пры ўмове, што нулявая гіпотэза праўдзівая.

– Калі p малое, гэта азначае, што назіраныя вынікі рэдка сустракаюцца, калі H₀ праўдзівае, таму ў нас ёсць падставы адхіліць H₀.
– Калі p вялікае, гэта азначае, што назіраныя вынікі ўсё яшчэ праўдападобныя, калі H₀ праўдзівы, таму ў нас няма дастаткова доказаў, каб адхіліць H₀.

Аднак p-значэнне часта разумеюць няправільна. P-значэнне не з'яўляецца верагоднасцю таго, што H₀ з'яўляецца праўдай ці ілжывасцю. Гэта таксама не мера велічыні эфекту. P-значэнне проста паказвае сілу доказаў супраць H₀ у пэўных рамках.

Узровень значнасці (α)

Каб прыняць рашэнне, даследчыкі ўстанаўліваюць узровень значнасці, які пазначаецца α (альфа). Звычайна выкарыстоўваюцца значэнні 0,05 (5%) або 0,01 (1%). Правіла такое:

– Калі p ≤ α, вынікі называюцца статыстычна значнымі, і H₀ адхіляецца.
– Калі p > α, вынік неістотны, і H₀ не адхіляецца.

Выбар α — гэта не толькі тэхнічнае рашэнне, але і ўлік кантэксту. Напрыклад, у медыцынскіх даследаваннях, звязаных з бяспекай пацыентаў, даследчыкі могуць выбраць больш строгі α (0,01), каб паменшыць рызыку памылковых высноў.

Памылкі I і II тыпу

Паколькі статыстычныя тэсты ўключаюць прыняцце рашэнняў ва ўмовах нявызначанасці, заўсёды існуе патэнцыял для памылкі:

1. Памылка I тыпу (ілжывастаноўчы вынік): адхіленне H₀, калі H₀ праўдзівае. Верагоднасць кантралюецца α.
2. Памылка II тыпу (ілжываадмоўная): не адхіляецца H₀, калі H₁ праўдзівае. Верагоднасць пазначаецца β (бэта); адваротная велічыня называецца ступенню, якая роўная 1 − β.

У рэальных умовах абодва тыпы памылак могуць мець значныя наступствы. Напрыклад, меркаванне, што прэпарат эфектыўны, калі ён не эфектыўны (тып I), можа быць шкодным, а меркаванне, што прэпарат неэфектыўны, калі ён насамрэч эфектыўны (тып II), можа прывесці да страчаных тэрапеўтычных магчымасцей.

Распаўсюджаныя тыпы тэстаў значнасці

Існуе мноства тэстаў значнасці, і выбар залежыць ад мэты, тыпу дадзеных і здагадак, якія выконваюцца. Некаторыя з найбольш часта выкарыстоўваных:

– Т-крытэрый: параўноўвае сярэднія значэнні дзвюх груп (напрыклад, эксперыментальнай і кантрольнай). Існуюць незалежныя і парныя версіі t-крытэрыя.
– ANOVA: параўноўвае сярэдняе значэнне больш чым дзвюх груп (напрыклад, трох метадаў навучання).
– Тэст хі-квадрат: правярае сувязь паміж катэгарыяльнымі зменнымі (напрыклад, пол і выбар спецыяльнасці).
– Карэляцыя Пірсана/Спірмана: правярае сувязь паміж двума лікавымі зменнымі (Пірсан для нармальных дадзеных, Спірман для парадкавых/ненармальных дадзеных).
– Лінейная/лагістычная рэгрэсія: правярае ўплыў адной або некалькіх прагнастычных зменных на зменную выніку.

Кожны тэст мае такія дапушчэнні, як нармальнасць, аднастайнасць дысперсіі або незалежнасць дадзеных. Парушэнне гэтых дапушчэнняў можа прывесці да памылковых вынікаў тэсту, таму дыягностыка дадзеных і папярэднія тэсты маюць важнае значэнне.

Статыстычная значнасць супраць практычнай значнасці

Адна з крытычных заўваг да тэставання значнасці заключаецца ў тым, што даследчыкі занадта засяроджваюцца на тым, ці з'яўляецца яно «значным» ці «нязначным», не ўлічваючы яго практычныя наступствы. Пры вельмі вялікіх выбарках невялікія адрозненні могуць быць статыстычна значнымі, нават калі іх уплыў ледзь прыкметны. І наадварот, пры малых выбарках эфекты, якія насамрэч даволі важныя, могуць не дасягнуць значнасці з-за недастатковай магутнасці.

Такім чынам, тэсты значнасці заўсёды павінны суправаджацца:
– Велічыні эфектаў, такія як d Коэна, эта-квадрат або стаўленне шанцаў.
– Даверны інтэрвал, каб паказаць дыяпазон прымальных значэнняў параметраў.

Спалучэнне p-значэння, памеру эфекту і давернага інтэрвалу дае больш поўную карціну: не толькі «ёсць эфект ці не», але і «наколькі вялікі эфект і наколькі мы можам быць упэўненымі ў гэтай ацэнцы».

Агульныя крокі для правядзення тэсту значнасці

Увогуле, працэдура такая:
1. Сфармулюйце H₀ і H₁ у адпаведнасці з пытаннямі даследавання.
2. Вызначце α (напрыклад, 0,05).
3. Выберыце правільны тэст у адпаведнасці з тыпам дадзеных і дызайнам даследавання.
4. Праверце тэставыя дапушчэнні (нармальнасць, дысперсія, незалежнасць і г.д.).
5. Разлічыце статыстыку тэсту і атрымайце p-значэнне.
6. Параўнайце p-значэнне з α і зрабіце высновы.
7. Паведамляйце вынікі цалкам, уключаючы памеры эфектаў і даверныя інтэрвалы, дзе гэта магчыма.

Добрая справаздачнасць таксама ўключае кантэкст, напрыклад, характарыстыкі выбаркі, метады вымярэння і патэнцыйную прадузятасць.

Закрыццё

Тэсты на статыстычную значнасць з'яўляюцца важнымі інструментамі для ацэнкі таго, ці адлюстроўваюць атрыманыя дадзеныя ўмовы папуляцыі, ці з'яўляюцца проста вынікам выпадковых варыяцый. Аднак гэтыя тэсты не з'яўляюцца адзіным арбітрам навуковай ісціны. p-значэнне неабходна разумець дакладна ў спалучэнні з памерам эфекту, даверным інтэрвалам і кантэкстуальнай ацэнкай актуальнасці вынікаў.

Пры правільным выкарыстанні тэсты значнасці дапамагаюць зрабіць даследаванні больш аб'ектыўнымі і падсправаздачнымі. І наадварот, калі іх выкарыстоўваць механічна без разумення іх здагадак і абмежаванняў, яны могуць прывесці да памылковых высноў. Такім чынам, канцэптуальнае разуменне, прадуманая інтэрпрэтацыя і празрыстая справаздачнасць з'яўляюцца ключом да выкарыстання тэстаў значнасці для падтрымкі рашэнняў, заснаваных на дадзеных.

Правільны каментар