Վիճակագրական նշանակալիության թեստ
Քանակական հետազոտություններում ամենատարածված հարցերից մեկն այն է, թե արդյոք տվյալներում դիտարկվող տարբերությունները կամ հարաբերությունները իսկապես «իրական» են, թե՞ դրանք պարզապես պատահական տատանումների պատճառով առաջացած զուգադիպություն են։ Այս հարցին պատասխանելու համար հետազոտողները օգտագործում են վիճակագրական նշանակալիության թեստեր։ Այս թեստերը օգնում են որոշել, թե արդյոք նմուշից ստացված արդյունքները բավականաչափ ուժեղ են՝ որոշակի հավանականության շրջանակի հիման վրա ընդհանրացնելու համար բնակչության վրա։ Թեև տերմինաբանությունը կարող է տեխնիկական հնչել, հիմնական հասկացությունը պարզ է. մենք համեմատում ենք դիտարկածը նրա հետ, ինչ կլիներ, եթե ազդեցություն չլիներ։
Սահմանում և նպատակ
Վիճակագրական նշանակալիության թեստը պաշտոնական ընթացակարգ է, որն օգտագործվում է տվյալներից ստացված ապացույցները գնահատելու համար բնակչության վերաբերյալ որևէ պնդման (վարկածի) համար: Դրա հիմնական նպատակն է որոշել, թե արդյոք որևէ ազդեցություն, օրինակ՝ երկու խմբային միջինների միջև տարբերությունը, երկու փոփոխականների միջև փոխհարաբերությունը կամ բուժման ազդեցությունը, բավականաչափ մեծ և հաստատուն է, որպեսզի պատահականորեն առաջանալու հավանականությունը ցածր լինի:
Գործնականում նշանակալիության թեստերը չեն «ապացուցում», որ որևէ տեսություն ճշմարիտ է, այլ չափում են, թե որքանով են տվյալները մերժում որոշակի ենթադրություն։ Ահա թե որտեղ է կարևոր հասկանալ, որ վիճակագրությունը գործում է անորոշության ոլորտում։ Չկա բացարձակ որոշակիություն, այլ կա տվյալների կողմից հաստատված վստահության որոշակի աստիճան։
Զրոյական վարկած և այլընտրանքային վարկած
Նշանակալիության թեստերը սովորաբար կառուցվում են երկու պնդումների վրա՝
1. Զրոյական վարկած (H₀). պնդում է, որ տարբերություն, կապ կամ ազդեցություն չկա։ Օրինակ՝ «A դասարանի միջին գնահատականը նույնն է, ինչ B դասարանի», կամ «Ուսումնական ժամերի և քննությունների միավորների միջև կապ չկա»։
2. Այլընտրանքային վարկած (H₁ կամ Hₐ): նշում է, որ կա տարբերություն, կապ կամ ազդեցություն: Օրինակ՝ «A դասարանի միջին գնահատականը տարբերվում է B դասարանի գնահատականից» կամ «Կա կապ ուսումնական ժամերի և քննությունների միավորների միջև»:
Նշանակալիության թեստերը գործում են սկզբնական ենթադրության հիման վրա, որ H₀-ն ճշմարիտ է: Այնուհետև տվյալները վերլուծվում են՝ պարզելու համար, թե արդյոք արդյունքները չափազանց հազվադեպ են, եթե H₀-ն ճշմարիտ է: Եթե դրանք հազվադեպ են, մենք հակված ենք մերժել H₀-ն:
p արժեքը (p-արժեք) և դրա նշանակությունը
Նշանակալիության թեստավորման կենտրոնական հասկացությունը p-արժեքն է: Պարզ ասած, p-արժեքը տվյալներում դիտարկվածի պես ծայրահեղ արդյունք ստանալու հավանականությունն է, եթե ենթադրենք, որ զրոյական վարկածը ճիշտ է:
– Եթե p-ն փոքր է, դա նշանակում է, որ դիտարկվող արդյունքները հազվադեպ են տեղի ունենում, երբ H₀-ն ճշմարիտ է, ուստի մենք հիմք ունենք մերժելու H₀-ն։
– Եթե p-ն մեծ է, դա նշանակում է, որ դիտարկվող արդյունքները դեռևս հավանական են, որ տեղի կունենան, եթե H₀-ն ճիշտ է, ուստի մենք բավարար ապացույցներ չունենք H₀-ն մերժելու համար։
Սակայն, p-արժեքը հաճախ սխալ է հասկացվում։ p-արժեքը H₀-ի ճիշտ կամ սխալ լինելու հավանականությունը չէ։ Այն նաև ազդեցության մեծության չափանիշ չէ։ p-արժեքը պարզապես ցույց է տալիս H₀-ի դեմ ապացույցների ուժը որոշակի շրջանակներում։
Նշանակալիության մակարդակ (α)
Որոշում կայացնելու համար հետազոտողները սահմանում են նշանակալիության մակարդակ, որը նշանակվում է α (ալֆա)-ով: Հաճախ օգտագործվող արժեքներն են՝ 0,05 (5%) կամ 0,01 (1%): Կանոնը հետևյալն է.
– Եթե p ≤ α, արդյունքները համարվում են վիճակագրորեն նշանակալի, իսկ H₀-ն մերժվում է։
– Եթե p > α, արդյունքը նշանակալի չէ, և H₀-ն չի մերժվում։
α-ի ընտրությունը զուտ տեխնիկական որոշում չէ, այլ հաշվի է առնում նաև համատեքստը: Օրինակ՝ հիվանդների անվտանգությանը վերաբերող բժշկական հետազոտություններում հետազոտողները կարող են ընտրել ավելի խիստ α (0,01)՝ կեղծ եզրակացությունների ռիսկը նվազեցնելու համար:
I և II տիպի սխալներ
Քանի որ վիճակագրական թեստերը ներառում են որոշումների կայացում անորոշության պայմաններում, միշտ կա սխալի հավանականություն.
1. I տիպի սխալ (կեղծ դրական). H₀-ի մերժում, երբ H₀-ն ճիշտ է։ Հավանականությունը վերահսկվում է α-ով։
2. II տիպի սխալ (կեղծ բացասական). H₀-ն մերժելու անկարողություն, երբ H₁-ն ճիշտ է։ Հավանականությունը նշանակվում է β-ով (բետա). հակադարձը կոչվում է աստիճան, որը հավասար է 1 − β-ի։
Իրական աշխարհում երկու տեսակի սխալներն էլ կարող են զգալի հետևանքներ ունենալ: Օրինակ՝ ենթադրել, որ դեղամիջոցը արդյունավետ է, մինչդեռ այն այդպիսին չէ (I տիպ), կարող է վնասակար լինել, մինչդեռ ենթադրել, որ դեղամիջոցը անարդյունավետ է, մինչդեռ այն իրականում արդյունավետ է (II տիպ), կարող է հանգեցնել թերապևտիկ հնարավորությունների կորստի:
Նշանակալիության թեստերի տարածված տեսակները
Կան բազմաթիվ նշանակալիության թեստեր, և ընտրությունը կախված է նպատակից, տվյալների տեսակից և բավարարված ենթադրություններից: Առավել հաճախ օգտագործվողներից մի քանիսն են՝
– T-թեստ. համեմատում է երկու խմբերի (օրինակ՝ փորձարարական և վերահսկիչ) միջին արժեքները։ Կան անկախ և զույգային t-թեստի տարբերակներ։
– ANOVA. համեմատում է երկուսից ավելի խմբերի (օրինակ՝ երեք ուսուցման մեթոդների) միջինը։
– Քի քառակուսի թեստ. ստուգում է կատեգորիկ փոփոխականների միջև եղած կապը (օրինակ՝ սեռը և մասնագիտության ընտրությունը):
– Փիրսոնի/Սփիրմանի համադրություն. ստուգում է երկու թվային փոփոխականների միջև կապը (Փիրսոնը՝ նորմալ տվյալների համար, Սփիրմանը՝ կարգային/ոչ նորմալ տվյալների համար):
– Գծային/լոգիստիկ ռեգրեսիա. ստուգում է մեկ կամ մի քանի կանխատեսող փոփոխականների ազդեցությունը արդյունքի փոփոխականի վրա։
Յուրաքանչյուր թեստ ունի ենթադրություններ, ինչպիսիք են նորմալությունը, դիսպերսիայի միատարրությունը կամ տվյալների անկախությունը: Այս ենթադրությունների խախտումը կարող է հանգեցնել թեստի մոլորեցնող արդյունքների, ուստի տվյալների ախտորոշումը և նախնական թեստերը կարևոր են:
Վիճակագրական նշանակությունն ընդդեմ գործնական նշանակության
Նշանակալիության թեստավորման քննադատություններից մեկն այն է, որ հետազոտողները չափազանց շատ են կենտրոնանում դրա «նշանակալի» կամ «աննշան» լինելու վրա՝ առանց հաշվի առնելու դրա գործնական հետևանքները: Շատ մեծ նմուշների դեպքում փոքր տարբերությունները կարող են վիճակագրորեն նշանակալի լինել, նույնիսկ եթե դրանց ազդեցությունը հազիվ նկատելի է: Եվ հակառակը, փոքր նմուշների դեպքում, իրականում բավականին կարևոր էֆեկտները կարող են չհասնել նշանակալիության՝ անբավարար հզորության պատճառով:
Հետևաբար, նշանակալիության թեստերը միշտ պետք է ուղեկցվեն.
– Էֆեկտի չափեր, ինչպիսիք են Քոհենի d-ն, էտա-քառակուսի կամ հավանականությունների հարաբերակցությունը։
– Վստահության միջակայք՝ պարամետրերի ողջամիտ արժեքների միջակայքը ցույց տալու համար։
p-արժեքի, էֆեկտի չափի և վստահության միջակայքի համադրությունը տալիս է ավելի ամբողջական պատկեր. ոչ միայն «կա՞ էֆեկտ, թե՞ ոչ», այլև «որքան մեծ է էֆեկտը և որքանով կարող ենք վստահ լինել այդ գնահատականի վերաբերյալ»։
Նշանակալիության թեստ անցկացնելու ընդհանուր քայլեր
Ընդհանուր առմամբ, ընթացակարգը հետևյալն է.
1. Ձևակերպեք H₀-ն և H₁-ն՝ համաձայն հետազոտական հարցերի։
2. Որոշեք α-ն (օրինակ՝ 0,05):
3. Ընտրեք ճիշտ թեստը՝ տվյալների տեսակին և հետազոտության դիզայնին համապատասխան։
4. Ստուգեք թեստի ենթադրությունները (նորմալություն, դիսպերսիա, անկախություն և այլն):
5. Հաշվարկեք թեստի վիճակագրությունը և ստացեք p-արժեքը։
6. Համեմատեք p-արժեքը α-ի հետ և եզրակացություններ արեք։
7. Արդյունքները ներկայացրեք ամբողջությամբ, հնարավորության դեպքում ներառելով էֆեկտների չափերը և վստահության միջակայքերը։
Լավ հաշվետվությունը ներառում է նաև համատեքստը, ինչպիսիք են նմուշի բնութագրերը, չափման մեթոդները և հնարավոր կողմնակալությունը։
Penutup
Վիճակագրական նշանակալիության թեստերը կարևոր գործիքներ են՝ գնահատելու համար, թե արդյոք տվյալների արդյունքները, հավանաբար, արտացոլում են բնակչության պայմանները, թե պարզապես պատահական տատանումների արդյունք են։ Այնուամենայնիվ, այս թեստերը գիտական ճշմարտության միակ որոշիչը չեն։ p-արժեքը պետք է ճշգրիտ հասկանալ՝ համակցված ազդեցության չափի, վստահության միջակայքի և արդյունքների համապատասխանության համատեքստային գնահատման հետ։
Ճիշտ օգտագործման դեպքում նշանակալիության թեստերը օգնում են հետազոտությունը դարձնել ավելի օբյեկտիվ և հաշվետու։ Եվ հակառակը, եթե դրանք օգտագործվում են մեխանիկորեն՝ առանց դրանց ենթադրությունների և սահմանափակումների հասկանալու, դրանք կարող են հանգեցնել սխալ եզրակացությունների։ Հետևաբար, հայեցակարգային հասկացողությունը, մտածված մեկնաբանությունը և թափանցիկ հաշվետվությունը կարևոր են նշանակալիության թեստերի օգտագործման համար՝ տվյալների վրա հիմնված որոշումները հիմնավորելու համար։