Statistiskās nozīmības tests
Kvantitatīvajos pētījumos viens no visbiežāk uzdotajiem jautājumiem ir: vai datos novērotās atšķirības vai sakarības patiesi ir “reālas”, vai arī tās ir vienkārši sakritība, ko izraisa nejaušas variācijas? Lai uz to atbildētu, pētnieki izmanto statistiskās nozīmības testus. Šie testi palīdz noteikt, vai no izlases iegūtie rezultāti ir pietiekami spēcīgi, lai tos vispārinātu uz populāciju, pamatojoties uz noteiktu varbūtības sistēmu. Lai gan terminoloģija var šķist tehniska, pamatkoncepcija ir vienkārša: mēs salīdzinām to, ko novērojam, ar to, kas būtu noticis, ja nebūtu nekādas ietekmes.
Definīcija un mērķis
Statistiskās nozīmības tests ir formāla procedūra, ko izmanto, lai novērtētu datu sniegtos pierādījumus apgalvojumam (hipotēzei) par populāciju. Tās galvenais mērķis ir noteikt, vai efekts, piemēram, atšķirība starp divu grupu vidējiem rādītājiem, korelācija starp diviem mainīgajiem vai ārstēšanas efekts, ir pietiekami liels un konsekvents, lai tā nejaušība būtu maz ticama.
Praksē nozīmīguma testi "nepierāda" teorijas patiesumu, bet gan sniedz mērījumu tam, cik spēcīgi dati noraida konkrētu pieņēmumu. Šeit ir svarīgi saprast, ka statistika darbojas nenoteiktības sfērā. Nav absolūtas pārliecības, bet gan zināma pārliecības pakāpe, ko apstiprina dati.
Nulles hipotēze un alternatīvā hipotēze
Nozīmīguma testi parasti balstās uz diviem apgalvojumiem:
1. Nulles hipotēze (H₀): apgalvo, ka nav atšķirības, nav saistību vai nav ietekmes. Piemēram: “A klases vidējā atzīme ir tāda pati kā B klasei” vai “Nav saistības starp mācību stundām un eksāmenu rezultātiem”.
2. Alternatīva hipotēze (H₁ vai Hₐ): apgalvo, ka pastāv atšķirība, saistība vai ietekme. Piemēram: “A klases vidējā atzīme atšķiras no B klases” vai “Pastāv saistība starp mācību stundām un eksāmenu rezultātiem”.
Nozīmīguma testi darbojas, pamatojoties uz sākotnējo pieņēmumu, ka H₀ ir patiess. Pēc tam dati tiek analizēti, lai noskaidrotu, vai rezultāti ir ārkārtīgi reti, ja H₀ ir patiess. Ja tie ir reti, mēs parasti noraidām H₀.
P vērtība (p-vērtība) un tās nozīme
Svarīgākais jēdziens nozīmīguma testēšanā ir p-vērtība. Vienkārši sakot, p-vērtība ir varbūtība iegūt rezultātu, kas ir vismaz tikpat ekstrēms kā datos novērotais, pieņemot, ka nulles hipotēze ir patiesa.
– Ja p ir mazs, tas nozīmē, ka novērotie rezultāti reti rodas, ja H₀ ir patiess, tāpēc mums ir pamats noraidīt H₀.
– Ja p ir liels, tas nozīmē, ka novērotie rezultāti joprojām ir ticami, ja H₀ ir patiess, tāpēc mums nav pietiekami daudz pierādījumu, lai noraidītu H₀.
Tomēr p-vērtība bieži tiek pārprasta. P-vērtība nav varbūtība, ka H₀ ir patiess vai nepatiess. Tā arī nav efekta lieluma mērs. P-vērtība vienkārši norāda pierādījumu stiprumu pret H₀ noteiktā kontekstā.
Nozīmīguma līmenis (α)
Lai pieņemtu lēmumu, pētnieki nosaka nozīmīguma līmeni, ko apzīmē ar α (alfa). Visbiežāk izmantotās vērtības ir 0,05 (5%) vai 0,01 (1%). Noteikums ir šāds:
– Ja p ≤ α, rezultātus sauc par statistiski nozīmīgiem, un H₀ tiek noraidīts.
– Ja p > α, rezultāts nav nozīmīgs un H₀ netiek noraidīts.
α izvēle nav tikai tehnisks lēmums, bet gan ņem vērā arī kontekstu. Piemēram, medicīniskos pētījumos, kas saistīti ar pacientu drošību, pētnieki var izvēlēties stingrāku α (0,01), lai samazinātu kļūdainu secinājumu risku.
I un II tipa kļūdas
Tā kā statistiskās pārbaudes ietver lēmumu pieņemšanu nenoteiktības apstākļos, vienmēr pastāv kļūdas iespējamība:
1. I tipa kļūda (viltus pozitīvs): H₀ noraidīšana, ja H₀ ir patiess. Varbūtību kontrolē α.
2. II tipa kļūda (viltus negatīvs): nespēja noraidīt H₀, ja H₁ ir patiess. Varbūtību apzīmē ar β (beta); apgriezto varbūtību sauc par pakāpi, kas ir 1 − β.
Reālās dzīves kontekstā abu veidu kļūdām var būt būtiskas sekas. Piemēram, pieņēmums, ka zāles ir efektīvas, lai gan tās tādas nav (I tips), var būt kaitīgs, savukārt pieņēmums, ka zāles ir neefektīvas, lai gan tās patiesībā ir efektīvas (II tips), var novest pie terapeitisku iespēju neizmantošanas.
Bieži sastopamie nozīmīguma testu veidi
Ir daudz nozīmīguma testu, un izvēle ir atkarīga no mērķa, datu veida un pieņēmumiem, kas tiek izpildīti. Daži no visbiežāk izmantotajiem ir:
– T-tests: salīdzina divu grupu (piemēram, eksperimentālās un kontroles) vidējos rādītājus. Pastāv neatkarīgas un pāru t-testa versijas.
– ANOVA: salīdzina vairāk nekā divu grupu (piemēram, trīs mācību metožu) vidējo vērtību.
– Hi kvadrāta tests: pārbauda kategorisko mainīgo (piemēram, dzimuma un studiju programmas izvēles) savstarpējo saistību.
– Pīrsona/Spīrmena korelācija: pārbauda divu skaitlisku mainīgo savstarpējo saistību (Pīrsona metode normāliem datiem, Spīrmena metode kārtas/nenormāliem datiem).
– Lineārā/loģistiskā regresija: pārbauda viena vai vairāku prognozējošo mainīgo ietekmi uz iznākuma mainīgo.
Katram testam ir pieņēmumi, piemēram, normalitāte, dispersijas homogenitāte vai datu neatkarība. Šo pieņēmumu pārkāpšana var novest pie maldinošiem testa rezultātiem, tāpēc datu diagnostika un priekšnosacījumu testi ir būtiski.
Statistiskā nozīmība pret praktisko nozīmību
Viens no nozīmīguma testēšanas kritikas punktiem ir tāds, ka pētnieki pārāk daudz koncentrējas uz to, vai tas ir "nozīmīgi" vai "nenozīmīgi", neņemot vērā tā praktiskās sekas. Ļoti lielās izlasēs nelielas atšķirības var būt statistiski nozīmīgas, pat ja to ietekme ir tik tikko pamanāma. Turpretī mazās izlasēs efekti, kas patiesībā ir diezgan svarīgi, var nesasniegt nozīmīgumu nepietiekamas jaudas dēļ.
Tāpēc nozīmīguma testiem vienmēr jāpievieno:
– Efektu lielumi, piemēram, Koena d, eta kvadrātā vai izredžu attiecība.
– ticamības intervāls, lai parādītu saprātīgu parametru vērtību diapazonu.
P-vērtības, efekta lieluma un ticamības intervāla kombinācija sniedz pilnīgāku priekšstatu: ne tikai “ir efekts vai nav”, bet gan “cik liels ir efekts un cik droši mēs varam būt par šo novērtējumu”.
Vispārīgie soļi nozīmīguma testa veikšanai
Kopumā procedūra ir šāda:
1. Formulējiet H₀ un H₁ atbilstoši pētījuma jautājumiem.
2. Nosakiet α (piemēram, 0,05).
3. Izvēlieties pareizo testu atbilstoši datu veidam un pētījuma dizainam.
4. Pārbaudiet testa pieņēmumus (normalitāti, dispersiju, neatkarību utt.).
5. Aprēķiniet testa statistiku un iegūstiet p-vērtību.
6. Salīdziniet p-vērtību ar α un izdariet secinājumus.
7. Pilnībā ziņojiet par rezultātiem, norādot arī efektu lielumu un ticamības intervālus, ja iespējams.
Laba ziņošana ietver arī kontekstu, piemēram, izlases raksturlielumus, mērīšanas metodes un iespējamo neobjektivitāti.
Pennutup
Statistiskās nozīmības testi ir svarīgi rīki, lai novērtētu, vai datu atradumi, visticamāk, atspoguļo populācijas apstākļus vai ir vienkārši nejaušas variācijas rezultāts. Tomēr šie testi nav vienīgais zinātniskās patiesības arbitrs. P-vērtība ir jāsaprot precīzi, apvienojumā ar efekta lielumu, ticamības intervālu un rezultātu atbilstības kontekstuālo novērtējumu.
Pareizi izmantoti nozīmīguma testi palīdz padarīt pētījumus objektīvākus un atbildīgākus. Savukārt, ja tos izmanto mehāniski, neizprotot to pieņēmumus un ierobežojumus, tie var novest pie kļūdainiem secinājumiem. Tāpēc konceptuāla izpratne, pārdomāta interpretācija un pārredzama ziņošana ir galvenie nozīmīguma testu izmantošanas galvenie faktori, lai atbalstītu uz datiem balstītus lēmumus.