Տվյալների բաշխման վերլուծություն՝ օգտագործելով ստանդարտ շեղում
Վիճակագրության մեջ տվյալների բազմության «կենտրոնը» պարզապես հասկանալը բավարար չէ: Երկու տվյալների բազմություններ կարող են ունենալ նույն միջինը, բայց դրանց բնութագրերը զգալիորեն տարբերվում են ցրման աստիճանի պատճառով: Ահա թե որտեղ է տվյալների ցրման հայեցակարգը կարևոր դառնում: Տարբեր ոլորտներում՝ կրթությունից և տնտեսագիտությունից մինչև առողջապահություն և տվյալագիտություն, ցրման ամենատարածված, հուսալի և հաճախ օգտագործվող չափանիշներից մեկը ստանդարտ շեղումն է: Այս հոդվածը քննարկում է ստանդարտ շեղման հայեցակարգը, հաշվարկը, մեկնաբանությունը և օգտագործումը՝ վերլուծելու համար, թե ինչպես են տվյալները ցրված իրենց կենտրոնական արժեքից:
1. Ինչո՞ւ է անհրաժեշտ վերլուծել տվյալների բաշխումը։
Պատկերացրեք երկու դասարան՝ մաթեմատիկայի թեստի միջին միավորը 80 է։ A դասարանում գրեթե բոլոր աշակերտները հավաքել են 78-ից 82 միավոր։ B դասարանում որոշ աշակերտներ հավաքել են 50, իսկ որոշները՝ 100։ Միջին միավորները նույնն են, բայց երկու դասարաններում իրավիճակները զգալիորեն տարբեր են։ A դասարանը ցույց է տալիս կայուն առաջադիմություն, մինչդեռ B դասարանը ցույց է տալիս զգալի անհամապատասխանություն։
Վերլուծելով բաշխումը, մենք կարող ենք.
– Գնահատեք երևույթի հետևողականությունը կամ փոփոխականությունը։
– Ռիսկի չափում (օրինակ՝ ներդրումային եկամտաբերության տատանում):
– Գործընթացի կայունության համեմատություն (օրինակ՝ արտադրության որակ):
– Հայտնաբերել հնարավոր անոմալիաներ կամ ծայրահեղ տվյալներ։
Ստանդարտ շեղումը այս նպատակի համար հիմնական գործիքն է, քանի որ այն չափում է, թե որքանով են տվյալները տարածված միջինից։
2. Ստանդարտ շեղման սահմանումը
Ստանդարտ շեղումը դիսպերսիայի քառակուսի արմատն է։ Մինչդեռ դիսպերսիան չափում է տվյալների և միջինի միջև եղած տարբերությունների քառակուսիների միջինը, ստանդարտ շեղումը չափման միավորները վերադարձնում է իրենց սկզբնական սանդղակին (օրինակ՝ թեստերի միավորներ, կիլոգրամներ, ռուփի և այլն)։ Սա ստանդարտ շեղումը դարձնում է ավելի հեշտ մեկնաբանելի։
Ինտուիտիվ կերպով՝
– Փոքր ստանդարտ շեղում → հավաքված տվյալները մոտ են միջինին (ավելի միատարր են):
– Մեծ ստանդարտ շեղում → տվյալները տարածված են միջինից հեռու (ավելի բազմազան):
3. Ստանդարտ շեղման բանաձև. Բնակչություն ընդդեմ նմուշի
Վիճակագրության մեջ մենք տարբերակում ենք պոպուլյացիաների և նմուշների համար ստանդարտ շեղման հաշվարկը։
ա) Բնակչության ստանդարտ շեղում (σ)
Եթե վերլուծվող տվյալները վերաբերում են բնակչության բոլոր անդամներին, ապա բանաձևը կլինի՝
\[
\sigma = \sqrt{\frac{\sum (x_i – \mu)^2}{N}}
\]
Տեղեկություն:
– \(x_i\) = i-րդ տվյալների արժեք
– \(\mu\) = բնակչության միջինը
– \(N\) = բնակչության տվյալների քանակը
բ) Նմուշի ստանդարտ շեղում(ներ)
Եթե վերլուծվող տվյալները բնակչության (նմուշի) միայն մի մասն են, ապա բանաձևը հետևյալն է՝
\[
s = \sqrt{\frac{\sum (x_i – \bar{x})^2}{n-1}}
\]
Տեղեկություն:
– \(\bar{x}\) = նմուշի միջինը
– \(n\) = նմուշային տվյալների քանակը
– \(n-1\)-ը կոչվում է ազատության աստիճաններ (Բեսելի ուղղում), որոնք օգտագործվում են այնպես, որ դիսպերսիայի/ստանդարտ շեղման գնահատականը լինի անաչառ։
Ամենօրյա պրակտիկայում մեր ունեցած տվյալները սովորաբար նմուշների տեսքով են, ուստի \(n-1\) բանաձևը շատ հաճախ օգտագործվում է։
4. Ստանդարտ շեղման հաշվարկման քայլեր
Գործընթացը հասկանալու համար ահա նմուշի ստանդարտ շեղումը հաշվարկելու ընդհանուր քայլերը.
1. Հաշվարկեք միջինը (\(\bar{x}\)):
2. Հաշվարկեք յուրաքանչյուր տվյալի և միջինի (\(x_i – \bar{x}\)) միջև եղած տարբերությունը։
3. Քառակուսի գցեք \((x_i – \bar{x})^2\) տարբերությունը։
4. Գումարեք բոլոր քառակուսիները։
5. Բաժանեք \(n-1\)-ի՝ նմուշի դիսպերսիան ստանալու համար։
6. Ստանդարտ շեղումը (s) ստանալու համար արդյունքից քառակուսի արմատ հանեք։
Պարզ օրինակ
Ենթադրենք, որ տվյալների արժեքներն են՝ 70, 75, 80, 85, 90 (n = 5)
– Միջինը՝ \(\bar{x} = (70+75+80+85+90)/5 = 80\)
– Տարբերություն՝ -10, -5, 0, 5, 10
– Քառակուսի տարբերություն՝ 100, 25, 0, 25, 100
– Քառակուսիների քանակը՝ 250
– Նմուշի շեղումը՝ \(250/(5-1)=62,5\)
– Ստանդարտ շեղում՝ \(s=\sqrt{62,5}\մոտավորապես 7,91\)
Պարզ մեկնաբանություն. արժեքները միջինում մոտ 7,91 միավորով շեղվում են 80 միջին արժեքից։
5. Տվյալների վերլուծության մեջ ստանդարտ շեղման մեկնաբանությունը
Ստանդարտ շեղումը առանձին չի լինում. դրա իմաստը կախված է համատեքստից: Այնուամենայնիվ, որոշ ընդհանուր ուղեցույցներ կարող են օգտակար լինել.
– Եթե ստանդարտ շեղումը մոտ է 0-ին, տվյալները խիստ կենտրոնացած են միջինի շուրջ։
– Եթե ստանդարտ շեղումը մեծ է, տվյալները ավելի փոփոխական են, ինչը վկայում է անհավասարության մասին։
Ստանդարտ շեղումը հաճախ օգտագործվում է նաև հետևյալի համար՝
– Երկու խմբերի համեմատություն. օրինակ՝ երկու դասեր՝ նույն միջինով, բայց տարբեր ստանդարտ շեղումներով։
– Գործընթացի կայունության գնահատում. արտադրանքի չափի փոքր ստանդարտ շեղումով գործարանային արտադրությունը նշանակում է ավելի կայուն որակ։
– Անկայունության չափում. ֆինանսների մեջ բաժնետոմսերի եկամտաբերության ստանդարտ շեղումը հաճախ օգտագործվում է որպես ռիսկի ցուցանիշ։
6. Ստանդարտ շեղման և նորմալ բաշխման միջև կապը
Նորմալ բաշխմանը հետևող տվյալներում ստանդարտ շեղումը շատ ուժեղ մեկնաբանություն ունի էմպիրիկ կանոնի միջոցով՝
– Տվյալների մոտ 68%-ը գտնվում է \(\bar{x} \pm 1s\) միջակայքում։
– Տվյալների մոտ 95%-ը գտնվում է \(\bar{x} \pm 2s\) միջակայքում։
– Տվյալների մոտ 99,7%-ը գտնվում է \(\bar{x} \pm 3s\) միջակայքում։
Այս կանոնը օգտակար է միջին արժեքի շուրջ տվյալների «նորմալ» լինելու չափը գնահատելու համար և հեշտացնում է ծայրահեղ արժեքների հայտնաբերումը: Այնուամենայնիվ, կարևոր է հիշել, որ այս կանոնը ճշգրիտ է միայն այն դեպքում, եթե տվյալները իրականում մոտ են նորմալին:
7. Ստանդարտ շեղում ընդդեմ տարածման այլ չափանիշների
Չնայած ստանդարտ շեղումը շատ տարածված է, կան նաև դիսպերսիայի այլ չափանիշներ, որոնք նույնպես կարևոր են.
– Միջակայք. առավելագույն և նվազագույն արժեքների միջև եղած տարբերությունը։ Պարզ է, բայց շատ զգայուն է արտառոց արժեքների նկատմամբ։
– Միջքառորդական միջակայք (IQR): 1-ին և 3-րդ քվարտիլների միջև ընկած միջակայքը: Ավելի դիմացկուն է արտառոց արժեքների նկատմամբ, քան ստանդարտ շեղումը:
– MAD (միջին բացարձակ շեղում). միջնարժեքի վրա հիմնված հուսալի չափանիշ, որը հարմար է բազմաթիվ արտառոց արժեքներ ունեցող տվյալների համար։
Ստանդարտ շեղումը գերազանց է, երբ տվյալները համեմատաբար «մաքուր» են, և բաշխումը չափազանց մեծ պոչ չունի։ Եթե տվյալները պարունակում են բազմաթիվ արտառոց արժեքներ, ստանդարտ շեղումը կարող է դառնալ ավելի մեծ և պակաս ներկայացուցչական տվյալների մեծամասնության համար։
8. Ստանդարտ շեղման առավելություններն ու սահմանափակումները
Քելեբիհան
– Օգտագործում է բոլոր տվյալները (ոչ միայն ծայրահեղ արժեքները):
– Ունի ամուր տեսական հիմք և հաճախ օգտագործվում է բազմաթիվ առաջադեմ վիճակագրական մեթոդներում։
– Հեշտ է մեկնաբանել, քանի որ չափման միավորները նույնն են, ինչ սկզբնական տվյալները։
Սահմանափակումներ
– Շատ զգայուն է արտառոց արժեքների նկատմամբ, քանի որ այն ներառում է տարբերության քառակուսին։
– «Մեծ» կամ «փոքր» հասկացությունների մեկնաբանությունը կախված է մասշտաբից և համատեքստից։
– Բարձր ոչ նորմալ բաշխումների դեպքում ստանդարտ շեղումը կարող է պակաս ներկայացուցչական լինել։
9. Եզրակացություն
Տվյալների ցրվածության վերլուծությունը կարևոր քայլ է տվյալների բազմության բնութագրերը հասկանալու համար: Ստանդարտ շեղումը հստակ չափանիշ է տալիս, թե որքանով են տվյալները տարածվում միջինից՝ օգնելով մեզ գնահատել գործընթացի կամ երևույթի հետևողականությունը, ռիսկը և որակը: Հասկանալով, թե ինչպես հաշվարկել և մեկնաբանել այն, մենք կարող ենք ավելի տեղեկացված որոշումներ կայացնել, լինի դա ակադեմիական հետազոտությունների, կատարողականի գնահատման, որակի վերահսկման, թե բիզնես վերլուծության ոլորտներում:
Վերջին հաշվով, ստանդարտ շեղումը պարզապես թիվ չէ, այլ տվյալներին բնորոշ անորոշության և տատանումների կարևոր ամփոփում: Ավելի ճշգրիտ վերլուծության համար ստանդարտ շեղումը պետք է օգտագործվի այլ չափանիշների հետ համատեղ, ինչպիսիք են միջնարժեքը, միջանկյալ հարաբերակցությունը կամ տվյալների վիզուալիզացիան՝ բաշխման ավելի ամբողջական և ճշգրիտ պատկերացում կազմելու համար: