ڊيٽا جي ورڇ ۾ ويرينس ۽ معياري انحراف جو تجزيو
انگن اکرن ۾، ڊيٽا جي ورڇ کي سمجهڻ ايترو ئي اهم آهي جيترو مرڪزي قدرن کي سمجهڻ جيئن ته اوسط يا وچين. ٻن ڊيٽا سيٽن جو اوسط ساڳيو ٿي سگهي ٿو، پر انهن جي ورڇ تمام مختلف آهن: هڪ سراسري جي چوڌاري مضبوطيءَ سان ڪلستر ٿي سگهي ٿو، جڏهن ته ٻيو وڏي پيماني تي پکڙيل ٿي سگهي ٿو. هي اهو هنڌ آهي جتي ويرينس ۽ معياري انحراف اچي ٿو - اهي اهم ماپ آهن ته ڊيٽا ان جي مرڪزي قدر کان ڪيترو مختلف آهي. هي مضمون انهن جي تصورن، فارمولن، تشريحن، ۽ ڊيٽا تجزيي ۾ انهن جي درخواست جي مثالن تي بحث ڪري ٿو.
1. ڊيٽا جي ورڇ ڇو ضروري آهي؟
ڊيٽا جي ورڇ مستقل مزاجي ۽ خطري بابت معلومات فراهم ڪري ٿي. مثال طور، ٽيسٽ اسڪور جي حوالي سان، ڪلاس A ۽ B ٻنهي لاءِ سراسري 80 ٿي سگهي ٿو. جڏهن ته، جيڪڏهن ڪلاس A جي اسڪور ۾ فرق ننڍو آهي، ته گهڻا شاگرد ساڳي طرح ڪم ڪندا آهن. ان جي برعڪس، جيڪڏهن ڪلاس B جي اسڪور ۾ فرق وڏو آهي، ته اهو ممڪن آهي ته ڪجهه شاگردن جا اسڪور تمام وڏا هجن ۽ ٻين جا اسڪور تمام گهٽ هجن. ڪاروبار ۾، سيلز ڊيٽا جو ورڇ آمدني جي استحڪام کي ظاهر ڪري ٿو؛ فنانس ۾، سيڙپڪاري جي واپسي جو ورڇ خطري جي سطح کي ظاهر ڪري ٿو.
ويرينس ۽ معياري انحراف کي سمجهڻ سان، فيصلو ڪندڙ ڪري سگهن ٿا:
- اندازو لڳايو ته ڪو عمل مستحڪم آهي يا نه (مثال طور ڪارخاني جي پيداوار).
- گروپن جي وچ ۾ تسلسل جو مقابلو ڪرڻ (مثال طور ٻه سکيا جا طريقا).
- ٻاهرين ڊيٽا جي سڃاڻپ ڪرڻ جيڪا جائزو وٺڻ جي لائق آهي.
- اڳڪٿين ۽ ماڊلز ۾ غير يقيني صورتحال جو اندازو لڳائڻ.
2. تغير جو بنيادي تصور
ويريئنس هر ڊيٽا سيٽ جي سراسري چورس انحراف کي اوسط کان ماپي ٿو. انحراف ڊيٽا جي قدرن ۽ اوسط جي وچ ۾ فرق آهي. جيڪڏهن ڪيتريون ئي قدرون اوسط کان پري آهن، ته ويرينس وڏو هوندو. جيڪڏهن قدرون اوسط جي ويجهو آهن، ته ويرينس ننڍو هوندو.
فرض ڪريو ته ڊيٽا آهن: \(x_1, x_2, …, x_n\) جن جو مطلب \(\bar{x}\) آهي. هر ڊيٽا جو انحراف \(x_i – \bar{x}\) آهي. جڏهن ته، جيڪڏهن انحرافن کي سڌو سنئون شامل ڪيو وڃي، ته نتيجو هميشه صفر هوندو آهي ڇاڪاڻ ته مثبت ۽ منفي انحراف آهن جيڪي هڪ ٻئي کي منسوخ ڪن ٿا. ان تي قابو پائڻ لاءِ، انحرافن کي چورس ڪيو ويندو آهي ته جيئن اهي سڀ مثبت هجن. هي اهو هنڌ آهي جتي فرق پيدا ٿئي ٿو.
الف) آبادي ۾ فرق
جيڪڏهن ڊيٽا کي پوري آبادي جي نمائندگي سمجهيو وڃي، ته آبادي جي فرق کي هن طرح لکيو ويندو:
\[
\سگما^2 = \فريڪ{\سم_{i=1}^{ن}(x_i – \mu)^2}{ن}
\]
انسان ۾:
- \(N\) آبادي جي ڊيٽا جو تعداد آهي،
- \(\mu\) آبادي جو سراسري آهي،
- \(\sigma^2\) آبادي جي فرق آهي.
ب) نموني جي فرق
جيڪڏهن ڊيٽا وڏي آبادي مان هڪ نمونو آهي، ته نموني جي فرق استعمال ڪيو ويندو آهي:
\[
s^2 = \frac{\sum_{i=1}^{n}(x_i – \bar{x})^2}{n-1}
\]
تقسيم ڪندڙ \(n-1\) کي بيسل اصلاح سڏيو ويندو آهي، ۽ اهو يقيني بڻائڻ لاءِ استعمال ڪيو ويندو آهي ته آبادي لاءِ ويرينس جو اندازو غير جانبدار آهي. بنيادي طور تي، ڇاڪاڻ ته نموني جو مطلب ڊيٽا مان ئي ڳڻيو ويندو آهي، اتي "آزادي جي درجي جو نقصان" آهي، تنهن ڪري تقسيم ڪندڙ کي مطابق ترتيب ڏنو ويندو آهي.
3. معياري انحراف: تغير جي جڙ
ويريئنس ۾ هڪ عملي خرابي آهي: ان جا يونٽ ڊيٽا جي يونٽن جو چورس آهن. جيڪڏهن ڊيٽا "روپيا" ۾ آهي، ته ويرينس "روپيا²" ۾ آهي، جنهن جي سڌي طرح تشريح ڪرڻ ڏکيو آهي. تنهن ڪري، اسان معياري انحراف استعمال ڪندا آهيون، جيڪو ويرينس جو چورس روٽ آهي.
الف) آبادي جو معياري انحراف
\[
سگما = اسڪوائرٽ {سگما ^ 2}
\]
ب) نموني معياري انحراف
\[
ايس = \sqrt{ايس^2}
\]
معياري انحراف ۾ اصل ڊيٽا وانگر ساڳيا يونٽ آهن، ان کي سمجهڻ آسان بڻائي ٿو. هڪ اعليٰ معياري انحراف هڪ وڌيڪ پکڙيل ڊيٽا کي ظاهر ڪري ٿو؛ هڪ گهٽ معياري انحراف هڪ وڌيڪ ڳري ڊيٽا سيٽ کي ظاهر ڪري ٿو.
4. سادي حساب ڪتاب جو مثال
مثال طور، ٽيسٽ اسڪور ڊيٽا: 70، 75، 80، 85، 90.
1) سراسري حساب ڪريو:
\[
\بار{x} = \فريڪ{70+75+80+85+90}{5} = 80
\]
2) هر قدر جي اوسط کان انحراف جو حساب ڪريو:
- 70: \(70-80=-10\)
- 75: \(75-80=-5\)
- 80: \(80-80=0\)
- 85: \(85-80=5\)
- 90: \(90-80=10\)
3) انحراف کي چورس ڪريو:
– 100، 25، 0، 25، 100
4) شامل ڪريو:
\[
\جوڙ (x_i-\bar{x})^2 = 250
\]
5) نموني جي فرق:
\[
s^2 = \frac{250}{5-1} = 62.5
\]
6) نموني معياري انحراف:
\[
s = \sqrt{62.5} \لڳ ڀڳ 7.91
\]
تشريح: سراسري اسڪور 80 آهي، ۽ "عام طور تي" اسڪور سراسري کان تقريباً 7-8 پوائنٽس جي فرق سان هوندا آهن.
5. تغير ۽ معياري انحراف جي تشريح
تغير ۽ معياري انحراف صرف انگ نه آهن؛ انهن کي تناظر ۾ تشريح ڪرڻ گهرجي.
- ننڍو معياري انحراف: اعليٰ مستقل مزاجي. مثال طور، پيداوار جي سائيز ۾ تمام گهٽ معياري انحراف سان هڪ پيداواري عمل مستحڪم معيار کي ظاهر ڪري ٿو.
- وڏو معياري انحراف: وڏو فرق. سيڙپڪاري ۾، واپسي جي هڪ اعليٰ معياري انحراف جو مطلب آهي اعليٰ اتار چڙهاؤ (وڌيڪ خطرو).
- گروپن جي وچ ۾ مقابلو: جيڪڏهن ٻن گروپن جو اوسط ساڳيو آهي پر مختلف معياري انحراف آهن، ته پوءِ ننڍي انحراف وارو گروپ وڌيڪ هڪجهڙو هوندو.
جڏهن ته، اهو ياد رکڻ ضروري آهي ته معياري انحراف ٻاهرين ماڻهن لاءِ حساس آهي. هڪ واحد انتهائي قدر ويريئنس ۽ معياري انحراف کي خاص طور تي وڌائي سگهي ٿو. تنهن ڪري، تقسيم جو تجزيو اڪثر ڪري ويزوئلائيزيشن (هسٽوگرام، باڪس پلاٽ) يا مضبوط ماپن جهڙوڪ IQR (انٽرڪوارٽائل رينج) سان مڪمل ڪيو ويندو آهي.
6. عام ورڇ ۽ تجرباتي قاعدن سان تعلق
هڪ عام ورڇ (بيل وکر) ۾، معياري انحراف جو هڪ تمام مضبوط مطلب آهي. هڪ تجرباتي اصول آهي جيڪو اڪثر استعمال ڪيو ويندو آهي:
- ڊيٽا جو لڳ ڀڳ 68٪ رينج \(\bar{x} \pm 1s\) ۾ آهي.
- ڊيٽا جو لڳ ڀڳ 95٪ رينج \(\bar{x} \pm 2s\) ۾ آهي.
- ڊيٽا جو لڳ ڀڳ 99,7٪ رينج \(\bar{x} \pm 3s\) ۾ آهي.
هي قاعدو جلدي تشريح ڪرڻ ۾ مدد ڪري ٿو، مثال طور اهو اندازو لڳائڻ ته ڇا ڪا قدر "غير قدرتي" آهي يا اڃا تائين عام حد اندر آهي.
7. مختلف شعبن ۾ درخواستون
1) تعليم: شاگردن جي گريڊن جي ورڇ جي نگراني. ننڍا انحراف برابر سکيا جي نتيجن کي ظاهر ڪن ٿا، جڏهن ته وڏا انحراف سمجھ ۾ فرق کي ظاهر ڪري سگهن ٿا.
2) صنعت: معيار جو ڪنٽرول. پيداوار جي تسلسل جو جائزو وٺڻ لاءِ ويرينس استعمال ڪيو ويندو آهي.
3) فنانس: اسٽاڪ جي قيمت جي اتار چڙهاؤ، پورٽ فوليو جي واپسي، ۽ سيڙپڪاري جي خطري کي ماپي ٿو.
4) صحت: مريض جي آبادي ۾ بلڊ پريشر، شوگر جي سطح، يا ٻين ڪلينڪل اشارن ۾ تبديلين جو مشاهدو ڪرڻ.
5) سماجي تحقيق: سروي جي جوابن جي مختلف هجڻ ۽ جواب ڏيندڙ جي خاصيتن جي تنوع جو جائزو وٺڻ.
8. عام غلطيون ۽ عملي صلاحون
ڪجھ عام غلطيون:
- نموني جي فرق (ورهائيندڙ \(n-1\)) استعمال ڪندي جيتوڻيڪ ڊيٽا مڪمل آبادي آهي، يا ان جي برعڪس.
- ان جي چورس يونٽن تي غور ڪرڻ کان سواءِ فرق جي تشريح ڪريو؛ تشريح لاءِ معياري انحراف استعمال ڪرڻ محفوظ آهي.
- غير ضروري شين کي نظرانداز ڪريو؛ اهو بهتر آهي ته پهريان ڊيٽا چيڪ ڪريو.
- مختلف پيمانن سان ڊيٽا جي وچ ۾ معياري انحرافن جو مقابلو ڪريو بغير نارملائيزيشن جي؛ ڪجهه حالتن ۾، وڌيڪ منصفانه مقابلي لاءِ تبديلي جي کوٽائي (CV) يعني \(CV = \frac{s}{\bar{x}}\times 100\%\) استعمال ڪريو.
پينوٽ اپ
ويريئنس ۽ معياري انحراف ڊيٽا جي ورڇ کي سمجهڻ لاءِ بنيادي اوزار آهن. ويريئنس هڪ مضبوط رياضياتي بنياد فراهم ڪري ٿو، جڏهن ته معياري انحراف هڪ ماپ فراهم ڪري ٿو جيڪو تشريح ڪرڻ آسان آهي ڇاڪاڻ ته اهو اصل ڊيٽا سان ملندڙ جلندڙ آهي. انهن ٻن ماپن کي استعمال ڪندي، اسان ڊيٽا سيٽن جي وچ ۾ ورڇ جي خاصيتن ۾ تسلسل، خطري ۽ فرق جو وڌيڪ واضح طور تي جائزو وٺي سگهون ٿا. ڊيٽا تجزيي جي عمل ۾، ويريئنس ۽ معياري انحراف کي مرڪزي رجحان ۽ بصري جي ماپن سان گڏ بهترين طور تي استعمال ڪيو ويندو آهي ته جيئن ڊيٽا جي مڪمل تصوير مهيا ڪري سگهجي ۽ وڌيڪ باخبر فيصلا ڪيا وڃن.
جيڪڏهن توهان چاهيو ٿا، ته مان وڌيڪ پيچيده حساب ڪتاب جا مثال شامل ڪري سگهان ٿو (مثال طور گروپ ٿيل ڊيٽا)، يا معياري انحراف جي تعلق کي z-score ۽ آئوٽليئر ڊيٽيڪشن سان بيان ڪري سگهان ٿو.