ပျံ့နှံ့မှုတိုင်းတာမှုများ- ဒေတာတွင် ပြောင်းလဲမှုကွဲပြားမှုကို နားလည်ခြင်း
စာရင်းအင်းနှင့်ဒေတာခွဲခြမ်းစိတ်ဖြာမှုတွင်၊ ဒေတာ၏ဖြန့်ဖြူးမှုနှင့်ကွဲပြားမှုကိုနားလည်ခြင်းသည် တိကျပြီးသက်ဆိုင်ရာကောက်ချက်များချရန်အတွက် အလွန်အရေးကြီးပါသည်။ ဒေတာကွဲပြားမှုကိုဖော်ပြရန်အသုံးပြုသောအဓိကအယူအဆတစ်ခုမှာ "ပျံ့နှံ့မှုတိုင်းတာမှု" ဖြစ်သည်။ ဤဆောင်းပါးသည် ပျံ့နှံ့မှုတိုင်းတာမှုအမျိုးမျိုး၊ ၎င်းတို့သည် အဘယ်ကြောင့်အရေးကြီးသည်၊ ၎င်းတို့ကိုမည်သို့တွက်ချက်ရမည်နှင့် ဒေတာခွဲခြမ်းစိတ်ဖြာမှု၏အခြေအနေတွင် ၎င်းတို့၏အဓိပ္ပာယ်ဖွင့်ဆိုချက်ကို ဆွေးနွေးပါမည်။
ပျံ့နှံ့မှုကို တိုင်းတာခြင်းဆိုတာ ဘာလဲ။
ပျံ့နှံ့မှုတိုင်းတာမှုများသည် အစုတစ်ခုရှိဒေတာသည် ဗဟိုတန်ဖိုးတစ်ခုမှ မည်မျှပျံ့နှံ့သွားသည် သို့မဟုတ် ပျံ့နှံ့သွားသည်ကို ဖော်ပြရန်အသုံးပြုသော မက်ထရစ်များဖြစ်သည်။ ဤဗဟိုတန်ဖိုးကို ပျမ်းမျှ သို့မဟုတ် အလယ်အလတ်ကဲ့သို့သော ဗဟိုလမ်းကြောင်း၏ တိုင်းတာမှုများကို အသုံးပြု၍ ပုံမှန်အားဖြင့် တိုင်းတာသည်။ ပျံ့နှံ့မှုတိုင်းတာမှုများသည် ဒေတာ၏ အကွာအဝေး၊ ကွဲပြားမှုနှင့် တသမတ်တည်းဖြစ်မှုတို့ကို ထိုးထွင်းသိမြင်စေသည်။
ဘာကြောင့် Spread Size က အရေးကြီးတာလဲ။
၁။ ပြောင်းလဲနိုင်မှုကို နားလည်ခြင်း-
ကွဲလွဲမှုသည် မည်သည့်ဒေတာ၏မဆို မရှိမဖြစ်အစိတ်အပိုင်းတစ်ခုဖြစ်သည်။ ဒေတာမည်မျှကွဲပြားသည်ကို နားလည်ခြင်းဖြင့် ထိုဒေတာ၏ အခြေခံဒိုင်းနမစ်ကို ကျွန်ုပ်တို့ နားလည်နိုင်ပါသည်။
၂။ ပြင်ပအချက်များကို ဖော်ထုတ်ပါ-
ဒေတာဖြန့်ဖြူးမှုသည် အခြားဒေတာများနှင့် ဝေးကွာနေသော outliers (အစွန်းရောက်တန်ဖိုးများ) ကို ဖော်ထုတ်ရာတွင် အထောက်အကူဖြစ်စေနိုင်ပြီး ၎င်းတို့သည် နောက်ထပ်ခွဲခြမ်းစိတ်ဖြာမှုအတွက် အရေးကြီးနိုင်သည် သို့မဟုတ် အမှားဒေတာ ဖြစ်နိုင်သည်။
၃။ ဒေတာအစုံ နှိုင်းယှဉ်ချက်-
ပျံ့နှံ့မှုတိုင်းတာမှုများသည် ဒေတာအစုံနှစ်ခု သို့မဟုတ် နှစ်ခုထက်ပိုသော ဒေတာအစုံများအကြား နှိုင်းယှဉ်မှုများကို ခွင့်ပြုသည်။ ဥပမာအားဖြင့်၊ ဒေတာအစုံနှစ်ခုတွင် ပျမ်းမျှတူညီသော်လည်း မတူညီသော ကွဲလွဲမှုများ သို့မဟုတ် ပျံ့နှံ့မှုများ ရှိနိုင်သည်။
၄။ ကောက်ချက်ချနိုင်သော စာရင်းအင်းများ-
ကောက်ချက်ချနိုင်သော စာရင်းအင်းနည်းလမ်းများစွာသည် တရားဝင်ပြီး သိသာထင်ရှားသော နိဂုံးချုပ်ချက်များချရန်အတွက် အချက်အလက်ဖြန့်ဖြူးမှုကို ကောင်းစွာနားလည်ရန် လိုအပ်ပါသည်။
ပြန့်ကျဲမှုအရွယ်အစား အမျိုးအစားများ
စာရင်းအင်းဒေတာခွဲခြမ်းစိတ်ဖြာမှုတွင် အသုံးများသော ပျံ့နှံ့မှုတိုင်းတာမှုများစွာရှိသည်-
၃။ အကွာအဝေး
Range သည် ပျံ့နှံ့မှု၏ အရိုးရှင်းဆုံး တိုင်းတာမှုဖြစ်ပြီး ဒေတာအစုံတစ်ခုရှိ အမြင့်ဆုံးနှင့် အနိမ့်ဆုံးတန်ဖိုးများအကြား ကွာခြားချက်အဖြစ် တွက်ချက်သည်။
\[ \text{အပိုင်းအခြား} = \text{အများဆုံးတန်ဖိုး} – \text{အနည်းဆုံးတန်ဖိုး} \]
တွက်ချက်ရန်လွယ်ကူသော်လည်း၊ ဤအပိုင်းအခြားသည် ဒေတာအချက်နှစ်ချက်ကိုသာ ထည့်သွင်းစဉ်းစားပြီး အနည်းဆုံးနှင့် အများဆုံးတန်ဖိုးများအကြား ဒေတာဖြန့်ဖြူးမှုကို ထင်ဟပ်မထားပါ။
၂။ Interquartile Range (IQR)
IQR သည် outliers များ၏ သက်ရောက်မှုမရှိသောကြောင့် range ထက် dispersion ကို ပိုမိုခိုင်မာသော တိုင်းတာမှုတစ်ခုဖြစ်သည်။ ၎င်းသည် 75th percentile (Q3) မှ 25th percentile (Q1) ကို နုတ်ခြင်းဖြင့် data ၏ median range ကို တွက်ချက်သည်။
\[ \text{IQR} = Q3 – Q1 \]
ပျမ်းမျှကို အာရုံစိုက်ခြင်းဖြင့် IQR သည် အခြေခံဒေတာ၏ ဖြန့်ဖြူးမှု၏ ပိုမိုကောင်းမွန်သော ရုပ်ပုံကို ပေးစွမ်းသည်။
၂။ ကွဲလွဲမှု
Variance သည် ဒေတာအစုံရှိ တန်ဖိုးတစ်ခုစီသည် ပျမ်းမျှမှ မည်မျှဝေးကွာသည်ကို တိုင်းတာသည်။ ၎င်းကို တန်ဖိုးတစ်ခုစီ၏ ပျမ်းမျှမှ ကွာခြားချက်များ၏ နှစ်ထပ်ကိန်းများကို ပေါင်းပြီးနောက် ဒေတာဒြပ်စင်အရေအတွက် (လူဦးရေအတွက်) သို့မဟုတ် ဒြပ်စင်အရေအတွက်မှ တစ် (နမူနာအတွက်) ဖြင့် စားခြင်းဖြင့် တွက်ချက်သည်။
လူဦးရေ (\(\sigma^2\)):
\[ \sigma^2 = \frac{\sum (X_i – \mu)^2}{N} \]
နမူနာ (\(s^2\) အတွက်):
\[ s^2 = \frac{\sum (X_i – X-overline{X})^2}{n-1} \]
Variance သည် အချက်အလက်၏ ညီညွတ်မှုဆိုင်ရာ အကြံဥာဏ်တစ်ခုကို ပေးပါသည်။ သို့သော် variance သည် စတုရန်းယူနစ်များကို အသုံးပြုသောကြောင့် တိုက်ရိုက်အဓိပ္ပာယ်ဖွင့်ဆိုရန် ခက်ခဲနိုင်ပါသည်။
၄။ စံသွေဖည်မှု
စံသွေဖည်မှုသည် ကွေကွင်းမှု၏ နှစ်ထပ်ကိန်းရင်းဖြစ်ပြီး မူရင်းဒေတာနှင့် ယူနစ်တူညီသောကြောင့် အဓိပ္ပာယ်ဖွင့်ဆိုရန် ပိုမိုလွယ်ကူစေသည်။
လူဦးရေ (\(\sigma\) အတွက်):
\[ \sigma = \sqrt{\sigma^2} = \sqrt{\frac{\sum (X_i – \mu)^2}{N}} \]
နမူနာ (\(s\) အတွက်):
\[ s = \sqrt{s^2} = \sqrt{\frac{\sum (X_i – X-line{X})^2}{n-1}} \]
စံသွေဖည်မှုသည် အဓိပ္ပာယ်ဖွင့်ဆိုရလွယ်ကူပြီး စာရင်းအင်းခွဲခြမ်းစိတ်ဖြာမှုအမျိုးမျိုးတွင် မကြာခဏအသုံးပြုသောကြောင့် ပျံ့နှံ့မှု၏ အသုံးအများဆုံးတိုင်းတာမှုများထဲမှ တစ်ခုဖြစ်သည်။
၅။ ကွဲလွဲမှုကိန်းဂဏန်း (CV)
CV သည် စံသွေဖည်မှုနှင့် ပျမ်းမျှအချိုးအဖြစ်ဖော်ပြသည့် ဆွေမျိုးပျံ့နှံ့မှု၏ တိုင်းတာမှုတစ်ခုဖြစ်ပြီး မကြာခဏ ရာခိုင်နှုန်းအဖြစ် ဖော်ပြလေ့ရှိသည်။
\[ \text{CV} = \frac{s}{\overline{X}} \အဆ ၁၀၀\% \]
CV သည် မတူညီသောနည်းလမ်းများဖြင့် ဒေတာအစုံများအကြား ကွဲပြားမှုကို နှိုင်းယှဉ်ရာတွင် အလွန်အသုံးဝင်ပါသည်။
တွက်ချက်နည်းနှင့် အဓိပ္ပာယ်ဖွင့်ဆိုနည်း
တွက်ချက်မှု ဥပမာ
အောက်ပါဒေတာဥပမာဖြင့် သရုပ်ပြကြပါစို့။
\[ \{၁၅၊ ၂၀၊ ၂၅၊ ၃၅၊ ၄၅၊ ၅၅၊ ၆၅၊ ၇၅၊ ၈၅၊ ၉၅\} \]
၁။ အကွာအဝေး:
\[ \text{Range} = ၉၅ – ၁၅ = ၈၀ \]
၂။ Interquartile Range (IQR):
ဒေတာကို စီပြီးနောက်၊ Q1 နှင့် Q3 ကွာတိုင်းလ်များကို ရှာတွေ့နိုင်ပါသည်။ ဤကိစ္စတွင် Q1 သည် 25 ဖြစ်ပြီး Q3 သည် 75 ဖြစ်သည်။
\[ \text{IQR} = ၇၅ – ၂၅ = ၅၀ \]
၁။ ကွဲလွဲမှုနှင့် စံသွေဖည်မှု-
အချက်အလက်၏ ပျမ်းမျှ (\(\overline{X}\)) သည် 51.5 ဖြစ်သည်။ ထို့နောက် ကျွန်ုပ်တို့သည် variance နှင့် standard deviation ကို တွက်ချက်ပါသည်။
\[ \text{Variance (s^2)} = \frac{1}{n-1} \sum (X_i – \overline{X})^2 = 816.11 \]
\[ \text{စံသွေဖည်မှု (များ)} = \sqrt{816.11} = 28.57 \]
၄။ ကွဲလွဲမှုကိန်းဂဏန်း (CV):
\[ \text{CV} = \frac{28.57}{51.5} \x100\% \ခန့်မှန်းခြေ 55.48\% \]
ဒီကနေ စံသွေဖည်မှုက 28.57 လို့ အဓိပ္ပာယ်ဖွင့်ဆိုနိုင်ပြီး CV မှာတော့ စံသွေဖည်မှုက မူရင်းဒေတာရဲ့ ပျမ်းမျှရဲ့ 55.48% လောက်ရှိတယ်လို့ ပြသထားပါတယ်။
နိဂုံး
ပျံ့နှံ့မှုတိုင်းတာမှုများသည် စာရင်းအင်းဒေတာခွဲခြမ်းစိတ်ဖြာမှု၏ မရှိမဖြစ်အစိတ်အပိုင်းများဖြစ်သည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းတို့သည် ဗဟိုတန်ဖိုးတစ်ခုပတ်လည်တွင် ဒေတာ၏ မတူညီမှုနှင့် ပျံ့နှံ့မှုကို ထိုးထွင်းသိမြင်စေသောကြောင့်ဖြစ်သည်။ အသုံးများသော ပျံ့နှံ့မှုတိုင်းတာမှုများတွင် အကွာအဝေး၊ interquartile အကွာအဝေး၊ variance၊ standard deviation နှင့် coefficient of variation တို့ပါဝင်သည်။ ဤတိုင်းတာမှုတစ်ခုစီတွင် သီးခြားအသုံးပြုမှုများရှိပြီး ဒေတာ၏အခြေအနေနှင့် ခွဲခြမ်းစိတ်ဖြာမှု၏ ရည်ရွယ်ချက်ပေါ် မူတည်၍ အဖိုးတန်ထိုးထွင်းသိမြင်မှုများကို ပေးစွမ်းနိုင်သည်။ ပျံ့နှံ့မှုတိုင်းတာမှုများကို သင့်လျော်စွာ နားလည်ခြင်းနှင့် အသုံးပြုခြင်းဖြင့်၊ ကျွန်ုပ်တို့သည် သုတေသနနယ်ပယ်အမျိုးမျိုးနှင့် ဒေတာသိပ္ပံအသုံးချမှုများတွင် ပိုမိုအသိပေးထားပြီး တိကျသောဆုံးဖြတ်ချက်များ ချမှတ်နိုင်ပါသည်။