သုတေသနတွင် စာရင်းအင်းဆိုင်ရာ ဖော်မြူလာများ

သုတေသနတွင် စာရင်းအင်းဆိုင်ရာ ဖော်မြူလာများ

စာရင်းအင်းပညာဆိုသည်မှာ အချက်အလက်စုဆောင်းခြင်း၊ ခွဲခြမ်းစိတ်ဖြာခြင်း၊ အဓိပ္ပာယ်ဖွင့်ဆိုခြင်းနှင့် တင်ပြခြင်းတို့နှင့် သက်ဆိုင်သည့် သင်္ချာဘာသာရပ်ခွဲတစ်ခုဖြစ်သည်။ သိပ္ပံ၊ အင်ဂျင်နီယာ၊ လူမှုရေးသိပ္ပံ သို့မဟုတ် လူသားပညာတို့တွင်ပင် သုတေသနပြုချက်များတွင် စာရင်းအင်းပညာသည် သုတေသီများအား ယူဆချက်များကို စမ်းသပ်ခြင်း၊ ခန့်မှန်းချက်များပြုလုပ်ခြင်းနှင့် နိဂုံးချုပ်ချက်များရေးဆွဲခြင်းတွင် အရေးပါသောအခန်းကဏ္ဍမှ ပါဝင်သည်။ ဤဆောင်းပါးသည် အခြေခံစာရင်းအင်းဖော်မြူလာအချို့နှင့် သုတေသနတွင် ၎င်းတို့၏အသုံးချမှုကို ဆွေးနွေးပါမည်။

၁။ ဖော်ပြချက်စာရင်းအင်းများ

ဖော်ပြချက်စာရင်းအင်းများကို လေ့လာမှုတစ်ခုတွင် စုဆောင်းရရှိသော အချက်အလက်များကို ဖော်ပြရန် အသုံးပြုသည်။ ၎င်းတို့တွင် အချက်အလက်များ၏ ခြုံငုံသုံးသပ်ချက်ကို ပေးစွမ်းသည့် တိုင်းတာမှုအမျိုးမျိုး ပါဝင်သည်။

က။ ပျမ်းမျှ (ပျမ်းမျှ)
ပျမ်းမျှတန်ဖိုးသည် စာရင်းအင်းများတွင် အသုံးအများဆုံးတန်ဖိုးဖြစ်သည်။ ၎င်းသည် dataset တစ်ခုရှိ တန်ဖိုးအားလုံး၏ စုစုပေါင်းပေါင်းလဒ်ကို တန်ဖိုးအရေအတွက်ဖြင့် စားခြင်းဖြစ်သည်။

\[ \text{ပျမ်းမျှ} (\bar{x}) = \frac{\sum_{i=1}^{n} x_i}{n} \]

ဘယ်နေရာ:
– \( \sum \) သည် ပေါင်းလဒ်သင်္ကေတဖြစ်ပြီး ၁ မှ \( n \) အထိ \( x \) တန်ဖိုးအားလုံးကို ပေါင်းထည့်ရန်ဟု ဆိုလိုသည်။
– \( x_i \) သည် dataset အတွင်းရှိ တန်ဖိုးတိုင်းဖြစ်သည်။
– \( n \) သည် dataset ရှိ တန်ဖိုးများ၏ စုစုပေါင်းအရေအတွက် ဖြစ်သည်။

ခ။ အလယ်အလတ်
အလယ်တန်ဖိုးသည် အစီအစဉ်တကျ စီစဉ်ထားသော dataset ရှိ အလယ်တန်ဖိုးဖြစ်သည်။ ဒေတာရှိ တန်ဖိုးအရေအတွက်သည် မကိန်းဖြစ်ပါက အလယ်တန်ဖိုးသည် အလယ်တန်ဖိုးဖြစ်သည်။ တန်ဖိုးအရေအတွက်သည် စုံဖြစ်ပါက အလယ်တန်ဖိုးနှစ်ခု၏ ပျမ်းမျှဖြစ်သည်။

ဂ။ မုဒ်
မုဒ်ဆိုသည်မှာ ဒေတာစုတစ်ခုတွင် အများဆုံးပေါ်လာသော တန်ဖိုးဖြစ်သည်။ ဒေတာစုတစ်ခုတွင် မုဒ်တစ်ခု (unimodal)၊ မုဒ်တစ်ခုထက်ပို၍ (multimodal) သို့မဟုတ် မုဒ်လုံးဝမရှိနိုင်ပါ။

ဃ။ အကွာအဝေး
Range ဆိုသည်မှာ dataset တစ်ခုရှိ အမြင့်ဆုံးနှင့် အနိမ့်ဆုံးတန်ဖိုးများအကြား ကွာခြားချက်ဖြစ်သည်။

\[ \text{အပိုင်းအခြား} = \text{အမြင့်ဆုံး}(x) – \text{အနည်းဆုံး}(x) \]

င. စံသွေဖည်မှု
စံသွေဖည်မှုဆိုသည်မှာ ပျမ်းမျှတစ်ဝိုက်တွင် အချက်အလက်ပျံ့နှံ့မှု သို့မဟုတ် ပျံ့နှံ့မှုကို တိုင်းတာခြင်းဖြစ်သည်။ လူဦးရေစံသွေဖည်မှုအတွက် ဖော်မြူလာမှာ-

ဖတ်ရန်  စာရင်းအင်းပညာတွင် မွန်တီကာလို နည်းလမ်း

\[ \sigma = \sqrt{\frac{\sum_{i=1}^{N} (x_i – \mu)^2}{N}} \]

နှင့် နမူနာအတွက်-

\[ s = \sqrt{\frac{\sum_{i=1}^{n} (x_i – x)^2}{n-1}} \]

ဘယ်နေရာ:
– \( \sigma \) သည် လူဦးရေ စံသွေဖည်မှု ဖြစ်သည်။
– \( s \) သည် နမူနာ စံသွေဖည်မှု ဖြစ်သည်။
– \( x_i \) သည် dataset အတွင်းရှိ တန်ဖိုးတိုင်းဖြစ်သည်။
– \( \mu \) သည် လူဦးရေ ပျမ်းမျှ ဖြစ်သည်။
– \( \bar{x} \) သည် နမူနာပျမ်းမျှတန်ဖိုး ဖြစ်သည်။
– \( N \) သည် လူဦးရေရှိ တန်ဖိုးများ၏ စုစုပေါင်းအရေအတွက် ဖြစ်သည်။
– \( n \) သည် နမူနာရှိ တန်ဖိုးများ၏ စုစုပေါင်းအရေအတွက် ဖြစ်သည်။

၂။ ကောက်ချက်ချနိုင်သော စာရင်းအင်းများ

ကောက်ချက်စာရင်းအင်းများသည် သုတေသီများအား အချက်အလက်နမူနာတစ်ခုအပေါ် အခြေခံ၍ လူဦးရေတစ်ခုအကြောင်း နိဂုံးချုပ်ရန် ခွင့်ပြုသည်။ ၎င်းတွင် ယူဆချက်စမ်းသပ်ခြင်း၊ ဆုတ်ယုတ်ခြင်းနှင့် ကွဲလွဲမှုခွဲခြမ်းစိတ်ဖြာခြင်း (ANOVA) ကဲ့သို့သော နည်းစနစ်အမျိုးမျိုး ပါဝင်သည်။

က. ယူဆချက်စမ်းသပ်ခြင်း
ယူဆချက်စမ်းသပ်ခြင်းသည် လူဦးရေတစ်ခုတွင် အခြေအနေတစ်ခု မှန်ကန်ကြောင်း ကောက်ချက်ချရန် အချက်အလက်နမူနာတစ်ခုတွင် လုံလောက်သော အထောက်အထားရှိမရှိ ဆုံးဖြတ်ရန် အသုံးပြုသည့် စာရင်းအင်းဆိုင်ရာ လုပ်ငန်းစဉ်တစ်ခုဖြစ်သည်။

i. သုညယူဆချက် (H0) နှင့် အခြားယူဆချက် (H1)

– Null Hypothesis (H0): ကွာခြားချက် သို့မဟုတ် အကျိုးသက်ရောက်မှု မရှိပါ။
– အခြားယူဆချက် (H1): ကွာခြားချက် သို့မဟုတ် အကျိုးသက်ရောက်မှု ရှိပါသည်။

စမ်းသပ်ခြင်းကို t-test၊ chi-square test သို့မဟုတ် ANOVA ကဲ့သို့သော စမ်းသပ်မှုစာရင်းအင်းကို အသုံးပြု၍ ပြုလုပ်ပြီး p-value ကို significance level (\(\alpha\)) နှင့် နှိုင်းယှဉ်ပြီး များသောအားဖြင့် 0,05 ဖြစ်သည်။

ii. t-စမ်းသပ်မှု
t-test ကို အုပ်စုနှစ်စု၏ ပျမ်းမျှတန်ဖိုးကို နှိုင်းယှဉ်ရန် အသုံးပြုသည်။ t-test တွင် ကွဲပြားမှုများစွာရှိပြီး၊ ဥပမာ လွတ်လပ်သောနမူနာ t-test နှင့် တွဲထားသော t-test ကဲ့သို့သော ဖြစ်သည်။

လွတ်လပ်သောနမူနာများအတွက် t-test အတွက် အခြေခံဖော်မြူလာမှာ-

\[ t = \frac{\bar{x}_1 – \bar{x}_2}{\sqrt{\left( \frac{s_1^2}{n_1} \right) + \left( \frac{s_2^2}{n_2} \right)}} \]

ခ။ နောက်ပြန်ဆုတ်ခြင်း
Regression ကို တစ်ခု သို့မဟုတ် တစ်ခုထက်ပိုသော လွတ်လပ်သော variable များ (predictors) နှင့် မှီခို variable (response) အကြား ဆက်နွယ်မှုကို ပုံစံပြုရန် အသုံးပြုသည်။

i. ရိုးရှင်းသော Linear Regression
ရိုးရှင်းသော linear regression သည် လွတ်လပ်သော variable တစ်ခုနှင့် မှီခို variable တစ်ခုအကြား ဆက်နွယ်မှုကို ပုံစံပြုပေးသည်။

ရိုးရှင်းသော linear regression ညီမျှခြင်းမှာ-

ဖတ်ရန်  စီမံခန့်ခွဲမှုအတွက် စာရင်းအင်းများ

\[ y = \beta_0 + \beta_1 x + \epsilon \]

ဘယ်နေရာ:
–\( y\) သည် မှီခိုကိန်းရှင် ဖြစ်သည်။
-\( x\) သည် လွတ်လပ်သော ကိန်းရှင် ဖြစ်သည်။
– \( \beta_0 \) သည် ကြားဖြတ် ဖြစ်သည်။
– \( \beta_1 \) သည် regression coefficient ဖြစ်သည်။
– \( \epsilon \) သည် အမှားအယွင်းတစ်ခုဖြစ်သည်။

ii. မျိုးစုံ Linear Regression
Multiple linear regression သည် လွတ်လပ်သော variable အများအပြားနှင့် မှီခို variable တစ်ခုအကြား ဆက်နွယ်မှုကို ပုံစံပြုပေးသည်။

multiple linear regression ညီမျှခြင်းကတော့ အောက်ပါအတိုင်း ဖြစ်ပါတယ်။

\[ y = \beta_0 + \beta_1 x_1 + \beta_2 x_2 + \ldots + \beta_p x_p + \epsilon \]

ဘယ်နေရာ:
–\( y\) သည် မှီခိုကိန်းရှင် ဖြစ်သည်။
– \( x_1, x_2, \ldots, x_p \) သည် လွတ်လပ်သော variable ဖြစ်သည်။
– \( \beta_0 \) သည် ကြားဖြတ် ဖြစ်သည်။
– \( \beta_p \) သည် လွတ်လပ်သော ကိန်းရှင် \( p \) အတွက် ဆုတ်ယုတ်မှု ကိန်းဂဏန်း ဖြစ်သည်။
– \( \epsilon \) သည် အမှားအယွင်းတစ်ခုဖြစ်သည်။

ဂ။ Variance ခွဲခြမ်းစိတ်ဖြာခြင်း (ANOVA)
ANOVA ကို အုပ်စုသုံးစု သို့မဟုတ် ထို့ထက်ပိုသော အုပ်စုများ၏ ပျမ်းမျှတန်ဖိုးများကို နှိုင်းယှဉ်ရန် အသုံးပြုသည်။ ANOVA သည် အုပ်စုများအကြား ကွဲပြားမှုကို အုပ်စုများအတွင်း ကွဲပြားမှုနှင့် နှိုင်းယှဉ်ခြင်းဖြင့် အုပ်စုပျမ်းမျှတန်ဖိုးများအကြား သိသာထင်ရှားသော ကွာခြားချက်ရှိမရှိကို ဆုံးဖြတ်သည်။

ANOVA အတွက် အခြေခံပုံသေနည်းကတော့ -

\[ F = \frac{\text{အုပ်စုအကြား ကွဲလွဲမှု}}{\text{အုပ်စုအတွင်း ကွဲလွဲမှု}} \]

အုပ်စုပျမ်းမျှကွာခြားချက်ရှိမရှိ ဆုံးဖြတ်ရန်အတွက် F-statistic ကို တွက်ချက်ပြီး F ဖြန့်ဖြူးမှု၏ အရေးပါသောတန်ဖိုးနှင့် နှိုင်းယှဉ်သည်။

၃။ ဆက်စပ်မှု

ဆက်စပ်မှုသည် ကိန်းရှင်နှစ်ခုကြားရှိ မျဉ်းဖြောင့်ဆက်နွယ်မှု၏ အစွမ်းသတ္တိနှင့် ဦးတည်ရာကို တိုင်းတာသည်။

က။ Pearson ဆက်စပ်မှုကိန်း (r)
Pearson's correlation coefficient သည် variable နှစ်ခုကြားရှိ linear correlation ကိုတိုင်းတာရန် အသုံးအများဆုံး တိုင်းတာမှုတစ်ခုဖြစ်သည်။

Pearson ဆက်စပ်မှုကိန်းအတွက် ဖော်မြူလာမှာ အောက်ပါအတိုင်းဖြစ်သည်။

\[ r = \frac{\sum_{i=1}^{n} (x_i – x)(y_i – y)}{\sqrt{\sum_{i=1}^{n} (x_i – x)^2} \sqrt{\sum_{i=1}^{n} (y_i – y)^2}} \]

ဘယ်နေရာ:
–\( r\) သည် Pearson ဆက်စပ်မှုကိန်း ဖြစ်သည်။
– \( x_i \) နှင့် \( y_i \) တို့သည် variable နှစ်ခု၏ တန်ဖိုးများ ဖြစ်ကြသည်။
– \( \bar{x} \) နှင့် \( \bar{y} \) တို့သည် variable နှစ်ခု၏ ပျမ်းမျှများ ဖြစ်သည်။

ဖတ်ရန်  ဒွိစုံဖြန့်ဖြူးမှုကို သိရှိခြင်း

\( r \) တန်ဖိုးသည် -1 (ပြီးပြည့်စုံသော အနုတ်လက္ခဏာ ဆက်စပ်မှု) မှ +1 (ပြီးပြည့်စုံသော အပြုသဘော ဆက်စပ်မှု) အထိရှိပြီး၊ 0 သည် ဆက်စပ်မှုမရှိဟု ညွှန်ပြသည်။

ပိတ်

စာရင်းအင်းပညာသည် သုတေသီများအား အချက်အလက်များမှ တင်ပြခြင်း၊ ခွဲခြမ်းစိတ်ဖြာခြင်းနှင့် နိဂုံးချုပ်ခြင်းတို့ကို ကူညီပေးသည့် အရေးကြီးသော သုတေသနကိရိယာတစ်ခုဖြစ်သည်။ ဤဆောင်းပါးသည် ဖော်ပြချက်နှင့် ကောက်ချက်ချခြင်းဆိုင်ရာ အခြေခံဖော်မြူလာအနည်းငယ်အပြင် ဆက်စပ်မှုတို့ကိုသာ လွှမ်းခြုံထားသည်။ ရိုးရှင်းသော်လည်း ဤဖော်မြူလာများကို သေချာစွာနားလည်ခြင်းသည် တရားဝင်ခွဲခြမ်းစိတ်ဖြာမှုများပြုလုပ်ခြင်းနှင့် သုတေသနဒေတာမှ တိကျသောနိဂုံးချုပ်မှုများဆွဲယူခြင်းအတွက် အဓိကသော့ချက်ဖြစ်သည်။ စာရင်းအင်းများကို ကျွမ်းကျင်စွာအသုံးပြုခြင်းဖြင့် သုတေသီများသည် ၎င်းတို့၏တွေ့ရှိချက်များသည် ခိုင်မာပြီးယုံကြည်စိတ်ချရသော ခွဲခြမ်းစိတ်ဖြာမှုပေါ်တွင် အခြေခံထားကြောင်း သေချာစေနိုင်သည်။

မှတ်ချက်ရေးပါ