ဆုံးဖြတ်မှုကိန်းဆိုင်ရာ ဆွေးနွေးမှုမေးခွန်း၏ ဥပမာ

ဆုံးဖြတ်ချက်ချမှတ်ခြင်းဆိုင်ရာ ဆွေးနွေးမှုမေးခွန်း၏ ဥပမာ

ဆုံးဖြတ်ချက်ချမှတ်မှုကိန်းဂဏန်း (R²) သည် ဆုတ်ယုတ်ခွဲခြမ်းစိတ်ဖြာမှုတွင် အရေးကြီးသော parameter တစ်ခုဖြစ်ပြီး၊ ဆုတ်ယုတ်မော်ဒယ်တစ်ခုသည် အချက်အလက်များ၏ တကယ့်ပြောင်းလဲမှုကို မည်မျှကောင်းမွန်စွာ ရှင်းပြနိုင်သည်ကို ညွှန်ပြသည်။ ဤဆောင်းပါးတွင်၊ ကျွန်ုပ်တို့သည် အသေးစိတ်ဥပမာနှင့် ဆွေးနွေးချက်မှတစ်ဆင့် ဆုံးဖြတ်ချက်ချမှတ်မှုကိန်းဂဏန်း၏ အယူအဆကို ရှင်းပြပါမည်။

ဆုံးဖြတ်မှုကိန်း၏ အခြေခံသဘောတရား

ဆုံးဖြတ်ချက်ချမှတ်ခြင်းဆိုင်ရာ ကိန်းဂဏန်း သို့မဟုတ် \( R^2 \) ကို ၀ မှ ၁ အထိ စကေးဖြင့် တိုင်းတာပြီး၊ ဤတွင်-

– \( R^2 = 0 \) သည် regression model သည် data ၏ variability ကို လုံးဝမရှင်းပြနိုင်ကြောင်း ညွှန်ပြသည်။
– \( R^2 = 1 \) သည် regression မော်ဒယ်သည် data ၏ variability အားလုံးကို ပြီးပြည့်စုံစွာ ရှင်းပြနိုင်ကြောင်း ပြသသည်။

ဆုံးဖြတ်ချက်ကိန်းဂဏန်းတွက်ချက်ရန် အခြေခံဖော်မြူလာမှာ-

\[ R^2 = 1 – \frac{SSR}{SST} \]

ဘယ်နေရာ:
– SSR (Sum of Squared Residuals) သည် မော်ဒယ်မှ ခန့်မှန်းထားသော တန်ဖိုးများနှင့် တကယ့်တန်ဖိုးများအကြား ကွာခြားချက်များ၏ နှစ်ထပ်ကိန်းများ၏ ပေါင်းလဒ်ဖြစ်သည်။
– SST (Total Sum of Squares) သည် တကယ့်တန်ဖိုးနှင့် တကယ့်တန်ဖိုးများ၏ ပျမ်းမျှတို့အကြား ကွာခြားချက်များ၏ နှစ်ထပ်ကိန်းများ၏ ပေါင်းလဒ်ဖြစ်သည်။

ပြဿနာ ဥပမာ

ဆုံးဖြတ်ချက်ချမှတ်မှုကိန်းဂဏန်းတွက်ချက်မှုကို ပိုမိုနက်ရှိုင်းစွာနားလည်ရန် ဥပမာပြဿနာတစ်ခုကို ဆွေးနွေးကြပါစို့။

ပြဿနာ ဥပမာ:

ကျောင်းသား ၁၀ ယောက်ရဲ့ စာသင်ချိန် (X) နဲ့ စာမေးပွဲရမှတ် (Y) ဆိုင်ရာ အချက်အလက်တွေ ရှိတယ်လို့ ယူဆပါ-

| ကျောင်းသားများ | စာကျက်ချိန် (X) | စာမေးပွဲရမှတ် (Y) |
|——-|——————–|———————–|
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၉ | ၃ | ၆၂ |
| ၁၀ | ၄ | ၇၈ |

ကျွန်ုပ်တို့သည် စာမေးပွဲရမှတ် (Y) ကို လေ့လာချိန် (X) ပေါ်အခြေခံ၍ ခန့်မှန်းသည့် ရိုးရှင်းသော linear regression မော်ဒယ်တစ်ခုကို ဖန်တီးပါမည်။

ဆွေးနွေးချက်

၁။ ရိုးရှင်းသော Linear Regression Model တစ်ခုတည်ဆောက်ခြင်း

ရိုးရှင်းသော linear regression မော်ဒယ်တွင် အောက်ပါပုံစံရှိသည်-

\[ Y = a + bX \]

ဘယ်နေရာ:
– \( Y \) သည် ခန့်မှန်းစာမေးပွဲရမှတ်ဖြစ်သည်။
-\( X\) သည် လေ့လာချိန် အရေအတွက် ဖြစ်သည်။
–\( a \) သည် X = 0 ဖြစ်သောအခါ Y ဝင်ရိုးပေါ်ရှိ ဖြတ်မှတ် (intercept) ဖြစ်သည်။
– \( b \) သည် regression မျဉ်း၏ slope (inclination) ဖြစ်သည်။

ကန့်သတ်ချက်များ \(a \) နှင့် \(b \) ကိုတွက်ချက်ရန်၊ အောက်ပါဖော်မြူလာကို အသုံးပြုပါသည်။

\[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
\[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]

ဤတွင် \( n \) သည် ဒေတာအရေအတွက်ဖြစ်သည် (ဤကိစ္စတွင် n = 10)။

ဇယားကနေ ကျွန်တော်တို့ တွက်ချက်နိုင်ပါတယ်-
– \(\sum{X} = ၃၆\)
– \(\sum{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\sum{Y^2} = 50428\)
– \(\sum{XY} = ၂၅၇၆\)

b ကို အရင်တွက်ကြည့်ရအောင်။

\[ b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
\[ b = \frac{၂၅၇၆၀ – ၂၅၃၄၄}{၁၄၀၀ – ၁၂၉၆} \]
\[ b = \frac{416}{104} \]
\[ ခ = ၈ \]

ထို့နောက် ကျွန်ုပ်တို့ တွက်ချက်သည်မှာ-

\[ a = \frac{704 – 4(36)}{10} \]
\[ a = \frac{704 – 144}{10} \]
\[ a = \frac{560}{10} \]
\[ a = 56 \]

ဒါကြောင့် ကျွန်တော်တို့ရတဲ့ linear regression model က အောက်ပါအတိုင်းပါ။

\[ Y = ၅၆ + ၄X \]

၂။ ခန့်မှန်းတန်ဖိုး (Y') ကို တွက်ချက်ပါ။

ထို့နောက်၊ ကျွန်ုပ်တို့သည် \(X\) တစ်ခုစီအတွက် ခန့်မှန်းတန်ဖိုး \(Y'\) ကို တွက်ချက်ပါသည်-

| ကျောင်းသားများ | စာကျက်ချိန် (X) | စာမေးပွဲရမှတ် (Y) | ခန့်မှန်းရမှတ် (Y') |
|——-|——————–|———————–|————————-|
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၉ | ၃ | ၆၂ | \( ၅၆ + ၄(၃) = ၆၈ \) |
| ၁၀ | ၄ | ၇၈ | \( ၅၆ + ၄(၄) = ၇၂ \) |

၃။ SSR နှင့် SST တွက်ချက်ခြင်း

ထို့နောက် \(R^2\) ကို ရရှိစေရန် SSR နှင့် SST ကို တွက်ချက်ပါသည်။

SSR-

\[ SSR = \sum{(Y – Y')^2} \]
\[ SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
\[ SSR = ၃၆ + ၁၆ + ၄ + ၈၁ + ၄၉ + ၀ + ၀ + ၁၉၆ + ၃၆ + ၃၆ \]
\[ SSR = ၄၅၄ \]

SST:

\[ SST = \sum{(Y – \bar{Y})^2} \]
ဘယ်နေရာ:
\[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]

\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[ SST = ၁၅၃.၇၆ + ၄၀.၉၆ + ၀.၁၆ + ၂၁၃.၁၆ + ၁၇၈.၅၆ + ၅.၇၆ + ၂.၅၆ + ၃၈၄.၁၆ + ၇၀.၅၆ + ၅၇.၇၆ \]
\[ SST = ၁၁၀၇.၄၄ \]

၄။ ဆုံးဖြတ်မှုကိန်း \( R^2 \) တွက်ချက်ခြင်း-

\[ R^2 = 1 – \frac{SSR}{SST} \]
\[ R^2 = 1 – \frac{454}{1107.44} \]
\[ R^2 = 1 – 0.41 \]
\[ R^2 = 0.59 \]

နိဂုံး

အထက်ပါ တွက်ချက်မှုမှ၊ ကျွန်ုပ်တို့သည် ဆုံးဖြတ်ချက်ကိန်းဂဏန်း (R2 = 0.59) ကို ရရှိခဲ့ပါသည်။ ၎င်းက ကျွန်ုပ်တို့ ဖန်တီးထားသော linear regression မော်ဒယ်သည် လေ့လာမှုနာရီများအပေါ် အခြေခံ၍ စာမေးပွဲရမှတ်များ၏ ကွဲပြားမှု၏ ၅၉% ခန့်ကို ရှင်းပြနိုင်ကြောင်း ညွှန်ပြနေပါသည်။ ကျန်ရှိသော ကွဲပြားမှု၏ ၄၁% သည် မော်ဒယ်တွင် မပါဝင်သော အခြားအချက်များကြောင့် ဖြစ်နိုင်သည်။

အထက်ဖော်ပြပါ အဆင့်များနှင့် တွက်ချက်မှုများကို နားလည်ခြင်းအားဖြင့်၊ ကျွန်ုပ်တို့တည်ဆောက်ထားသော regression model သည် data များ၏ တကယ့်ပြောင်းလဲမှုကို မည်မျှကောင်းမွန်စွာ ရှင်းပြသည်ကို အကဲဖြတ်ရာတွင် coefficient of determination ၏ အရေးပါမှုကို ကျွန်ုပ်တို့ မြင်တွေ့နိုင်ပါသည်။ ၎င်းသည် စာရင်းအင်းခွဲခြမ်းစိတ်ဖြာမှုနှင့် data modeling တွင် အလွန်အသုံးဝင်သော tool တစ်ခုဖြစ်သည်။

မှတ်ချက်ရေးပါ