စာရင်းအင်းများတွင် ထည့်သွင်းစဉ်းစားခြင်းနည်းလမ်းများ
စာရင်းအင်းနှင့် အချက်အလက်ခွဲခြမ်းစိတ်ဖြာမှုလုပ်ငန်းစဉ်တွင် အချက်အလက်ပျောက်ဆုံးမှုပြဿနာသည် အမြဲတမ်းလိုလို ပေါ်ပေါက်လေ့ရှိသည်။ ဖြေဆိုသူများက မေးခွန်းအချို့ကို မဖြေဆိုခြင်း၊ မှတ်တမ်းတင်မှုအမှားများ၊ အာရုံခံကိရိယာဝင်ရောက်စွက်ဖက်မှု၊ ထုတ်ယူစဉ် အချက်အလက်ပျက်စီးခြင်း သို့မဟုတ် အပြည့်အဝမကိုက်ညီသော အချက်အလက်ရင်းမြစ်များစွာကို ပေါင်းစပ်ခြင်းလုပ်ငန်းစဉ်ကြောင့် အချက်အလက်ပျောက်ဆုံးနေနိုင်သည်။ ကောင်းစွာမကိုင်တွယ်ပါက အချက်အလက်ပျောက်ဆုံးခြင်းသည် ခွဲခြမ်းစိတ်ဖြာမှု၏ အရည်အသွေးကို ကျဆင်းစေပြီး စမ်းသပ်မှု၏စွမ်းအားကို လျော့ကျစေပြီး ဘက်လိုက်သော နိဂုံးချုပ်ချက်များကိုပင် ဖြစ်ပေါ်စေနိုင်သည်။ အချက်အလက်ပျောက်ဆုံးမှုကို ကိုင်တွယ်ရန် အသုံးအများဆုံးချဉ်းကပ်မှုများထဲမှတစ်ခုမှာ ရရှိနိုင်သောအချက်အလက်များအပေါ် အခြေခံ၍ ခန့်မှန်းတန်ဖိုးများဖြင့် ပျောက်ဆုံးနေသောတန်ဖိုးများကို ဖြည့်စွက်ခြင်းပါဝင်သည့် imputation ဖြစ်သည်။
ဘာကြောင့် Imputation က အရေးကြီးတာလဲ။
ပျောက်ဆုံးနေသောဒေတာကို ဖျက်ပစ်ခြင်းထက် imputation ကို မကြာခဏရွေးချယ်ရခြင်းအကြောင်းရင်းများစွာရှိပါသည်။ ပထမအချက်အနေဖြင့် ပျောက်ဆုံးနေသောတန်ဖိုးများပါ၀င်သော row/observations များကို ဖျက်ခြင်း (ဥပမာ၊ listwise deletion) သည် အထူးသဖြင့် ပျောက်ဆုံးနေသောဒေတာရာခိုင်နှုန်းသည် များပြားသည့်အခါ နမူနာအရွယ်အစားကို သိသိသာသာလျှော့ချနိုင်သည်။ ဒုတိယအချက်အနေဖြင့် ဒေတာသည် ကျပန်းပျောက်ဆုံးမနေပါက ဖျက်ပစ်ခြင်းသည် ဘက်လိုက်မှုကို ဖြစ်ပေါ်စေနိုင်သည်။ တတိယအချက်အနေဖြင့် စာရင်းအင်း သို့မဟုတ် စက်သင်ယူမှု အယ်လဂိုရီသမ်များစွာသည် ဒေတာအပြည့်အစုံလိုအပ်ပြီး imputation သည် အဆင်ပြေသော preprocessing အဆင့်တစ်ခုဖြစ်စေသည်။
သို့သော်၊ imputation ဆိုသည်မှာ "ကွက်လပ်များကို ဖြည့်ခြင်း" သက်သက်မဟုတ်ပါ။ ရွေးချယ်ထားသော နည်းလမ်းသည် ပျောက်ဆုံးနေသော data ယန္တရား၊ variable များ၏ဖွဲ့စည်းပုံနှင့် ခွဲခြမ်းစိတ်ဖြာမှု၏ ရည်ရွယ်ချက်များကို ထည့်သွင်းစဉ်းစားရမည်။ Imputation ညံ့ဖျင်းခြင်းသည် မော်ဒယ်ကို "လှည့်စား" နိုင်ပြီး၊ variance ကို လျှော့ချပေးနိုင်ပြီး ရလဒ်များကို အမှန်တကယ်ထက် ပိုမိုသေချာစေနိုင်သည်။
ပျောက်ဆုံးသွားသောဒေတာယန္တရား
စာရင်းအင်းဆိုင်ရာ စာပေများတွင် ပျောက်ဆုံးနေသော အချက်အလက်ကို အဓိက ယန္တရား သုံးခုအဖြစ် ခွဲခြားထားလေ့ရှိသည်-
၁။ MCAR (ကျပန်းတွင် လုံးဝပျောက်ဆုံးခြင်း): ဒေတာပျောက်ဆုံးနိုင်ခြေသည် မည်သည့် variable မဆို၊ တွေ့ရှိသည်ဖြစ်စေ၊ မတွေ့ရှိသည်ဖြစ်စေ မသက်ဆိုင်ပါ။ ဥပမာအားဖြင့် မတော်တဆမှုကြောင့် ပျက်စီးသွားသော မေးခွန်းလွှာ။
၂။ MAR (ကျပန်းတွင် ပျောက်ဆုံးခြင်း): ဒေတာပျောက်ဆုံးနိုင်ခြေသည် တွေ့ရှိရသည့် ကိန်းရှင်ပေါ်တွင် မူတည်သော်လည်း အခြားကိန်းရှင်များကို ထိန်းချုပ်ပြီးနောက် ပျောက်ဆုံးနေသော တန်ဖိုးပေါ်တွင် မူတည်ခြင်းမဟုတ်ပါ။ ဥပမာအားဖြင့်၊ ငယ်ရွယ်သော တုံ့ပြန်သူများသည် ဝင်ငွေမေးခွန်းများကို လွတ်သွားနိုင်ခြေ ပိုများသော်လည်း အသက်အရွယ် ရှိပါသည်။
၃။ MNAR (ကျပန်းမဟုတ်ဘဲ ပျောက်ဆုံးခြင်း): ဒေတာပျောက်ဆုံးနိုင်ခြေသည် ပျောက်ဆုံးနေသောတန်ဖိုးပေါ်တွင် မူတည်ပါသည်။ ဥပမာအားဖြင့်၊ ဝင်ငွေအလွန်မြင့်မားသူများသည် ၎င်းတို့၏ဝင်ငွေကို ထုတ်ဖော်ပြောဆိုလေ့မရှိပါ။
MCAR/MAR အောက်တွင် Imputation သည် ယေဘုယျအားဖြင့် ပိုမိုလုံခြုံပါသည်။ MNAR သည် မကြာခဏဆိုသလို ပျောက်ဆုံးနေသောဒေတာ သို့မဟုတ် sensitivity analysis ကို ရှင်းလင်းစွာထည့်သွင်းစဉ်းစားသည့် မော်ဒယ်တစ်ခု လိုအပ်ပါသည်။
ရိုးရှင်းသော စွပ်စွဲချက်နည်းလမ်း
၁။ ပျမ်းမျှ/အလယ်အလတ်/မုဒ် ပမာဏ တွက်ချက်မှု
အရိုးရှင်းဆုံးနည်းလမ်းကတော့ ပျောက်ဆုံးနေတဲ့တန်ဖိုးတွေကို ဂဏန်းကိန်းရှင်တွေအတွက် ပျမ်းမျှ ဒါမှမဟုတ် အလယ်အလတ်နဲ့ အစားထိုးဖို့နဲ့ အမျိုးအစားအလိုက် ကိန်းရှင်တွေအတွက် မုဒ်နဲ့ အစားထိုးဖို့ပါပဲ။ အားသာချက်တွေကတော့- လွယ်ကူမြန်ဆန်ပြီး မကြာခဏ အခြေခံအဖြစ် ဆောင်ရွက်ပေးပါတယ်။ အားနည်းချက်တွေကတော့- အထူးသဖြင့် ဒေတာက မညီမျှရင် ဒါမှမဟုတ် အပြင်အစွန်းတွေ ပါဝင်နေရင် variance ကို လျှော့ချပြီး ဒေတာဖြန့်ဖြူးမှုကို ပုံပျက်စေနိုင်ပါတယ်။ အလယ်အလတ်ဟာ ပျမ်းမျှထက် အပြင်အစွန်းတွေအတွက် ပိုပြီး ခိုင်မာပါတယ်။
၂။ အဆက်မပြတ် စွပ်စွဲခြင်း
ပျောက်ဆုံးနေသောတန်ဖိုးများကို ၀၊ -၁ ကဲ့သို့သော သီးခြားကိန်းသေတစ်ခု သို့မဟုတ် "မသိရ" အညွှန်းဖြင့် ဖြည့်ထားသည်။ တန်ဖိုးတွင် သီးခြားအဓိပ္ပာယ်တစ်ခုရှိသည့်အခါ (ဥပမာ "ငွေပေးငွေယူမရှိပါ") သို့မဟုတ် မော်ဒယ်တွင် ပျောက်ဆုံးမှုကို မီးမောင်းထိုးပြရန် အပိုညွှန်ပြချက်တစ်ခု ပေးရန် လိုအပ်သည့်အခါ ၎င်းသည် အသုံးဝင်ပါသည်။ သို့သော်၊ စိတ်ကြိုက်ကိန်းသေတစ်ခုကို ရွေးချယ်ခြင်းသည် မမှန်ကန်သောပုံစံများကို ဖြစ်ပေါ်စေနိုင်သည်။
၃။ Hot Deck Imputation
hot deck တွင်၊ အဓိက variable အများအပြားအပေါ်အခြေခံ၍ အခြား "ဆင်တူသော" လေ့လာတွေ့ရှိချက်များ (donors) မှ တန်ဖိုးများကို အသုံးပြု၍ ပျောက်ဆုံးနေသောတန်ဖိုးများကို ဖြည့်သည်။ ဤနည်းလမ်းသည် စစ်တမ်းများတွင် ရေပန်းစားသည်။ Hot decks များသည် အချက်အလက်၏ တကယ့်တန်ဖိုးများကို ဖမ်းယူသောကြောင့် လက်တွေ့ကျသောတန်ဖိုးများကို ထိန်းသိမ်းထားသော်လည်း ရလဒ်များသည် "ဆင်တူမှု" ၏ အဓိပ္ပာယ်ဖွင့်ဆိုချက်အပေါ် အာရုံခံနိုင်စွမ်းရှိပြီး နမူနာအကြား ကွဲပြားမှုကို ဖြစ်ပေါ်စေနိုင်သည်။
မော်ဒယ်အခြေပြု ဖြည့်စွက်ချက် နည်းလမ်း
၄။ နောက်ပြန်လှန်ထည့်သွင်းခြင်း
ပျောက်ဆုံးနေသောတန်ဖိုးများကို အခြား variable များမှရရှိသော regression model ကို အသုံးပြု၍ ခန့်မှန်းသည်။ numeric variable များအတွက် linear regression ကို အသုံးပြုနိုင်သည်။ categorical variable များအတွက် logistic သို့မဟုတ် multinomial regression ကို အသုံးပြုနိုင်သည်။ အားသာချက်မှာ variable များအကြား ဆက်နွယ်မှုများကို အသုံးချခြင်းဖြစ်သည်။ အားနည်းချက်မှာ deterministic predicted values များကိုသာ အသုံးပြုခြင်းသည် variance ကို လျှော့ချပေးလေ့ရှိသည်၊ အဘယ်ကြောင့်ဆိုသော် imputed value အားလုံးသည် prediction line ပေါ်တွင် တိတိကျကျ ကျရောက်သောကြောင့်ဖြစ်သည်။ ၎င်းကိုဖြေရှင်းရန်အတွက် random components များ (ဥပမာ၊ residuals) ကို ပိုမိုလက်တွေ့ကျစေရန် မကြာခဏ ထည့်သွင်းလေ့ရှိသည်။
၅။ k- အနီးဆုံးအိမ်နီးချင်းများ (kNN) ပမာဏသတ်မှတ်ခြင်း
kNN နည်းလမ်းသည် အနီးဆုံးအိမ်နီးချင်း k ၏ ပျမ်းမျှ (သို့မဟုတ် မဲပေးခြင်း) ကို အခြေခံ၍ ပျောက်ဆုံးနေသောတန်ဖိုးများကို ဖြည့်ဆည်းပေးသည်။ ဒေတာကို ပုံမှန်ဖြစ်အောင်ပြုလုပ်ပြီးနောက် နီးကပ်မှုကို Euclidean အကွာအဝေး သို့မဟုတ် အခြားမက်ထရစ်ဖြင့် တိုင်းတာလေ့ရှိသည်။ ၎င်း၏ အားသာချက်များတွင် ပြောင်းလွယ်ပြင်လွယ်ရှိမှုနှင့် မျဉ်းဖြောင့်ဆက်နွယ်မှုမရှိဟု ယူဆခြင်းတို့ ပါဝင်သည်။ အားနည်းချက်များတွင် ဒေတာအစုကြီးများအတွက် တွက်ချက်မှုကုန်ကျစရိတ်မြင့်မားခြင်း၊ variable scale ကို အာရုံခံနိုင်စွမ်းနှင့် မြင့်မားသောအတိုင်းအတာဒေတာတွင် စွမ်းဆောင်ရည်ကျဆင်းခြင်း (အတိုင်းအတာ၏ကျိန်စာ) တို့ ပါဝင်သည်။
၆။ မျှော်လင့်ချက်-အမြင့်ဆုံးဖြစ်အောင်လုပ်ဆောင်ခြင်း (EM)
EM ချဉ်းကပ်မှုသည် ပျောက်ဆုံးနေသောတန်ဖိုးများကို latent variable များအဖြစ်သတ်မှတ်ခြင်းဖြင့် မော်ဒယ် parameter များ (ဥပမာ၊ multivariate normal data အတွက် covariance နှင့် covariance) ကို ခန့်မှန်းသည်။ အဆင့် E သည် လက်ရှိ parameter များအပေါ်အခြေခံ၍ ပျောက်ဆုံးနေသောတန်ဖိုးများ၏မျှော်လင့်ချက်ကို ထပ်ခါတလဲလဲတွက်ချက်ပြီးနောက် အဆင့် M သည် မျှော်မှန်းထားသော "ပြီးပြည့်စုံသော" data များအပေါ်အခြေခံ၍ parameter များကို အပ်ဒိတ်လုပ်သည်။ EM သည် ဖြန့်ဖြူးမှုဆိုင်ရာယူဆချက်အချို့အတွက် ခိုင်မာသော်လည်း ရှုပ်ထွေးနိုင်ပြီး မော်ဒယ်ယူဆချက်များ၏ မှန်ကန်မှုပေါ်တွင် မူတည်သည်။
ဘက်ပေါင်းစုံစွပ်စွဲချက်- ကိစ္စများစွာတွင် ရွှေစံနှုန်း
၇။ ဘက်စုံစွပ်စွဲချက် (MI)
Multiple Imputation ကို MAR အတွက် အခြေခံအကျဆုံး ချဉ်းကပ်မှုများထဲမှ တစ်ခုအဖြစ် သတ်မှတ်ကြသည်။ ပြီးပြည့်စုံသော dataset တစ်ခုတည်းကို ထုတ်လုပ်မည့်အစား MI သည် မသေချာမှုကို ထင်ဟပ်စေသော မတူညီသော imputation များဖြင့် dataset များစွာ (ဥပမာ ၅-၂၀) ကို ထုတ်လုပ်သည်။ dataset တစ်ခုစီကို သီးခြားစီ ခွဲခြမ်းစိတ်ဖြာပြီးနောက် ရလဒ်များကို Rubin ၏ စည်းမျဉ်းများကို အသုံးပြု၍ ပေါင်းစပ်ကာ ပိုမိုမှန်ကန်သော ခန့်မှန်းချက်များနှင့် စံအမှားများ ရရှိရန် ပြုလုပ်သည်။
MI အားသာချက်များ-
- စွပ်စွဲချက် မရေမရာမှုကို လက်ခံသည်။
– စာရင်းအင်းဆိုင်ရာ ကောက်ချက်ချခြင်း (ယုံကြည်မှုကြားကာလများ၊ ယူဆချက်စမ်းသပ်မှု) အတွက် ပိုမိုတိကျမှန်ကန်မှု။
- ကွဲပြားသော variable အမျိုးအစားများအတွက် ပြောင်းလွယ်ပြင်လွယ်ရှိသည်။
၎င်း၏ ကန့်သတ်ချက်များ-
- ပိုမိုရှုပ်ထွေးသော အကောင်အထည်ဖော်မှု။
- လုံလောက်သော ယူဆချက်များနှင့် စွပ်စွဲချက်ပုံစံ သတ်မှတ်ချက်များ လိုအပ်သည်။
– MNAR တွင် ပျောက်ဆုံးနေပါက၊ စံ MI သည် ဘက်လိုက်နေနိုင်ဆဲဖြစ်သည်။
အချိန်စီးရီးနှင့် နေရာဒေသဆိုင်ရာဒေတာအတွက် ထည့်သွင်းစဉ်းစားခြင်း
အချိန်စီးရီးဒေတာတွင်၊ ပျောက်ဆုံးနေသောတန်ဖိုးများသည် ၎င်းတို့၏ ရှေ့နှင့် နောက်ဆက်တွဲတန်ဖိုးများနှင့် အပြင်းအထန်ဆက်စပ်နေလေ့ရှိသည်။ linear interpolation၊ splines၊ Kalman filters သို့မဟုတ် ARIMA/State Space မော်ဒယ်များကဲ့သို့သော နည်းလမ်းများကို မကြာခဏအသုံးပြုလေ့ရှိသည်။ spatial data အတွက်၊ kriging နှင့် spatial မော်ဒယ်များကဲ့သို့သော ချဉ်းကပ်မှုများသည် ပထဝီဝင်နီးကပ်မှုကို အသုံးချနိုင်သည်။ ဤနည်းလမ်းများသည် အချိန်/နေရာဖွဲ့စည်းပုံ လွှမ်းမိုးနေသည့်အခါ ထိရောက်မှုရှိသော်လည်း၊ ရိုးရှင်းသော interpolation ကို လမ်းလွဲစေနိုင်သည့် ရုတ်တရက်ပြောင်းလဲမှုများ (ဥပမာ၊ စီးပွားရေးရှော့ခ်များ) ကို သတိထားရမည်။
စွပ်စွဲနည်းလမ်းများ ရွေးချယ်ရာတွင် ကောင်းမွန်သော အလေ့အကျင့်များ
၁။ ပျောက်ဆုံးနေသောဒေတာရှာဖွေမှုကို ဆောင်ရွက်ခြင်း- ပျောက်ဆုံးနေသောတန်ဖိုးများ၏ ရာခိုင်နှုန်း၊ ပျောက်ဆုံးမှုပုံစံနှင့် ပျောက်ဆုံးမှုသည် သတ်မှတ်ထားသော ကိန်းရှင်တစ်ခုနှင့် ဆက်စပ်မှုရှိမရှိ စစ်ဆေးပါ။
၂။ လေ့ကျင့်ရေးနှင့် စမ်းသပ်မှုဒေတာကို သီးခြားခွဲထားပါ- လေ့ကျင့်ရေးဒေတာမှသာ “သင်ယူခြင်း” ဖြင့် imputation ကို လုပ်ဆောင်ပါ၊ ထို့နောက် ဒေတာယိုစိမ့်မှုကို ရှောင်ရှားရန် စမ်းသပ်ဒေတာတွင် အသုံးချပါ။
၃။ variable အမျိုးအစားကို ထည့်သွင်းစဉ်းစားပါ- numeric၊ categorical၊ ordinal သို့မဟုတ် mixed၊ သင့်လျော်သောနည်းလမ်းကွဲပြားသည်။
၄။ ပျောက်ဆုံးမှုညွှန်ပြချက်များကို အသုံးပြုပါ- တစ်ခါတစ်ရံတွင် တန်ဖိုးတစ်ခု ပျောက်ဆုံးနေကြောင်း အချက်အလက်သည် ၎င်းကိုယ်တိုင်က ခန့်မှန်းချက်တစ်ခုဖြစ်သည်။ အညွှန်းကိန်းများ ထည့်သွင်းခြင်းသည် ခန့်မှန်းမော်ဒယ်၏ စွမ်းဆောင်ရည်ကို တိုးတက်စေနိုင်သည်။
၅။ ဖြည့်စွက်ချက်၏ သက်ရောက်မှုကို အကဲဖြတ်ပါ- ဖြည့်စွက်ချက် မပြုမီ/ပြုလုပ်ပြီးနောက် ဖြန့်ဖြူးမှုများကို နှိုင်းယှဉ်ပါ၊ ကွဲလွဲမှု လျော့နည်းသွားခြင်း ရှိ၊ မရှိ စစ်ဆေးပါ၊ ထို့နောက် မော်ဒယ်ကို အတည်ပြုပါ။
၆။ ကောက်ချက်ချရန်အတွက် MI ကို ဦးစားပေးပါ- ခွဲခြမ်းစိတ်ဖြာမှု၏ ရည်မှန်းချက်မှာ ကန့်သတ်ချက်ခန့်မှန်းချက်နှင့် စာရင်းအင်းစမ်းသပ်မှုဖြစ်သည့်အခါ၊ တစ်ကြိမ်တည်းထည့်သွင်းစဉ်းစားခြင်းထက် အကြိမ်များစွာထည့်သွင်းစဉ်းစားခြင်းသည် ပိုမိုသင့်လျော်လေ့ရှိသည်။
နိဂုံး
ပျောက်ဆုံးနေသောဒေတာကိုကိုင်တွယ်ရန်အတွက် ခေတ်သစ်စာရင်းအင်းလုပ်ငန်းစဉ်များ၏ အရေးကြီးသောအစိတ်အပိုင်းတစ်ခုဖြစ်သည်။ ပျမ်းမျှ/အလယ်အလတ်ကဲ့သို့သော ရိုးရှင်းသောနည်းလမ်းများသည် အခြေခံအဖြစ် သို့မဟုတ် သေးငယ်သောပျောက်ဆုံးမှုများအတွက် အသုံးဝင်နိုင်သော်လည်း ဒေတာဖွဲ့စည်းပုံနှင့် မသေချာမရေရာမှုများကို မကြာခဏထိခိုက်စေလေ့ရှိသည်။ regression၊ kNN နှင့် EM ကဲ့သို့သော မော်ဒယ်အခြေပြုနည်းလမ်းများသည် variable များအကြား ဆက်ဆံရေးကို အသုံးချပြီး Multiple Imputation သည် မသေချာမရေရာမှုကို ထည့်သွင်းစဉ်းစားခြင်းဖြင့် ကောက်ချက်ချရန်အတွက် ခိုင်မာသောမူဘောင်တစ်ခုကို ပေးစွမ်းသည်။ အကောင်းဆုံးနည်းလမ်းရွေးချယ်မှုသည် ပျောက်ဆုံးနေသောဒေတာယန္တရား (MCAR/MAR/MNAR)၊ ခွဲခြမ်းစိတ်ဖြာမှုရည်မှန်းချက် (ခန့်မှန်းချက် vs. ကောက်ချက်ချခြင်း) နှင့် ဒေတာ၏ဝိသေသလက္ခဏာများ (အချိန်စီးရီး၊ နေရာ၊ ရောနှော) တို့ပေါ်တွင် မူတည်သည်။ မှန်ကန်သောချဉ်းကပ်မှုဖြင့် ကောက်ချက်ချခြင်းသည် ခွဲခြမ်းစိတ်ဖြာမှု၏ သမာဓိကို ထိန်းသိမ်းရန်နှင့် ပိုမိုယုံကြည်စိတ်ချရသော နိဂုံးချုပ်ချက်များကို ရရှိစေရန် ကူညီပေးသည်။