အမျိုးအစားခွဲခြမ်းစိတ်ဖြာနည်း

အမျိုးအစားခွဲခြမ်းစိတ်ဖြာနည်း

အမျိုးအစားခွဲဒေတာသည် သုတေသန၊ စီးပွားရေး၊ စျေးကွက်ရှာဖွေရေး၊ ကျန်းမာရေး၊ ပညာရေးနှင့် ဖောက်သည်ကျေနပ်မှုစစ်တမ်းများတွင်ပင် တွေ့ရှိရသော အသုံးအများဆုံးဒေတာအမျိုးအစားများထဲမှ တစ်ခုဖြစ်သည်။ ပျမ်းမျှ သို့မဟုတ် စံသွေဖည်မှုကို အသုံးပြု၍ တွက်ချက်နိုင်သော ဂဏန်းဒေတာ (ဥပမာ၊ အသက်၊ အရပ်၊ ဝင်ငွေ) နှင့်မတူဘဲ၊ အမျိုးအစားခွဲဒေတာတွင် "အမျိုးသား/အမျိုးသမီး"၊ "သဘောတူ/သဘောမတူ"၊ "က/ခ/ဂ" သို့မဟုတ် "ကျေနပ်/ကြားနေ/မကျေနပ်" ကဲ့သို့သော အညွှန်းများ သို့မဟုတ် အုပ်စုများ ပါဝင်သည်။ ၎င်း၏ အမျိုးအစားခွဲသဘောသဘာဝကြောင့် ခွဲခြမ်းစိတ်ဖြာနည်းစနစ်များသည် သီးခြားချဉ်းကပ်မှုများ လိုအပ်သည်။ ဤဆောင်းပါးသည် အမျိုးအစားခွဲဒေတာကို ထိရောက်စွာ ခွဲခြမ်းစိတ်ဖြာရန်အတွက် လက်တွေ့ကျသော အဆင့်များနှင့် အသုံးများသောနည်းလမ်းများကို ဆွေးနွေးထားသည်။

၁။ အမျိုးအစားအလိုက် ဒေတာအမျိုးအစားများကို နားလည်ခြင်း

ခွဲခြမ်းစိတ်ဖြာမှုမပြုမီ၊ သင့်တွင်ရှိသော အမျိုးအစားခွဲခြားထားသောဒေတာအမျိုးအစားကို ဦးစွာနားလည်ပါ။ ယေဘုယျအားဖြင့် အမျိုးအစားနှစ်မျိုးရှိသည်-

၁) အမည်ခံ
အမျိုးအစားများတွင် အစီအစဉ်မရှိပါ။ ဥပမာ- ကျား၊ မ၊ အကြိုက်ဆုံးအရောင်၊ ထုတ်ကုန်အမှတ်တံဆိပ်၊ နေထိုင်ရာဒေသ။

၂) အစဉ်လိုက်
အမျိုးအစားများတွင် အစီအစဉ် သို့မဟုတ် အဆင့်ရှိသည်။ ဥပမာ- စိတ်ကျေနပ်မှုအဆင့် (မကျေနပ်ပါ - အသင့်အတင့် - ကျေနပ်သည်)၊ ပညာရေးအဆင့် (အထက်တန်းကျောင်း - ဘွဲ့ကြို - မဟာဘွဲ့)၊ Likert စကေး (လုံးဝသဘောမတူပါ - လုံးဝသဘောတူသည်)။

ဤခွဲခြားချက်သည် အရေးကြီးပါသည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းသည် သင့်လျော်သော ခွဲခြမ်းစိတ်ဖြာနည်းစနစ်များကို သက်ရောက်မှုရှိသောကြောင့်ဖြစ်သည်။ အစဉ်လိုက်ဒေတာကို ၎င်း၏အစီအစဉ်ကို ထည့်သွင်းစဉ်းစားခြင်းဖြင့် ခွဲခြမ်းစိတ်ဖြာနိုင်သော်လည်း၊ အမည်ခံဒေတာကို မထည့်သွင်းစဉ်းစားပါ။

၂။ ဒေတာပြင်ဆင်ခြင်း- ကုဒ်များ၊ အညွှန်းများနှင့် ဒေတာသန့်ရှင်းမှု

ကောင်းမွန်သော ခွဲခြမ်းစိတ်ဖြာမှုမှာ အမြဲတမ်း စနစ်တကျစီစဉ်ထားသော အချက်အလက်များဖြင့် စတင်ပါသည်။ အကြံပြုထားသော ပြင်ဆင်မှုအဆင့်များ-

– အမျိုးအစားရေးသားခြင်းကို စံသတ်မှတ်ခြင်း- ဥပမာအားဖြင့် “အမျိုးသား” နှင့် “ယောက်ျားလေး” ကို ကွဲပြားသော အမျိုးအစားများအဖြစ် မသတ်မှတ်စေရန် ပေါင်းစပ်ရမည်။
– ပျောက်ဆုံးနေသော တန်ဖိုးများကို ကိုင်တွယ်ပါ- “မဖြေပါ” ကဲ့သို့သော သီးခြားအမျိုးအစားကို ဖျက်ပစ်ရန်၊ ထည့်သွင်းရန် သို့မဟုတ် ဖန်တီးရန် ဆုံးဖြတ်ပါ။
– လိုအပ်ပါက ကုဒ်ရေးသားပါ- ဥပမာ- သဘောတူ=၄၊ ကြားနေ=၃၊ သဘောမတူ=၂။ အမည်ခံတန်ဖိုးများအတွက် ဂဏန်းကုဒ်သည် အညွှန်းတစ်ခုသာဖြစ်ပြီး သင်္ချာတန်ဖိုးမဟုတ်ပါ။
– ရှားပါးလွန်းသော အမျိုးအစားများကို စစ်ဆေးပါ- ကြိမ်နှုန်းအလွန်နိမ့်သော အမျိုးအစားများသည် ခွဲခြမ်းစိတ်ဖြာမှုကို အနှောင့်အယှက်ဖြစ်စေနိုင်သည်။ တစ်ခါတစ်ရံတွင် ပိုမိုတည်ငြိမ်သောရလဒ်များရရှိရန် ၎င်းတို့ကို ပေါင်းစပ်ရန် လိုအပ်ပါသည်။

ဖတ်ရန်  ဥပဒေဆိုင်ရာ စာရင်းအင်းများ

၃။ ဖော်ပြချက်ခွဲခြမ်းစိတ်ဖြာမှု- ကြိမ်နှုန်းနှင့် အချိုးအစား

အမျိုးအစားအလိုက်ဒေတာအတွက် အခြေခံအကျဆုံးနှင့် အရေးကြီးဆုံးနည်းလမ်းမှာ တွက်ချက်ရန်ဖြစ်သည်-

– ကြိမ်နှုန်း- အမျိုးအစားတစ်ခုစီတွင် တုံ့ပြန်သူ/လေ့လာတွေ့ရှိချက် အရေအတွက်။
– အချိုး သို့မဟုတ် ရာခိုင်နှုန်း- ကြိမ်နှုန်းကို စုစုပေါင်းဒေတာဖြင့် စားခြင်း။

ရိုးရှင်းသော ဥပမာတစ်ခု- တုံ့ပြန်သူ ၂၀၀ တွင် ၁၂၀ ဦးက “ကျေနပ်သည်”၊ ၅၀ ဦးက “ကြားနေ” နှင့် ၃၀ ဦးက “မကျေနပ်” ဟူ၍ အသီးသီး အသီးသီး အသီးသီး ဖြေဆိုခဲ့ကြသည်။ ကျေနပ်မှု ရှိသူ ရာခိုင်နှုန်းမှာ ၆၀% ဖြစ်သည်။

ဖော်ပြချက် ခွဲခြမ်းစိတ်ဖြာမှုသည် အမျိုးအစားများ ဖြန့်ဖြူးမှု၏ ကနဦးခြုံငုံသုံးသပ်ချက်ကို ပေးစွမ်းသည်။ မကြာခဏဆိုသလို အရေးကြီးသော တွေ့ရှိချက်များကို ဤနေရာတွင် ဖော်ထုတ်လေ့ရှိသည်- လွှမ်းမိုးသော အမျိုးအစားများ၊ အုပ်စုများအကြား ဖွဲ့စည်းမှု ကွဲပြားချက်များ သို့မဟုတ် ၎င်းတို့၏ အရေအတွက် နည်းပါးခြင်း သို့မဟုတ် များပြားခြင်းကြောင့် "ထူးဆန်းသော" အမျိုးအစားများ ရှိနေခြင်း။

၄။ အမျိုးအစားအလိုက်ဒေတာအတွက် သင့်လျော်သော မြင်ယောင်မှု

မြင်ယောင်ပုံဖော်မှုများသည် စာဖတ်သူများအား ပုံစံများကို လျင်မြန်စွာ နားလည်ရန် ကူညီပေးသည်။ အဖြစ်များသော ဇယားများ-

– ဘားဇယား (ဘားပုံ): အမည်ခံနှင့် အစဉ်လိုက်အတွက် အသင့်တော်ဆုံး။
– အထပ်လိုက်ဘားဇယား (အထပ်လိုက်ဘားများ): အုပ်စုများစွာတွင် အမျိုးအစားဖွဲ့စည်းမှုကို နှိုင်းယှဉ်ရန်အတွက် ကောင်းမွန်ပါသည်၊ ဥပမာအားဖြင့် ဌာနခွဲတစ်ခုစီ၏ စိတ်ကျေနပ်မှု။
– စက်ဝိုင်းဇယား- အသုံးပြုနိုင်ပါသည်၊ သို့သော် အမျိုးအစားများစွာ သို့မဟုတ် ကွာခြားချက်အနည်းငယ်ရှိပါက ထိရောက်မှုနည်းပါသည်။
– Mosaic plot: အမျိုးအစားခွဲခြားထားသော variable နှစ်ခုကြား ဆက်နွယ်မှုကို ကြည့်ရှုရန်အတွက် အသုံးဝင်သည်။
– Pareto ဇယား- အမြင့်ဆုံးမှ အနိမ့်ဆုံးကြိမ်နှုန်းအထိ အစီအစဉ်တကျရှိသော ဘားဇယားတစ်ခုဖြစ်ပြီး ပြဿနာဦးစားပေး ခွဲခြမ်းစိတ်ဖြာမှုအတွက် မကြာခဏအသုံးပြုလေ့ရှိသည်။

အကြံပြုချက်- အစဉ်လိုက်ဒေတာအတွက်၊ အမျိုးအစားများကို အက္ခရာစဉ်အလိုက် မဟုတ်ဘဲ အဆင့်အလိုက် စီပါ (ဥပမာ၊ “လုံးဝသဘောမတူ” မှ “လုံးဝသဘောတူ” အထိ)။

၅။ Crosstab တစ်ခု ဖန်တီးခြင်း

အမျိုးအစားခွဲခြားထားသော variable နှစ်ခုကြား ဆက်နွယ်မှုကို သင်မြင်လိုပါက crosstab ကို အသုံးပြုပါ။ ဥပမာအားဖြင့် “ကျား/မ” နှင့် “ထုတ်ကုန်ဦးစားပေးမှု” သို့မဟုတ် “ဒေသ” နှင့် “ဝယ်ယူမှုအခြေအနေ” အကြား ဆက်နွယ်မှု။

Crosstabulation သည် အမျိုးအစားများ ပေါင်းစပ်မှုတစ်ခုတွင် မည်မျှသော လေ့လာတွေ့ရှိချက်များ ပါဝင်သည်ကို ပြသသည့် ဇယားတစ်ခုကို ထုတ်လုပ်ပေးသည်။ သင် အောက်ပါတို့ကို ထည့်သွင်းနိုင်သည်-

– တစ်တန်းလျှင် ရာခိုင်နှုန်း- တစ်တန်းစီရှိ ကော်လံအမျိုးအစားများ ဖြန့်ဖြူးမှုကို အဓိကထားသည်။
– ကော်လံတစ်ခုလျှင် ရာခိုင်နှုန်း- ကော်လံတစ်ခုစီရှိ အတန်းအမျိုးအစားများ ဖြန့်ဖြူးမှုကို အဓိကထားသည်။
– စုစုပေါင်း၏ ရာခိုင်နှုန်း- စုစုပေါင်းတွင် ဆဲလ်တစ်ခုစီ၏ ပံ့ပိုးကူညီမှု။

ဖတ်ရန်  စာရင်းအင်းဒေတာ ခွဲခြမ်းစိတ်ဖြာမှု နည်းစနစ်များ

Crosstab များသည် ဖော်ပြချက်ဆိုင်ရာ စမ်းသပ်မှုများနှင့် စာရင်းအင်းဆိုင်ရာ စမ်းသပ်မှုများအကြား “တံတား” အဖြစ် မကြာခဏ ဆောင်ရွက်လေ့ရှိသည်။

၆။ လွတ်လပ်ရေးအတွက် Chi-Square စမ်းသပ်မှု

အမျိုးအစားခွဲခြားထားသော ကိန်းရှင်နှစ်ခုသည် ဆက်စပ်နေသလား သို့မဟုတ် လွတ်လပ်နေသလားကို စမ်းသပ်ရန်အတွက် အသုံးအများဆုံးစမ်းသပ်မှုမှာ Chi-Square (χ²) လွတ်လပ်မှုစမ်းသပ်မှုဖြစ်သည်။ ယူဆချက်မှာ-

– H0: ဆက်နွယ်မှုမရှိ (လွတ်လပ်သည်)
– H1: ဆက်နွယ်မှုတစ်ခုရှိသည် (လွတ်လပ်မှုမရှိ)

p-တန်ဖိုးသည် အရေးပါမှုအဆင့် < (ဥပမာ 0,05) ဖြစ်ပါက၊ variable နှစ်ခုကြား ဆက်နွယ်မှုရှိကြောင်း အထောက်အထားရှိပါသည်။ အရေးကြီးသော မှတ်ချက်အချို့- - chi-square စမ်းသပ်မှုသည် အထူးသဖြင့် မျှော်မှန်းထားသော ကြိမ်နှုန်းတွင် လုံလောက်သော ဒေတာပမာဏ လိုအပ်သည်။ မျှော်မှန်းထားသော အရေအတွက်နည်းသော ဆဲလ်များ အလွန်များပြားပါက စမ်းသပ်မှုရလဒ်များသည် မမှန်ကန်ပါ။ - နမူနာသည် သေးငယ်ပါက Fisher's Exact Test (အထူးသဖြင့် 2x2 ဇယားများအတွက်) ကို ထည့်သွင်းစဉ်းစားပါ။ ၇။ ဆက်နွယ်မှု၏ အစွမ်းသတ္တိကို တိုင်းတာခြင်း- Cramér's V နှင့် Phi chi-square စမ်းသပ်မှုသည် ဆက်နွယ်မှုတစ်ခု ရှိမရှိကို ညွှန်ပြသော်လည်း မည်မျှအားကောင်းကြောင်း မပြောပြပါ။ ဤရည်ရွယ်ချက်အတွက်၊ အကျိုးသက်ရောက်မှု အရွယ်အစားများကို အသုံးပြုသည်- - Phi (φ): 2x2 ဇယားများအတွက်။ - Cramér's V: 2x2 ထက်ကြီးသော ဇယားများအတွက်။ Cramér's V သည် 0–1 အထိရှိသည်- - 0 နှင့်နီးစပ်သည်- အားနည်းသော ဆက်နွယ်မှု - 1 နှင့်နီးစပ်သည်- ခိုင်မာသော ဆက်နွယ်မှု အစီရင်ခံစာတွင်၊ ပြည့်စုံသော အဓိပ္ပာယ်ဖွင့်ဆိုချက်အတွက် p-တန်ဖိုးနှင့် အကျိုးသက်ရောက်မှု အရွယ်အစားကို ဖော်ပြပါ။ ၈။ အစဉ်လိုက်ဒေတာအတွက် ခွဲခြမ်းစိတ်ဖြာခြင်း- အဆင့်ဆက်စပ်မှုနှင့် လမ်းကြောင်းစမ်းသပ်မှုများ သင်၏ အမျိုးအစားအလိုက်ဒေတာသည် အစဉ်လိုက်ဖြစ်ပါက၊ အစီအစဉ်တကျထည့်သွင်းစဉ်းစားသည့် ချဉ်းကပ်မှုများကို သင်အသုံးပြုနိုင်သည်၊ ဥပမာ- - Spearman အဆင့်ဆက်စပ်မှု (အစဉ်လိုက်ကိန်းရှင်နှစ်ခု သို့မဟုတ် အစဉ်လိုက် vs. ပုံမှန်မဟုတ်သော ဂဏန်းများအတွက်) - Kendall's tau (Spearman ၏ ရွေးချယ်စရာ၊ နမူနာအနည်းငယ်အတွက် မကြာခဏတည်ငြိမ်သည်) - တိုးတက်မှု/လျော့နည်းသွားသော ပုံစံတသမတ်တည်းရှိမရှိ ကြည့်ရှုရန် အခြေအနေဇယားများရှိ လမ်းကြောင်းစမ်းသပ်မှုများ။ ဥပမာ- ပညာရေးအဆင့် (အထက်တန်းကျောင်း-ဘွဲ့ကြို-မဟာဘွဲ့-ပါရဂူဘွဲ့) သည် သဘောတူညီချက်အဆင့်များ (၁-၅) နှင့် တိုးလာသောပုံစံတွင် ဆက်စပ်နေပါသလား။ ၉။ ခန့်မှန်းမော်ဒယ်များ- လော့ဂျစ်ဆုတ်ယုတ်မှု သင်၏ရည်မှန်းချက်သည် ဆက်နွယ်မှုကိုကြည့်ရှုရန်သာမက အခြားကိန်းရှင်များအပေါ်အခြေခံ၍ အမျိုးအစားများကို ခန့်မှန်းရန်ဖြစ်ပါက၊ ဆုတ်ယုတ်မှုကို အသုံးပြုပါ-

ဖတ်ရန်  အပြုသဘောနှင့် အနုတ်လက္ခဏာဆောင်သော ဂဏန်းများကို အသုံးပြု၍ ဒေတာတင်ပြခြင်းနည်းစနစ်များ
- Binary logistic regression: အမျိုးအစားနှစ်ခုပါ output အတွက် (ဥပမာ "ဝယ်ပါ" vs. "မဝယ်ပါ")။ - Multinomial logistic regression: အစီအစဉ်မကျသော အမျိုးအစားနှစ်ခုထက်ပိုသော output အတွက် (ဥပမာ "Package A/B/C")။ - Ordinal logistic regression: အစီအစဉ်တကျ categorical output အတွက် (ဥပမာ၊ ကျေနပ်မှု ၁–၅)။ logistic regression ၏ အားသာချက်- သင်သည် တစ်ပြိုင်နက်တည်း ခန့်မှန်းသူများစွာ (အသက်၊ တည်နေရာ၊ စျေးကွက်ရှာဖွေရေးလမ်းကြောင်း) ကို ထည့်သွင်းနိုင်ပြီး odds ratio-based interpretation ကို ရယူနိုင်သည်၊ ဥပမာ "ဝယ်ယူမှုဖြစ်နိုင်ခြေသည် အုပ်စု X တွင် ၁.၈ ဆ တိုးလာသည်"။ ၁၀။ ရလဒ်များကို အဓိပ္ပာယ်ဖွင့်ဆိုခြင်းနှင့် နိဂုံးချုပ်များ ရေးသားခြင်း ကောင်းမွန်သော categorical data analysis သည် ကိန်းဂဏန်းများထက် ကျော်လွန်သော်လည်း သုတေသနမေးခွန်းကို ရှင်းရှင်းလင်းလင်း ဖြေကြားပေးသည်။ နိဂုံးချုပ်များ ရေးသားသည့်အခါ- - အဓိကဖြန့်ဖြူးမှုကို ဖော်ပြပါ (ဥပမာ၊ "တုံ့ပြန်သူ ၆၀% ကျေနပ်သည်")။ - ဆက်စပ်မှုစမ်းသပ်မှုတစ်ခုရှိပါက p-value နှင့် effect size (ဥပမာ၊ Cramér's V) ကို တင်ပြပါ။ - လက်တွေ့ကျသော အရေးပါမှုကို ရှင်းပြပါ- မူဝါဒ၊ စျေးကွက်ရှာဖွေရေး မဟာဗျူဟာ သို့မဟုတ် အဖွဲ့အစည်းဆိုင်ရာ ဆုံးဖြတ်ချက်များအတွက် ကွာခြားချက်သည် အရေးကြီးခြင်း ရှိ၊ မရှိကို ရှင်းပြပါ။ - ဒေတာများသည် လေ့လာတွေ့ရှိချက်များဖြစ်ပါက အကြောင်းရင်းဆက်စပ်မှုဆိုင်ရာ ပြောဆိုချက်များကို ရှောင်ကြဉ်ပါ။ ဆက်စပ်မှုသည် အမြဲတမ်း အကြောင်းရင်းဆက်စပ်မှုကို ဆိုလိုခြင်း မဟုတ်ပါ။ အမျိုးအစားအလိုက် ဒေတာများကို ခွဲခြမ်းစိတ်ဖြာရန်အတွက် ဒေတာအမျိုးအစားများ (nominal vs. ordinal) ကို နားလည်ခြင်း၊ ကြိမ်နှုန်းများကို ရှင်းလင်းစွာ ဖော်ပြချက်၊ သင့်လျော်သော မြင်ယောင်မှု၊ cross-tabulation နှင့် chi-square နှင့် Cramér's V ကဲ့သို့သော effect size များကဲ့သို့သော စာရင်းအင်းစမ်းသပ်မှုများ လိုအပ်သည်။ ခန့်မှန်းချက် ရည်ရွယ်ချက်အတွက် logistic regression သည် အလွန်အစွမ်းထက်သော ကိရိယာတစ်ခုဖြစ်သည်။ ဤအဆင့်များဖြင့် label လုပ်ထားသော ဒေတာကို ဆုံးဖြတ်ချက်ချရာတွင် အသုံးဝင်သော စာရင်းအင်းအရ ကောင်းမွန်သော အသိအမြင်များအဖြစ်သို့ ပြောင်းလဲနိုင်သည်။ သင်အလိုရှိပါက သင်၏ dataset သို့မဟုတ် case study ကို အခြေခံ၍ နမူနာ ခွဲခြမ်းစိတ်ဖြာမှုတစ်ခု ဖန်တီးရန် (ဥပမာ Excel၊ SPSS၊ R သို့မဟုတ် Python ကို အသုံးပြု၍) ကျွန်ုပ် ကူညီပေးနိုင်ပါသည်။

မှတ်ချက်ရေးပါ