မုဒ်နှင့် မီဒီယံ- စာရင်းအင်းများတွင် ရှင်းလင်းချက်နှင့် အသုံးချမှု
စာရင်းအင်းပညာသည် ဒေတာများ စုဆောင်းခြင်း၊ ခွဲခြမ်းစိတ်ဖြာခြင်း၊ အဓိပ္ပာယ်ဖွင့်ဆိုခြင်း၊ တင်ပြခြင်းနှင့် စီစဉ်ခြင်းတို့နှင့် သက်ဆိုင်သည့် သင်္ချာဘာသာရပ်ခွဲတစ်ခုဖြစ်သည်။ စာရင်းအင်းပညာတွင်၊ ပျံ့နှံ့မှုတိုင်းတာမှုအမျိုးမျိုးနှင့် ဒေတာ၏ဗဟိုဆုံးဖြတ်ချက်များကို အသုံးပြု၍ ခွဲခြမ်းစိတ်ဖြာပြီး နားလည်ကြသည်။ အခြေခံအကျဆုံးနှင့် အရေးကြီးဆုံးနှစ်ခုမှာ မုဒ်နှင့် အလယ်အလတ်ဖြစ်သည်။ ဤဆောင်းပါးသည် မုဒ်နှင့် အလယ်အလတ်ကား အဘယ်နည်း၊ ၎င်းတို့ကို မည်သို့တွက်ချက်ရမည်နှင့် ဒေတာခွဲခြမ်းစိတ်ဖြာမှုတွင် ၎င်းတို့၏အရေးပါမှုကို ရှင်းပြပါမည်။
မုဒ်ဆိုတာ ဘာလဲ။
မုဒ်ဆိုသည်မှာ ဒေတာအစုတစ်ခုတွင် အများဆုံးတွေ့ရှိရသော တန်ဖိုးဖြစ်သည်။ နည်းပညာပိုင်းအရ မုဒ်ဆိုသည်မှာ ဒေတာဖြန့်ဖြူးမှုတွင် အမြင့်ဆုံးကြိမ်နှုန်းရှိသော တန်ဖိုး သို့မဟုတ် အမျိုးအစားဖြစ်သည်။ မုဒ်များကို အမျိုးအစားအလိုက်၊ အစဉ်လိုက်၊ ကြားကာလနှင့် အချိုးဒေတာများအတွက် အသုံးပြုနိုင်သည်။ ပျမ်းမျှနှင့် အလယ်အလတ်နှင့်မတူဘဲ မုဒ်သည် အမြဲတမ်းထူးခြားသည်မဟုတ်ပါ။ အချို့ကိစ္စများတွင် ဒေတာတွင် မုဒ်တစ်ခုထက်ပို၍ (bimodal သို့မဟုတ် multimodal) ရှိနိုင်သည် သို့မဟုတ် တန်ဖိုးအားလုံးသည် တူညီသောကြိမ်နှုန်းဖြင့် ဖြစ်ပေါ်ပါက မုဒ်လုံးဝမရှိနိုင်ပါ။
မုဒ်တွက်ချက်နည်း
မုဒ်တွက်ချက်ခြင်းသည် အလွန်ရိုးရှင်းပါသည်။ ဒေတာတွင် အများဆုံးပေါ်လာသော တန်ဖိုးကို သင်ခွဲခြားသတ်မှတ်ရန်သာ လိုအပ်ပါသည်။ ရိုးရှင်းသော ဥပမာတစ်ခု ဤတွင်ဖော်ပြထားပါသည်။
အောက်ပါဒေတာအစုံကို ကျွန်ုပ်တို့တွင် ရှိသည်ဟု ဆိုကြပါစို့- ၃၊ ၇၊ ၅၊ ၉၊ ၇၊ ၆၊ ၇၊ ၂။
ဤဒေတာအစုံတွင် ၇ တန်ဖိုးသည် အခြားတန်ဖိုးများထက် သုံးဆပိုများပြီး ပေါ်လာသည်။ ထို့ကြောင့် ဤဒေတာအစုံ၏ မုဒ်မှာ ၇ ဖြစ်သည်။
ပိုမိုရှုပ်ထွေးသောဒေတာ သို့မဟုတ် အမျိုးအစားခွဲခြားထားသောဒေတာအတွက်၊ တန်ဖိုးတစ်ခုစီ၏ ကြိမ်နှုန်းများကို ပိုမိုလွယ်ကူစွာ ခွဲခြားသိရှိနိုင်စေရန် စီစဉ်ရန် လိုအပ်နိုင်ပါသည်။
အမျိုးအစားအလိုက် အချက်အလက် ဥပမာ-
အနှစ်သက်ဆုံး ကားအရောင်များကို ရှာဖွေရန် စစ်တမ်းတစ်ခု ပြုလုပ်ခဲ့သည်- အနီ၊ အပြာ၊ အနက်၊ အဖြူ၊ အနက်၊ အပြာ၊ အပြာ။
ဤဥပမာတွင်-
- အနီရောင် ၁ ကြိမ်ပေါ်လာသည်
- အပြာရောင် ၃ ကြိမ်ပေါ်လာသည်
- အနက်ရောင် ၂ ကြိမ်ပေါ်လာသည်
- အဖြူရောင် ၁ ကြိမ်ပေါ်လာသည်
ဤဒေတာ၏ မုဒ်မှာ အပြာရောင်ဖြစ်သည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းသည် အများဆုံးဖော်ပြခံရသော အရောင်ဖြစ်သည် (၃ ကြိမ်)။
မုဒ်သည် ထူးခြားမှုမရှိသည့်အခါ သို့မဟုတ် မရှိသည့်အခါ
အချို့ကိစ္စများတွင်၊ ဒေတာတွင် မုဒ်တစ်ခုထက်ပို၍ ရှိနိုင်သည် သို့မဟုတ် မုဒ်လုံးဝမရှိနိုင်ပါ။ ဥပမာ-
နှစ်လမ်းသွား သို့မဟုတ် ဘက်စုံသုံး:
ဒေတာအစုံ: ၄၊ ၄၊ ၅၊ ၅၊ ၆၊ ၆၊ ၇
ဤဥပမာတွင်၊ ၄၊ ၅ နှင့် ၆ တန်ဖိုးများသည် နှစ်ကြိမ်ပေါ်လာသည်။ ထို့ကြောင့်၊ ဤဒေတာစုသည် ၄၊ ၅ နှင့် ၆ ၏ မုဒ်များပါရှိသော multimodal ဖြစ်သည်။
မုဒ်မရှိပါ-
ဒေတာအစုံ: ၁၊ ၂၊ ၃၊ ၄၊ ၅
တန်ဖိုးတစ်ခုစီသည် တစ်ကြိမ်သာပေါ်သောကြောင့် ဤဒေတာစုတွင် မုဒ်မရှိပါ။
အလယ်အလတ်ဆိုတာ ဘာလဲ။
အလယ်အလတ်တန်ဖိုးသည် အစီအစဉ်တကျစီစဉ်ထားသောဒေတာအစုတစ်ခုရှိ အလယ်အလတ်တန်ဖိုးဖြစ်သည်။ ၎င်းသည် ဒေတာအစုကို ညီမျှသောအပိုင်းနှစ်ပိုင်းအဖြစ် ပိုင်းခြားပြီး တန်ဖိုးတစ်ဝက်သည် အလယ်အလတ်တန်ဖိုးအောက်တွင်ရှိပြီး ကျန်တစ်ဝက်သည် အလယ်အလတ်တန်ဖိုးအထက်တွင်ရှိသည်။ အလယ်အလတ်တန်ဖိုးများကို မကြာခဏအသုံးပြုလေ့ရှိသည်၊ အဘယ်ကြောင့်ဆိုသော် ၎င်းသည် ပျမ်းမျှတန်ဖိုးများ သို့မဟုတ် ပြင်ပအချက်များ၏ သက်ရောက်မှုမရှိသောကြောင့်ဖြစ်ပြီး၊ ထို့ကြောင့် ဒေတာတွင် သွေဖည်မှုများစွာရှိသည့်အခါ ဒေတာဖြန့်ဖြူးမှု၏ဗဟိုကို ပိုမိုကောင်းမွန်စွာညွှန်ပြပေးသည်။
အလယ်အလတ်ကိန်းကို ဘယ်လိုတွက်ချက်မလဲ
အလယ်အလတ်တန်ဖိုးတွက်ချက်ရန် အဆင့်များမှာ အောက်ပါအတိုင်းဖြစ်သည်။
၁။ ဒေတာကို ငယ်စဉ်ကလိုက် စီပါ။
၂။ အချက်အလက်အရေအတွက် (N) သည် မကိန်းဖြစ်ပါက အလယ်ဗဟိုတန်ဖိုးသည် အလယ်နေရာရှိ တန်ဖိုးဖြစ်သည်။
၃။ အချက်အလက်အရေအတွက် (N) သည် စုံဖြစ်ပါက အလယ်ရှိတန်ဖိုးနှစ်ခု၏ ပျမ်းမျှဖြစ်သည်။
ဥပမာ-
မကိန်းပါသော ဒေတာအစုံ-
ဒေတာအစုံ: ၁၊ ၂၊ ၃၊ ၄၊ ၅
စီရန်: ၃၊ ၅၊ ၆၊ ၇၊ ၉
အလယ်အလတ်တန်ဖိုး: ၆ (အလယ်ရှိတန်ဖိုး)
စုံဂဏန်းပါသော ဒေတာအစုံ-
ဒေတာအစုံ: ၃၊ ၇၊ ၅၊ ၉၊ ၆၊ ၈
စီရန်: ၃၊ ၅၊ ၆၊ ၇၊ ၈၊ ၉
အလယ်အလတ်: (၆ + ၇) / ၂ = ၆.၅
အမျိုးအစားအလိုက်ဒေတာတွင် အလယ်အလတ်
median ကို စဉ်ဆက်မပြတ်ဒေတာ သို့မဟုတ် အစဉ်လိုက်ဒေတာများတွင် ပိုမိုအသုံးပြုလေ့ရှိသော်လည်း၊ ၎င်းကို ရှင်းလင်းသော အစီအစဉ်ဖြင့် အမျိုးအစားအလိုက်ဒေတာအတွက်လည်း အသုံးပြုနိုင်ပါသည်။
အမျိုးအစားအလိုက် (အစဉ်လိုက်) အချက်အလက်၏ ဥပမာများ-
ရုပ်ရှင်အဆင့်သတ်မှတ်ချက်- ကောင်း၊ အလွန်ကောင်း၊ အသင့်အတင့်၊ အလွန်ကောင်း၊ ကောင်း
အဆင့်အလိုက် စီပါ- အသင့်အတင့်၊ ကောင်း၊ ကောင်း၊ အလွန်ကောင်း၊ အထူးကောင်းမွန်
အလယ်အလတ်တန်ဖိုး: ကောင်း (တတိယအလယ်တန်ဖိုး)
အလယ်အလတ်အဆင့်၏ အားသာချက်များနှင့် အားနည်းချက်များ
အလယ်အလတ်ကိန်းရဲ့ အဓိကအားသာချက်တစ်ခုကတော့ outliers တွေကို sensitive ဖြစ်တာပဲဖြစ်ပါတယ်။ ဥပမာအားဖြင့်၊ ကျွန်ုပ်တို့မှာ ဝင်ငွေ dataset တစ်ခုရှိပြီး အလွန်မြင့်မားတဲ့ ဝင်ငွေရှိတဲ့ CEO တစ်ယောက်ပါဝင်တယ်လို့ ဆိုကြပါစို့။ အလယ်အလတ်ကိန်းဟာ အလွန်အမင်းတန်ဖိုးတွေကြောင့် ပုံပျက်သွားနိုင်တဲ့ အလယ်အလတ်ကိန်းထက် ဗဟိုဝင်ငွေရဲ့ ပိုပြီးလက်တွေ့ကျတဲ့ပုံရိပ်ကို ပေးစွမ်းနိုင်ပါသေးတယ်။ ဒါပေမယ့် အလယ်အလတ်ကိန်းရဲ့ အားနည်းချက်ကတော့ dataset သေးငယ်တဲ့ dataset တွေမှာ ပျောက်ဆုံးနေတဲ့ ဒါမှမဟုတ် မတိကျတဲ့ data တွေက ရလဒ်တွေကို သိသိသာသာ သက်ရောက်မှုရှိနိုင်ပါတယ်။
မုဒ် vs အလယ်အလတ် vs ပျမ်းမျှ
မုဒ်၊ အလယ်အလတ် နှင့် ပျမ်းမျှ နှစ်မျိုးလုံးသည် ဒေတာဖြန့်ဖြူးမှု၏ ဝိသေသလက္ခဏာများနှင့်ပတ်သက်သည့် အရေးကြီးသောအချက်အလက်များကို ပေးစွမ်းသည့် ဗဟိုလမ်းကြောင်း၏ တိုင်းတာမှုများဖြစ်သည်။
– ပျမ်းမျှ: ဒေတာအားလုံး၏ ဂဏန်းသင်္ချာပျမ်းမျှ။ outliers များအတွက် ထိခိုက်လွယ်သည်။
– အလယ်အလတ်တန်ဖိုး- စီစဉ်ထားသောဒေတာ၏ အလယ်အလတ်တန်ဖိုး။ outliers များအပေါ် အာရုံခံနိုင်စွမ်းမရှိပါ။
– မုဒ်: အများဆုံးပေါ်လာသော တန်ဖိုး။ အမျိုးအစားအလိုက်ဒေတာအတွက် အသုံးဝင်သည်။
တစ်ခုချင်းစီတွင် ၎င်း၏ကိုယ်ပိုင်အသုံးပြုမှုများနှင့် အားနည်းချက်များရှိပြီး ပိုမိုပြည့်စုံသောပုံရိပ်ကို ပေးစွမ်းရန်အတွက် တစ်ခါတစ်ရံတွင် အတူတကွအသုံးပြုကြသည်။
မှန်ကန်သောအရွယ်အစားရွေးချယ်ခြင်း
ဗဟိုလမ်းကြောင်း၏ သင့်လျော်သော တိုင်းတာမှုကို ရွေးချယ်ခြင်းသည် ဒေတာအမျိုးအစားနှင့် ခွဲခြမ်းစိတ်ဖြာမှု၏ ရည်ရွယ်ချက်ပေါ်တွင် မူတည်ပါသည်။
– ဒေတာတွင် outliers များရှိပါက သို့မဟုတ် ပုံမှန်ဖြန့်ဝေမထားပါက၊ median သည် ပိုမိုသင့်လျော်နိုင်ပါသည်။
– အသုံးအများဆုံးတန်ဖိုး သို့မဟုတ် လွှမ်းမိုးနိုင်သော အမျိုးအစားကို စိတ်ဝင်စားပါက ဤမုဒ်သည် ပိုမိုအသုံးဝင်ပါလိမ့်မည်။
– ဒေတာကို outliers မပါဘဲ ပုံမှန်ဖြန့်ဝေပါက၊ ပျမ်းမျှသည် ကောင်းမွန်သော ကိုယ်စားပြုမှုကို ပေးနိုင်ပါသည်။
ဥပမာအားဖြင့် အိမ်ခြံမြေဈေးကွက် ခွဲခြမ်းစိတ်ဖြာမှုတွင် ဈေးနှုန်း အလွန်အမင်း ကွဲပြားမှုကြောင့် အိမ်ခြံမြေဈေးနှုန်းများကို ဖော်ပြရန် အလယ်အလတ်ကိန်းကို မကြာခဏ အသုံးပြုလေ့ရှိသည်။ လူထုထင်မြင်ချက် စစ်တမ်းများတွင် ဤမုဒ်ကို အလွန်ရေပန်းစားသော ရွေးချယ်မှုအဖြစ် အသုံးပြုနိုင်သည်။
နိဂုံး
မုဒ်နှင့် အလယ်အလတ်သည် စာရင်းအင်းများတွင် ဗဟိုလမ်းကြောင်းကို တိုင်းတာရာတွင် အလွန်အသုံးဝင်သော တိုင်းတာမှုနှစ်ခုဖြစ်သည်။ ၎င်းတို့သည် မတူညီသော အချက်အလက်များကို ပေးစွမ်းသော်လည်း၊ ၎င်းတို့သည် အချက်အလက်အစုတစ်ခု၏ အဓိကဝိသေသလက္ခဏာများကို ရိုးရှင်းစေပြီး အကျဉ်းချုပ်နိုင်ပြီး ထိုအချက်အလက်အပေါ် အခြေခံ၍ ဆုံးဖြတ်ချက်ချရာတွင် အထောက်အကူဖြစ်စေသည်။ ၎င်းတို့၏ ရှိနေခြင်းသည် ပျမ်းမျှနှင့်အတူ သုတေသီများနှင့် ခွဲခြမ်းစိတ်ဖြာသူများအား ၎င်းတို့လေ့လာနေသော အချက်အလက်၏ ပိုမိုပြီးပြည့်စုံသော ပုံရိပ်ကို ရရှိစေပါသည်။