စာရင်းအင်းပညာတွင် အဓိကအစိတ်အပိုင်း ခွဲခြမ်းစိတ်ဖြာခြင်း

စာရင်းအင်းပညာတွင် အဓိကအစိတ်အပိုင်း ခွဲခြမ်းစိတ်ဖြာခြင်း

Pendahuluan

Principal Component Analysis (PCA) သည် dataset ၏ မရှိမဖြစ် ဝိသေသလက္ခဏာများကို ထိန်းသိမ်းထားစဉ်တွင် data ၏ အတိုင်းအတာကို လျှော့ချရန် အသုံးပြုသည့် စာရင်းအင်းနည်းပညာတစ်ခုဖြစ်သည်။ ၎င်းကို data volume များပြားခြင်းသည် အဓိပ္ပာယ်ဖွင့်ဆိုခြင်းနှင့် လုပ်ဆောင်ခြင်းကို ရှုပ်ထွေးစေနိုင်သည့် pattern recognition၊ image processing နှင့် genomic data analysis ကဲ့သို့သော နယ်ပယ်များတွင် ကျယ်ကျယ်ပြန့်ပြန့် အသုံးပြုကြသည်။ PCA သည် သိသာထင်ရှားသော အချက်အလက်များ မဆုံးရှုံးဘဲ data ကို ရိုးရှင်းစေရန် ကူညီပေးပြီး ခေတ်မီ data analysis တွင် အလွန်အသုံးဝင်သော tool တစ်ခုဖြစ်လာစေသည်။

PCA ၏ အခြေခံသီအိုရီ

PCA ၏ အခြေခံမူမှာ ဒေတာကို ကိုဩဒိနိတ်အစုအသစ်တစ်ခုအဖြစ်သို့ ပြောင်းလဲခြင်းဖြစ်ပြီး၊ ဒေတာတွင် အများဆုံးကွဲပြားမှုကို ပထမအစိတ်အပိုင်းဖြင့် ဖမ်းယူခြင်း၊ ဒုတိယအမြင့်ဆုံးကွဲပြားမှုကို ဒုတိယအစိတ်အပိုင်းဖြင့် ဖမ်းယူခြင်း စသည်တို့ကို ပြုလုပ်ပါသည်။ ဤအစိတ်အပိုင်းများကို အဓိကအစိတ်အပိုင်းများဟု ခေါ်သည်။ လုပ်ငန်းစဉ်တွင် အဓိကအဆင့်များစွာ ပါဝင်သည်-

၁။ ဒေတာစံသတ်မှတ်ခြင်း- မတူညီသောဒေတာများတွင် မတူညီသောစကေးများရှိလေ့ရှိပြီး PCA ရလဒ်များကို ထိခိုက်စေနိုင်သည်။ ထို့ကြောင့် ဒေတာကို ပျမ်းမျှကိုနုတ်ပြီး စံသွေဖည်မှုဖြင့်စားခြင်းဖြင့် စံသတ်မှတ်လေ့ရှိသည်။

၂။ Covariance Matrix: နောက်တစ်ဆင့်မှာ စံသတ်မှတ်ထားသောဒေတာ၏ covariance matrix ကိုတွက်ချက်ရန်ဖြစ်သည်။ ဤ matrix သည် variable နှစ်ခု မည်သို့အတူတကွပြောင်းလဲသွားသည်ကို နားလည်ရန် ကူညီပေးသည်။

၃။ Eigenvalue နှင့် Eigenvector: covariance matrix ၏ eigenvalue နှင့် eigenvector ကို တွက်ချက်သည်။ eigenvector သည် အဓိက အစိတ်အပိုင်းများ၏ ဦးတည်ရာကို ဆုံးဖြတ်ပေးပြီး eigenvalue သည် ၎င်းတို့၏ အရေးပါမှုကို ဆုံးဖြတ်ပေးသည်။

၄။ အစိတ်အပိုင်း စီခြင်း- အဓိက အစိတ်အပိုင်းများကို ၎င်းတို့၏ eigenvalue များအလိုက် အကြီးဆုံးမှ အသေးဆုံးအထိ စီထားသည်။ အဓိက အစိတ်အပိုင်း ရွေးချယ်ခြင်းသည် ပုံမှန်အားဖြင့် eigenvalue များပေါ်တွင် အခြေခံပြီး eigenvalue များ ပိုကြီးသော အစိတ်အပိုင်းများကို နောက်ထပ် ခွဲခြမ်းစိတ်ဖြာမှုအတွက် ရွေးချယ်သည်။

၅။ ဒေတာအသွင်ပြောင်းခြင်း- မူရင်းဒေတာကို နောက်ထပ်ခွဲခြမ်းစိတ်ဖြာရန်အတွက် အဓိကအစိတ်အပိုင်းနေရာအဖြစ်သို့ ပြောင်းလဲသည်။

PCA တွင် အဆင့်ဆင့်

၁။ ဒေတာစုဆောင်းခြင်း

PCA ရဲ့ ပထမခြေလှမ်းကတော့ သက်ဆိုင်ရာဒေတာတွေကို စုဆောင်းဖို့ပါပဲ။ ဒီဒေတာဟာ ခွဲခြမ်းစိတ်ဖြာမှုကနေ အဓိပ္ပာယ်ရှိတဲ့ ရလဒ်တွေ ထွက်လာစေဖို့အတွက် လုံလောက်တဲ့ အရွယ်အစားရှိရပါမယ်။ ဥပမာအားဖြင့် ကျန်းမာရေးစောင့်ရှောက်မှု အသုံးချမှုတစ်ခုအတွက် အရပ်အမြင့်၊ ကိုယ်အလေးချိန်၊ သွေးပေါင်ချိန် စတဲ့ လူနာဒေတာတွေကို စုဆောင်းနိုင်ပါတယ်။

ဖတ်ရန်  ဆေးခန်းသုတေသနအတွက် စာရင်းအင်းခွဲခြမ်းစိတ်ဖြာမှု

၂။ ဒေတာ စံသတ်မှတ်ခြင်း

ဒေတာစုဆောင်းပြီးနောက်၊ ၎င်းအတွင်းရှိ အင်္ဂါရပ်တစ်ခုစီ (ကော်လံ) ကို စံသတ်မှတ်ရမည်။ စံသတ်မှတ်ခြင်း၏ အကြောင်းပြချက်မှာ မူလစကေး မည်သို့ပင်ရှိစေကာမူ အင်္ဂါရပ်တစ်ခုစီသည် PCA သို့ တူညီစွာ ပံ့ပိုးပေးကြောင်း သေချာစေရန်ဖြစ်သည်။ စံသတ်မှတ်ခြင်းကို အင်္ဂါရပ်တစ်ခုစီမှ ပျမ်းမျှကို နုတ်ပြီးနောက် စံသွေဖည်မှုဖြင့် စားခြင်းဖြင့် ရရှိသည်။

ဖော်မြူလာ:
\[ Z = \frac{X – \mu}{\sigma} \]
\(X\) သည် မူရင်းအင်္ဂါရပ်တန်ဖိုးဖြစ်ပြီး၊ \(\mu\) သည် အင်္ဂါရပ်ပျမ်းမျှဖြစ်ပြီး၊ \(\sigma\) သည် အင်္ဂါရပ်စံသွေဖည်မှုဖြစ်သည်။

၃။ Covariance Matrix တစ်ခု ဖန်တီးခြင်း

နောက်တစ်ဆင့်ကတော့ စံသတ်မှတ်ထားတဲ့ဒေတာကနေ covariance matrix တစ်ခုဖန်တီးဖို့ပါ။ covariance matrix ဆိုတာ features တွေရဲ့ variability နဲ့ သူတို့ကြားက relationships တွေကိုကိုယ်စားပြုတဲ့ square matrix တစ်ခုပါ။

ဖော်မြူလာ:
\[Cov(X၊ Y) = E[(X–E[X])(Y – E[Y])] \]
\(E\) သည် မျှော်မှန်းချက် သို့မဟုတ် ပျမ်းမျှဖြစ်သည်။

၄။ Eigenvalues ​​​​နှင့် Eigenvectors များတွက်ချက်ခြင်း

covariance matrix ကို ဖန်တီးပြီးသည်နှင့် နောက်တစ်ဆင့်မှာ eigenvalue ​​များနှင့် eigenvector များကို တွက်ချက်ရန်ဖြစ်သည်။ Eigenvector များနှင့် eigenvalue ​​များသည် PCA ၏ အဓိကကျောရိုးဖြစ်ပြီး အဓိကအစိတ်အပိုင်းများ၏ ဦးတည်ရာနှင့် အရေးပါမှုကို ဆုံးဖြတ်ပေးသောကြောင့်ဖြစ်သည်။ eigenvalue ကြီးလေ သက်ဆိုင်ရာ eigenvector ပေးထားသော ဦးတည်ရာတွင် variance ပိုများလေဖြစ်သည်။

၅။ Eigenvalues ​​များအပေါ် အခြေခံ၍ အစိတ်အပိုင်းများကို စီခြင်း

အဓိက အစိတ်အပိုင်းများကို ၎င်းတို့၏ eigenvalue များအလိုက် အကြီးဆုံးမှ အငယ်ဆုံးအထိ စီထားသည်။ အကြီးဆုံး eigenvalue ရှိသော အဓိက အစိတ်အပိုင်းသည် အချက်အလက်များတွင် ပြောင်းလဲမှုအများဆုံးဖြစ်စေသည်။

၆။ သိမ်းဆည်းမည့် အစိတ်အပိုင်းအရေအတွက် ရွေးချယ်ခြင်း

အဓိက အစိတ်အပိုင်းအားလုံးကို ထိန်းသိမ်းထားရန် မလိုအပ်ပါ။ အစိတ်အပိုင်း ရွေးချယ်ခြင်းသည် eigenvalues ​​များအပေါ် အခြေခံသည်။ အသုံးများသော ချဉ်းကပ်မှုတစ်ခုမှာ 'Cumulative Explained Variance' ဖြစ်ပြီး၊ ၎င်းသည် အဓိက အစိတ်အပိုင်း အများအပြားက ဒေတာတွင် စုစုပေါင်း ကွဲလွဲမှု၏ အချိုးအစားကို ရှင်းပြထားသည်ဟု ညွှန်ပြသည်။

၇။ ဒေတာအသွင်ပြောင်းခြင်း

နောက်ဆုံးအဆင့်မှာ မူရင်းဒေတာကို ရွေးချယ်ထားသော အဓိက အစိတ်အပိုင်း နေရာ၏ ကိုဩဒိနိတ်များအဖြစ်သို့ ပြောင်းလဲရန်ဖြစ်သည်။ ဤ အဓိက အစိတ်အပိုင်း နေရာရှိ တန်ဖိုးများသည် နောက်ထပ် ခွဲခြမ်းစိတ်ဖြာနိုင်သော attribute အသစ်များ ဖြစ်လာသည်။

ဖတ်ရန်  စာရင်းအင်းဒေတာတွင် Quartiles၊ Deciles နှင့် Percentiles များကို မည်သို့တွက်ချက်ရမည်နည်း

PCA အပလီကေးရှင်းများ

အမျိုးအစားခွဲခြားခြင်းနှင့် ပုံစံမှတ်မိခြင်း

PCA ကို အမျိုးအစားခွဲခြားခြင်းနှင့် ပုံစံမှတ်မိခြင်းတွင် ကျယ်ကျယ်ပြန့်ပြန့်အသုံးပြုကြသည်။ အချက်အလက်များ၏ အတိုင်းအတာကို လျှော့ချခြင်းဖြင့် PCA သည် အမျိုးအစားခွဲခြားခြင်းလုပ်ငန်းစဉ်ကို ပိုမိုထိရောက်စေပြီး တွက်ချက်မှုဆိုင်ရာ ရှုပ်ထွေးမှုကို လျှော့ချပေးသည်။ ဥပမာအားဖြင့် မျက်နှာမှတ်မိခြင်းတွင် PCA သည် ရုပ်ပုံများရှိ မျက်နှာများ၏ အတိုင်းအတာကို လျှော့ချပေးသောကြောင့် ကွန်ပျူတာများသည် ၎င်းတို့ကို ပိုမိုမြန်ဆန်စွာ မှတ်မိနိုင်မည်ဖြစ်သည်။

ရုပ်ပုံ စီမံဆောင်ရွက်ခြင်း

PCA သည် အရေးကြီးသော အသေးစိတ်အချက်အလက်များကို မဆုံးရှုံးဘဲ ရုပ်ပုံအရွယ်အစားကို လျှော့ချပေးနိုင်သည်။ ဤနည်းပညာကို အရာဝတ္ထုမှတ်မိခြင်း၊ အစွန်းထောက်လှမ်းခြင်းနှင့် ရုပ်ပုံခွဲခြားခြင်းကဲ့သို့သော အပလီကေးရှင်းအမျိုးမျိုးတွင် အသုံးပြုနိုင်သော ရုပ်ပုံများမှ အင်္ဂါရပ်များကို ထုတ်ယူရန်အတွက်လည်း အသုံးပြုသည်။

ဂျီနိုမ်ဒေတာ ခွဲခြမ်းစိတ်ဖြာခြင်း

ဇီဝဗေဒတွင်၊ ဂျီနိုမစ်ဒေတာသည် အလွန်ကြီးမားပြီး ရှုပ်ထွေးလေ့ရှိသည်။ PCA ကို ဂျီနိုမစ်ဒေတာ၏ အတိုင်းအတာကို လျှော့ချရန်အတွက် အသုံးပြုပြီး ဒေတာအတွင်းရှိ ပုံစံများနှင့် ဆက်စပ်မှုများကို ရှာဖွေဖော်ထုတ်ရန်နှင့် ခွဲခြမ်းစိတ်ဖြာရန် ပိုမိုလွယ်ကူစေသည်။ ၎င်းသည် မျိုးရိုးဗီဇသုတေသနနှင့် ဆေးဝါးဖွံ့ဖြိုးတိုးတက်မှုတွင် အထူးသဖြင့် အထောက်အကူဖြစ်စေသည်။

ဘဏ္ဍာရေးနှင့် စီးပွားရေး

PCA ကို ရင်းနှီးမြှုပ်နှံမှုအန္တရာယ် ခွဲခြမ်းစိတ်ဖြာခြင်းနှင့် စတော့ရှယ်ယာဈေးနှုန်း ခန့်မှန်းချက်တွင် အသုံးပြုသည်။ ဘဏ္ဍာရေးဒေတာ၏ ရှုထောင့်ကို လျှော့ချခြင်းဖြင့် ခွဲခြမ်းစိတ်ဖြာမှုသည် ဈေးကွက်ကို သိသိသာသာ သက်ရောက်မှုရှိသော အချက်များအပေါ် ပိုမိုအာရုံစိုက်နိုင်သည်။

နိဂုံး

အဓိက အစိတ်အပိုင်း ခွဲခြမ်းစိတ်ဖြာခြင်း (PCA) သည် စာရင်းအင်းနှင့် စက်သင်ယူမှုတွင် အစွမ်းထက်သော နည်းပညာတစ်ခုဖြစ်သည်။ သိသာထင်ရှားသော အချက်အလက်များ မဆုံးရှုံးဘဲ အချက်အလက်၏ အတိုင်းအတာကို လျှော့ချခြင်းဖြင့် PCA သည် ပိုမိုထိရောက်ပြီး အဓိပ္ပာယ်ဖွင့်ဆိုနိုင်သော ခွဲခြမ်းစိတ်ဖြာမှုကို ဖြစ်စေသည်။ PCA သည် အစွမ်းထက်သော်လည်း ၎င်း၏ ကန့်သတ်ချက်များကို နားလည်ရန် အရေးကြီးသည်- အချက်အလက်ကို linearly structured ဖြစ်သည့်အခါတွင်သာ ထိရောက်မှုရှိသည်။ PCA နှင့် ၎င်း၏ အလားအလာရှိသော အသုံးချမှုများကို နားလည်ခြင်းသည် ကြီးမားပြီး ရှုပ်ထွေးသော dataset များမှ ပိုမိုနက်ရှိုင်းသော အသိအမြင်များကို ထုတ်ယူနိုင်စေပြီး ခေတ်မီဒေတာခွဲခြမ်းစိတ်ဖြာမှုတွင် မရှိမဖြစ်ကိရိယာတစ်ခု ဖြစ်လာစေသည်။

မှတ်ချက်ရေးပါ