په احصایو کې د تور لګولو طریقې
د احصایې او معلوماتو تحلیل په عمل کې، د معلوماتو د ورکیدو ستونزه تقریبا تل راپورته کیږي. معلومات د ځواب ویونکو لخوا د ځینو پوښتنو ځواب نه ورکولو، د ثبت کولو غلطیو، د سینسر لاسوهنې، د استخراج په جریان کې د فاسد معلوماتو، یا د ډیری معلوماتو سرچینو د یوځای کولو پروسې له امله ورک کیدی شي چې په بشپړ ډول سره سمون نه خوري. که په سمه توګه اداره نشي، ورک شوي معلومات کولی شي د تحلیل کیفیت خراب کړي، د ازموینې ځواک کم کړي، او حتی د تعصب پایلو ته لار هواره کړي. د ورک شوي معلوماتو اداره کولو لپاره یو له خورا عامو لارو څخه تور لګول دي، کوم چې د شته معلوماتو پراساس د اټکل شوي ارزښتونو سره د ورک شوي ارزښتونو ډکول شامل دي.
ولې تور لګول مهم دي؟
ډیری دلیلونه شتون لري چې ولې تور لګول اکثرا د ورک شوي معلوماتو د حذف کولو پرځای غوره کیږي. لومړی، د قطارونو / مشاهدو حذف کول چې ورک شوي ارزښتونه لري (د مثال په توګه، د لیست له مخې حذف کول) کولی شي د نمونې اندازه په ډراماتیک ډول کمه کړي، په ځانګړي توګه کله چې د ورک شوي معلوماتو سلنه د پام وړ وي. دوهم، که چیرې معلومات په ناڅاپي ډول ورک نه وي، نو حذف کولی شي تعصب معرفي کړي. دریم، ډیری احصایوي یا د ماشین زده کړې الګوریتمونه بشپړ معلوماتو ته اړتیا لري، چې تور لګول د پروسس کولو لپاره یو اسانه ګام جوړوي.
په هرصورت، تور لګول یوازې د "تشو ډکولو" په اړه ندي. غوره شوی میتود باید د معلوماتو ورک شوي میکانیزم، د متغیرونو جوړښت، او د تحلیل اهداف په پام کې ونیسي. ضعیف تور لګول کولی شي ماډل "احمق" کړي، توپیر کم کړي، او پایلې یې د هغه څه په پرتله ډیرې ډاډمنې ښکاره کړي چې واقعیا دي.
د ورک شوي معلوماتو میکانیزم
په احصایوي ادبیاتو کې، ورک شوي معلومات معمولا په دریو اصلي میکانیزمونو ویشل شوي دي:
۱. MCAR (په ناڅاپي ډول په بشپړه توګه ورکیدل): د معلوماتو د ورکیدو احتمال د هر ډول متغیراتو څخه خپلواک دی، مشاهده شوی یا غیر مشاهده شوی. د مثال په توګه، یوه پوښتنلیک چې د پیښې له امله زیانمن شوی وي.
۲. MAR (په ناڅاپي ډول ورک شوی): د معلوماتو د ورکیدو احتمال په مشاهده شوي متغیر پورې اړه لري، مګر د نورو متغیرونو کنټرول وروسته پخپله په ورک شوي ارزښت پورې اړه نلري. د مثال په توګه، ځوان ځواب ویونکي ډیر احتمال لري چې د عاید پوښتنې له لاسه ورکړي، مګر عمر شتون لري.
۳. MNAR (په ناڅاپي ډول له لاسه ورکول): د معلوماتو د ورکیدو احتمال پخپله د ورک شوي ارزښت پورې اړه لري. د مثال په توګه، هغه خلک چې ډیر لوړ عاید لري خپل عاید نه څرګندوي.
د MCAR/MAR لاندې عموما تور لګول خوندي دي. د MNAR لپاره، یو ماډل چې په څرګنده توګه د ورک شوي معلوماتو یا حساسیت تحلیل حساب کوي ډیری وخت اړین وي.
د تور لګولو ساده طریقه
۱. منځنۍ/منځنۍ/موډ انګېزه
تر ټولو ساده طریقه دا ده چې ورک شوي ارزښتونه د عددي متغیرونو لپاره د اوسط یا میډیا سره بدل کړئ، او د کټګوري متغیرونو لپاره حالت. ګټې یې دا دي: دا اسانه، ګړندی دی، او ډیری وختونه د اساس په توګه کار کوي. زیانونه یې دا دي: دا کولی شي توپیر کم کړي او د معلوماتو ویش تحریف کړي، په ځانګړي توګه که چیرې معلومات غیر متناسب وي یا بهرني وي. میډیا عموما د اوسط په پرتله د بهرنيانو لپاره ډیر قوي وي.
۲. دوامداره تور لګول
ورک شوي ارزښتونه د یو ځانګړي ثابت سره ډک شوي، لکه 0، -1، یا د "نامعلوم" لیبل. دا ګټور دی کله چې ارزښت یو ځانګړی معنی ولري (د مثال په توګه، "هیڅ معامله نه ده")، یا کله چې ماډل ته د ورکیدو روښانه کولو لپاره اضافي شاخص ورکولو ته اړتیا وي. په هرصورت، د خپل سري ثابت غوره کول کولی شي جعلي نمونې معرفي کړي.
۳. د ګرمو ډیکونو لګول
په ګرم ډیک کې، ورک شوي ارزښتونه د نورو، "ورته" مشاهدو (ډونرانو) څخه د ارزښتونو په کارولو سره ډک شوي چې د څو کلیدي متغیرونو پراساس دي. دا طریقه په سروې ګانو کې مشهوره ده. ګرم ډیکونه حقیقي ارزښتونه ساتي ځکه چې دوی د معلوماتو اصلي ارزښتونه نیسي، مګر پایلې د "ورته والي" تعریف سره حساس دي او کولی شي د نمونې ترمنځ توپیر تولید کړي.
د ماډل پر بنسټ د تور لګولو طریقه
۴. د رجعت امپوټیشن
ورک شوي ارزښتونه د نورو متغیرونو څخه اخیستل شوي ریګریشن ماډل په کارولو سره وړاندوینه کیږي. د عددي متغیرونو لپاره، خطي ریګریشن کارول کیدی شي؛ د کټګوري متغیرونو لپاره، لوژستیکي یا څو نومي ریګریشن کارول کیدی شي. ګټه یې دا ده چې دا د متغیرونو ترمنځ اړیکې کاروي. زیان یې دا دی چې یوازې د ټاکل شوي وړاندوینې ارزښتونو کارول د توپیر کمولو ته لیوالتیا لري ځکه چې ټول اټکل شوي ارزښتونه په سمه توګه د وړاندوینې کرښې ته راځي. د دې د حل لپاره، تصادفي اجزا (د مثال په توګه، پاتې شوني) ډیری وختونه د لوی واقعیت لپاره اضافه کیږي.
۵. k- نږدې ګاونډیان (kNN) تورونه
د kNN میتود د k نږدې ګاونډیانو د اوسط (یا رایې ورکولو) پراساس ورک شوي ارزښتونه ډکوي. نږدېوالی معمولا د یوکلیډین واټن یا بل میټریک لخوا اندازه کیږي وروسته له دې چې معلومات نورمال شي. د دې ګټې انعطاف او د خطي اړیکو نه شتون انګیرنه شامله ده. زیانونه د لویو معلوماتو سیټونو لپاره د محاسبې له پلوه ګران، د متغیر پیمانې سره حساسیت، او په لوړ ابعادي معلوماتو کې د فعالیت تخریب (د ابعاد لعنت) شامل دي.
۶. د تمې اعظمي کول (EM)
د EM طریقه د ماډل پیرامیټرونه اټکل کوي (د مثال په توګه، د څو متغیر نورمال معلوماتو لپاره اوسط او کوویریننس) د ورک شوي ارزښتونو سره د پټ متغیرونو په توګه چلند کولو سره. مرحله E په تکراري ډول د اوسني پیرامیټرونو پراساس د ورک شوي ارزښتونو تمه محاسبه کوي، او بیا مرحله M د تمه شوي "بشپړ" معلوماتو پراساس پیرامیټرونه تازه کوي. EM د ځینې توزیع انګیرنو لپاره قوي دی، مګر پیچلی کیدی شي او د ماډل انګیرنو په سموالي پورې اړه لري.
څو ځله تور لګول: په ډیری قضیو کې د سرو زرو معیار
۷. ګڼ شمېر تورونه (MI)
څو اړخیزه انګېزه د MAR لپاره یو له خورا اصولي لارو څخه ګڼل کیږي. د یو بشپړ ډیټاسیټ تولیدولو پرځای، MI ډیری ډیټاسیټ تولیدوي (د مثال په توګه، 5-20) د مختلفو انګېزې سره چې ناڅرګندتیا منعکس کوي. هر ډیټاسیټ په جلا توګه تحلیل کیږي، بیا پایلې د روبین قواعدو په کارولو سره یوځای کیږي ترڅو ډیر باوري اټکلونه او معیاري غلطۍ ترلاسه کړي.
د MI ګټې:
- د تور لګولو ناڅرګندتیا ځای په ځای کوي.
- د احصایوي استنباط لپاره ډیر دقیق (د باور وقفې، فرضیه ازموینه).
- د مختلفو ډولونو متغیراتو لپاره انعطاف منونکی.
محدودیتونه یې:
- ډیر پیچلي پلي کول.
- د تور لګولو ماډل لپاره کافي انګیرنې او مشخصات اړین دي.
– که چیرې په MNAR کې نیمګړتیا وي، معیاري MI بیا هم تعصب کیدی شي.
د وخت لړۍ او فضايي معلوماتو لپاره انګیرنه
د وخت لړۍ معلوماتو کې، ورک شوي ارزښتونه ډیری وختونه د دوی د مخکینیو او راتلونکو ارزښتونو سره په کلکه تړاو لري. میتودونه لکه خطي انټرپولیشن، سپلاینونه، د کالمان فلټرونه، یا د ARIMA/State Space ماډلونه ډیری وختونه کارول کیږي. د فضايي معلوماتو لپاره، طریقې لکه کریګینګ او فضايي ماډلونه کولی شي د جغرافیایي نږدېوالي څخه ګټه پورته کړي. دا میتودونه هغه وخت اغیزمن دي کله چې وختي/فضایي جوړښت غالب وي، مګر احتیاط باید د ناڅاپي بدلونونو (د بیلګې په توګه، اقتصادي شاکونو) په وړاندې وکارول شي چې کولی شي ساده انټرپولیشن ګمراه کړي.
د تور لګولو د طریقو په غوره کولو کې ښې کړنې
۱. د ورکو شویو معلوماتو پلټنه ترسره کړئ: د ورکو شویو ارزښتونو سلنه، د ورکېدو نمونه، او ایا ورکېدل د یو ځانګړي متغیر سره تړاو لري وګورئ.
۲. د روزنې او ازموینې معلومات جلا کړئ: یوازې د روزنې معلوماتو څخه د "زده کړې" له لارې تورونه ترسره کړئ، بیا یې د معلوماتو د لیکیدو مخنیوي لپاره د ازموینې معلوماتو ته پلي کړئ.
۳. د متغیر ډول په پام کې ونیسئ: عددي، کټګوري، ترتیبي، یا مخلوط؛ مناسب میتود توپیر لري.
۴. د ورکېدو شاخصونه وکاروئ: ځینې وختونه هغه معلومات چې ارزښت یې ورک وي پخپله وړاندوینه کونکی وي؛ د شاخص متغیرونو اضافه کول کولی شي د وړاندوینې ماډل فعالیت ښه کړي.
۵. د تور لګولو اغیز ارزونه وکړئ: د تور لګولو دمخه/وروسته ویشونه پرتله کړئ، وګورئ چې آیا توپیر کم شوی، او ماډل تایید کړئ.
۶. د استنباط لپاره MI ته لومړیتوب ورکړئ: کله چې د تحلیل هدف د پیرامیټر اټکل او احصایوي ازموینه وي، نو ډیری تورونه اکثرا د واحد تورونو په پرتله ډیر مناسب وي.
پایله
د ورک شوي معلوماتو د اداره کولو لپاره د عصري احصایوي کاري جریانونو یوه مهمه برخه د اوسط/میډین په څیر ساده میتودونه د اساس په توګه یا د کوچنیو ورکیدو لپاره ګټور کیدی شي، مګر ډیری وختونه د معلوماتو جوړښت او ناڅرګندتیا سره موافقت کوي. د ماډل پر بنسټ میتودونه لکه ریګریشن، kNN، او EM د متغیرونو ترمنځ اړیکې کاروي، پداسې حال کې چې څو ځله د ناڅرګندتیا لپاره د محاسبې له لارې د استنباط لپاره یو قوي چوکاټ چمتو کوي. د غوره میتود انتخاب د ورک شوي معلوماتو میکانیزم (MCAR/MAR/MNAR)، د تحلیل هدف (وړاندوینه د استنباط په مقابل کې)، او د معلوماتو ځانګړتیاو (د وخت لړۍ، ځایي، مخلوط) پورې اړه لري. د سمې طریقې سره، استنباط د تحلیل بشپړتیا ساتلو کې مرسته کوي او ډیر باوري پایلې ترلاسه کوي.