Статистикадағы импульсация әдістері

Статистикадағы импульсиялық әдістер

Статистика және деректерді талдау тәжірибесінде деректердің жетіспеушілігі мәселесі әрдайым туындайды. Деректер респонденттердің белгілі бір сұрақтарға жауап бермеуіне, жазу қателеріне, сенсордың кедергісіне, деректерді алу кезіндегі деректердің бұзылуына немесе толық сәйкес келмейтін бірнеше деректер көздерін біріктіру процесіне байланысты болмауы мүмкін. Дұрыс өңделмеген жағдайда, жетіспейтін деректер талдау сапасын төмендетуі, тесттің күшін төмендетуі және тіпті біржақты қорытындыларға әкелуі мүмкін. Жетіспейтін деректерді өңдеудің ең көп таралған тәсілдерінің бірі - импутация, ол жетіспейтін мәндерді қолжетімді ақпаратқа негізделген болжамды мәндермен толтыруды қамтиды.

Неліктен айыппұл салу маңызды?

Жоқ деректерді жай ғана жоюдың орнына импутацияның жиі таңдалуының бірнеше себебі бар. Біріншіден, жоқ мәндері бар жолдарды/бақылауларды жою (мысалы, тізім бойынша жою) үлгі көлемін айтарлықтай азайтуы мүмкін, әсіресе жоқ деректердің пайызы айтарлықтай болған кезде. Екіншіден, егер деректер кездейсоқ жоғалмаса, жою ауытқуды тудыруы мүмкін. Үшіншіден, көптеген статистикалық немесе машиналық оқыту алгоритмдері толық деректерді талап етеді, бұл импутацияны алдын ала өңдеудің ыңғайлы қадамына айналдырады.

Дегенмен, импутация тек «олқылықтарды толтыру» туралы емес. Таңдалған әдіс жетіспейтін деректер механизмін, айнымалылардың құрылымын және талдау мақсаттарын ескеруі керек. Нашар импутация модельді «алдауы» мүмкін, дисперсияны азайтып, нәтижелерді іс жүзіндегіден гөрі сенімдірек етіп көрсетуі мүмкін.

Жоғалған деректер механизмі

Статистикалық әдебиеттерде жоғалған деректер әдетте үш негізгі механизмге жіктеледі:

1. MCAR (кездейсоқ түрде толығымен жоқ): деректердің жоқ болу ықтималдығы байқалған немесе байқалмаған кез келген айнымалыларға тәуелсіз. Мысалы, апат салдарынан зақымдалған сауалнама.
2. MAR (кездейсоқ жетіспеушілік): деректердің жетіспеу ықтималдығы байқалған айнымалыға байланысты, бірақ басқа айнымалыларды бақылағаннан кейін жетіспейтін мәннің өзіне тәуелді емес. Мысалы, жас респонденттер табыс туралы сұрақтарды жіберіп алуы ықтимал, бірақ жасы қолжетімді.
3. MNAR (кездейсоқ емес, жоғалған): Деректердің жоғалу ықтималдығы жоғалған мәннің өзіне байланысты. Мысалы, табысы өте жоғары адамдар өз табыстарын жария етпеуге бейім.

READ  Сапалық зерттеулердегі статистика

MCAR/MAR бойынша импутация әдетте қауіпсіз. MNAR көбінесе жетіспейтін деректерді немесе сезімталдықты талдауды нақты ескеретін модельді талап етеді.

Қарапайым импультация әдісі

1. Орташа/Медиана/Режим импультациясы
Ең қарапайым әдіс - жоқ мәндерді сандық айнымалылар үшін орташа мәнмен немесе медианамен, ал категориялық айнымалылар үшін режиммен ауыстыру. Артықшылықтары: оңай, жылдам және көбінесе базалық сызық ретінде қызмет етеді. Кемшіліктері: дисперсияны азайтуы және деректердің таралуын бұрмалауы мүмкін, әсіресе деректер асимметриялық болса немесе ауытқуларды қамтыса. Медиана әдетте ауытқуларға орташа мәннен гөрі сенімдірек.

2. Тұрақты импутация
Жоқ мәндер 0, -1 немесе «Белгісіз» белгісі сияқты белгілі бір тұрақтымен толтырылады. Бұл мәннің белгілі бір мағынасы болған кезде (мысалы, «транзакция жоқ») немесе модельге жоқ мәндерді бөлектеу үшін қосымша индикатор беру қажет болған кезде пайдалы. Дегенмен, кез келген тұрақтыны таңдау жалған үлгілерді енгізуі мүмкін.

3. Хот-Дек импультациясы
Хот-декада жетіспейтін мәндер бірнеше негізгі айнымалыларға негізделген басқа, «ұқсас» бақылаулардан (донорлардан) алынған мәндерді пайдаланып толтырылады. Бұл әдіс сауалнамаларда кең таралған. Хот-декалар деректердің нақты мәндерін көрсететіндіктен нақты мәндерді сақтайды, бірақ нәтижелер «ұқсастық» анықтамасына сезімтал және үлгіаралық вариацияны тудыруы мүмкін.

Модельге негізделген импультация әдісі

4. Регрессиялық импульс
Жоқ мәндер басқа айнымалылардан алынған регрессия моделін пайдаланып болжанады. Сандық айнымалылар үшін сызықтық регрессияны пайдалануға болады; категориялық айнымалылар үшін логистикалық немесе көпмүшелік регрессияны пайдалануға болады. Артықшылығы - ол айнымалылар арасындағы қатынастарды пайдаланады. Кемшілігі - тек детерминирленген болжамды мәндерді пайдалану дисперсияны азайтуға бейім, себебі барлық импультацияланған мәндер болжау сызығында дәл түседі. Мұны шешу үшін шынайылықты арттыру үшін кездейсоқ компоненттер (мысалы, қалдықтар) жиі қосылады.

5. k-Ең жақын көршілер (kNN) импутациясы
kNN әдісі k ең жақын көршілерінің орташа (немесе дауыс беру) мәніне негізделген жетіспейтін мәндерді толтырады. Жақындық әдетте деректер қалыпқа келтірілгеннен кейін Евклид қашықтығымен немесе басқа метрикамен өлшенеді. Оның артықшылықтарына икемділік және сызықтық байланыстың жоқтығы туралы болжам жатады. Кемшіліктеріне үлкен деректер жиынтықтары үшін есептеу қымбаттығы, айнымалы масштабқа сезімталдық және жоғары өлшемді деректердегі өнімділіктің төмендеуі (өлшемділіктің қарғысы) жатады.

READ  Excel көмегімен статистикалық деректерді өңдеу

6. Күтуді барынша арттыру (ҮМ)
ЭМ тәсілі жетіспейтін мәндерді жасырын айнымалылар ретінде қарастыру арқылы модель параметрлерін (мысалы, көп айнымалы қалыпты деректер үшін орташа мән және ковариация) бағалайды. Е қадамы ағымдағы параметрлерге негізделген жетіспейтін мәндердің күтілуін итеративті түрде есептейді, содан кейін M қадамы күтілетін «толық» деректерге негізделген параметрлерді жаңартады. ЭМ белгілі бір үлестірімдік болжамдарға берік, бірақ күрделі болуы мүмкін және модель болжамдарының дұрыстығына байланысты.

Бірнеше айыптау: көптеген жағдайларда алтын стандарт

7. Көптік импутация (МИ)
Бірнеше импутация MAR-ға ең принципті тәсілдердің бірі болып саналады. MI бір толық деректер жиынтығын жасаудың орнына, белгісіздікті көрсететін әртүрлі импутациялары бар бірнеше деректер жиынтығын (мысалы, 5-20) жасайды. Әрбір деректер жиынтығы бөлек талданады, содан кейін нәтижелер Рубин ережелерін пайдаланып біріктіріліп, неғұрлым дәл бағалаулар мен стандартты қателіктер алынады.

МИ артықшылықтары:
– Импутация белгісіздікті ескереді.
– Статистикалық қорытынды жасау үшін дәлірек (сенімділік аралықтары, гипотезаны тексеру).
- Әртүрлі айнымалылар үшін икемді.

Оның шектеулері:
– Күрделірек іске асыру.
– Тиісті болжамдар мен имплуатация моделінің сипаттамаларын талап етеді.
– Егер MNAR-да жетіспеушілік болса, стандартты MI әлі де біржақты болуы мүмкін.

Уақыттық қатарлар мен кеңістіктік деректер үшін импульсация

Уақыт қатарларының деректерінде жоғалған мәндер көбінесе олардың алдыңғы және кейінгі мәндерімен тығыз байланысты болады. Сызықтық интерполяция, сплайндар, Калман сүзгілері немесе ARIMA/күй кеңістік модельдері сияқты әдістер жиі қолданылады. Кеңістіктік деректер үшін кригинг және кеңістіктік модельдер сияқты тәсілдер географиялық жақындықты пайдалана алады. Бұл әдістер уақытша/кеңістіктік құрылым басым болған кезде тиімді, бірақ қарапайым интерполяцияны жаңылыстыруы мүмкін кенеттен өзгерістерге (мысалы, экономикалық күйзелістерге) қарсы сақ болу керек.

Импутация әдістерін таңдаудағы жақсы тәжірибелер

1. Жетіспейтін деректерді зерттеу: жетіспейтін мәндердің пайызын, жетіспеушілік үлгісін және жетіспеушіліктің белгілі бір айнымалымен байланысты екенін тексеріңіз.
2. Оқыту және тест деректерін бөлектеңіз: тек оқу деректерінен «үйрену» арқылы есептеуді орындаңыз, содан кейін деректердің ағып кетуіне жол бермеу үшін оны тест деректеріне қолданыңыз.
3. Айнымалы түрін қарастырыңыз: сандық, категориялық, реттік немесе аралас; тиісті әдіс әртүрлі.
4. Жоқтық көрсеткіштерін пайдаланыңыз: кейде мәннің жоқтығы туралы ақпараттың өзі болжамды болып табылады; индикатор айнымалыларын қосу болжамды модельдің өнімділігін жақсарта алады.
5. Импутацияның әсерін бағалаңыз: импутацияға дейінгі/кейінгі үлестірімдерді салыстырыңыз, дисперсияның азайғанын тексеріңіз және модельді растаңыз.
6. МИ-ге қорытынды жасау үшін басымдық беріңіз: талдаудың мақсаты параметрлерді бағалау және статистикалық тестілеу болған кезде, бірнеше импультация көбінесе бір импультацияға қарағанда орындырақ.

READ  Қоршаған ортадағы статистика

Қорытынды

Импутация қазіргі заманғы статистикалық жұмыс процестерінің жетіспейтін деректерді өңдеудегі маңызды құрамдас бөлігі болып табылады. Орташа/медиана сияқты қарапайым әдістер бастапқы мән ретінде немесе шағын жетіспейтін мәндер үшін пайдалы болуы мүмкін, бірақ көбінесе деректер құрылымы мен белгісіздікті бұзады. Регрессия, kNN және EM сияқты модельге негізделген әдістер айнымалылар арасындағы қатынастарды пайдаланады, ал көптік импутация белгісіздікті ескере отырып, қорытынды жасау үшін сенімді негіз ұсынады. Ең жақсы әдісті таңдау жетіспейтін деректер механизміне (MCAR/MAR/MNAR), талдау мақсатына (болжау және қорытынды) және деректердің сипаттамаларына (уақыт қатары, кеңістіктік, аралас) байланысты. Дұрыс тәсілмен импутация талдаудың тұтастығын сақтауға көмектеседі және сенімдірек қорытындылар береді.

Пікір қалдырыңыз