របៀបវិភាគទិន្នន័យប្រភេទ

របៀបវិភាគទិន្នន័យប្រភេទ

ទិន្នន័យប្រភេទគឺជាប្រភេទទិន្នន័យទូទៅបំផុតមួយដែលត្រូវបានជួបប្រទះនៅក្នុងការស្រាវជ្រាវ អាជីវកម្ម ទីផ្សារ សុខភាព ការអប់រំ និងសូម្បីតែការស្ទង់មតិពេញចិត្តរបស់អតិថិជន។ មិនដូចទិន្នន័យជាលេខ (ឧទាហរណ៍ អាយុ កម្ពស់ ប្រាក់ចំណូល) ដែលអាចត្រូវបានគណនាដោយប្រើមធ្យមភាគ ឬគម្លាតស្តង់ដារ ទិន្នន័យប្រភេទមានស្លាក ឬក្រុមដូចជា "ប្រុស/ស្រី" "យល់ស្រប/មិនយល់ស្រប" "ក/ខ/គ" ឬ "ពេញចិត្ត/អព្យាក្រឹត/មិនពេញចិត្ត"។ ដោយសារតែលក្ខណៈប្រភេទរបស់វា បច្ចេកទេសវិភាគតម្រូវឱ្យមានវិធីសាស្រ្តជាក់លាក់។ អត្ថបទនេះពិភាក្សាអំពីជំហានជាក់ស្តែង និងវិធីសាស្រ្តទូទៅសម្រាប់ការវិភាគទិន្នន័យប្រភេទប្រកបដោយប្រសិទ្ធភាព។

១. ការយល់ដឹងអំពីប្រភេទទិន្នន័យប្រភេទ

មុននឹងវិភាគ សូមយល់ជាមុនសិនថាទិន្នន័យប្រភេទណាដែលអ្នកមាន។ ជាទូទៅ មានពីរប្រភេទ៖

១) នាមករណ៍
ប្រភេទ​មិនមាន​លំដាប់លំដោយ​ទេ។ ឧទាហរណ៍៖ ភេទ ពណ៌​ដែល​ចូលចិត្ត ម៉ាក​ផលិតផល តំបន់​រស់នៅ។

២) លំដាប់លំដោយ
ប្រភេទ​នានា​មាន​លំដាប់ ឬ​កម្រិត។ ឧទាហរណ៍៖ កម្រិត​ពេញចិត្ត (មិនពេញចិត្ត – មធ្យម – ពេញចិត្ត) កម្រិត​អប់រំ (វិទ្យាល័យ – បរិញ្ញាបត្រ – អនុបណ្ឌិត) មាត្រដ្ឋាន Likert (មិនយល់ស្រប​យ៉ាងខ្លាំង – យល់ស្រប​យ៉ាងខ្លាំង)។

ភាពខុសគ្នានេះមានសារៈសំខាន់ណាស់ ពីព្រោះវាប៉ះពាល់ដល់បច្ចេកទេសវិភាគសមស្រប។ ទិន្នន័យលំដាប់អាចត្រូវបានវិភាគដោយពិចារណាលើលំដាប់របស់វា ខណៈដែលទិន្នន័យនាមមិនអាចធ្វើបានទេ។

២. ការរៀបចំទិន្នន័យ៖ លេខកូដ ស្លាក និងភាពស្អាតនៃទិន្នន័យ

ការវិភាគល្អតែងតែចាប់ផ្តើមជាមួយនឹងទិន្នន័យដែលបានរៀបចំ។ ជំហានរៀបចំដែលបានណែនាំ៖

– ស្តង់ដារនីយកម្មនៃការសរសេរប្រភេទ៖ ឧទាហរណ៍ “ប្រុស” ទល់នឹង “ប្រុស” ត្រូវតែបញ្ចូលគ្នា ដើម្បីកុំឱ្យពួកគេចាត់ទុកថាជាប្រភេទផ្សេងគ្នា។
– ដោះស្រាយតម្លៃដែលបាត់៖ សម្រេចចិត្តថាតើត្រូវលុប ចោទប្រកាន់ ឬបង្កើតប្រភេទដាច់ដោយឡែកដូចជា "មិនបានឆ្លើយ"។
– បង្កើត​កូដ​ប្រសិនបើចាំបាច់៖ ឧទាហរណ៍ យល់ព្រម=៤ អព្យាក្រឹត=៣ មិនយល់ព្រម=២។ ចំពោះតម្លៃនាម កូដលេខគ្រាន់តែជាស្លាកប៉ុណ្ណោះ មិនមែនជាតម្លៃគណិតវិទ្យាទេ។
– ពិនិត្យមើលប្រភេទដែលកម្រពេក៖ ប្រភេទដែលមានប្រេកង់ទាបខ្លាំងអាចរំខានដល់ការវិភាគ។ ពេលខ្លះពួកវាត្រូវបញ្ចូលគ្នាដើម្បីសម្រេចបានលទ្ធផលដែលមានស្ថេរភាពជាងមុន។

អាន  ស្ថិតិ​ក្នុង​ច្បាប់

៣. ការវិភាគពិពណ៌នា៖ ភាពញឹកញាប់ និងសមាមាត្រ

វិធី​មូលដ្ឋាន និង​សំខាន់​បំផុត​សម្រាប់​ទិន្នន័យ​ប្រភេទ​គឺ​ការ​គណនា៖

– ភាពញឹកញាប់៖ ចំនួនអ្នកឆ្លើយតប/ការសង្កេតនៅក្នុងប្រភេទនីមួយៗ។
– សមាមាត្រ ឬភាគរយ៖ ចែកប្រេកង់នឹងទិន្នន័យសរុប។

ឧទាហរណ៍សាមញ្ញមួយ៖ ក្នុងចំណោមអ្នកឆ្លើយតប 200 នាក់ មាន 120 នាក់ «ពេញចិត្ត» 50 នាក់ «អព្យាក្រឹត» និង 30 នាក់ «មិនពេញចិត្ត»។ ភាគរយនៃអ្នកឆ្លើយតបពេញចិត្តគឺ 60%។

ការវិភាគបែបពិពណ៌នាផ្តល់នូវទិដ្ឋភាពទូទៅដំបូងនៃការចែកចាយប្រភេទ។ ជាញឹកញាប់ ការរកឃើញសំខាន់ៗអាចមើលឃើញយ៉ាងច្បាស់នៅទីនេះ៖ ប្រភេទលេចធ្លោ ភាពខុសគ្នានៃសមាសភាពរវាងក្រុម ឬវត្តមាននៃប្រភេទ "សេស" ដោយសារតែចំនួនតូច ឬធំរបស់វា។

៤. ការមើលឃើញសមស្របសម្រាប់ទិន្នន័យប្រភេទ

ការមើលឃើញជួយអ្នកអានឱ្យយល់បានយ៉ាងឆាប់រហ័សអំពីលំនាំ។ តារាងទូទៅ៖

– តារាងរបារ (ដ្យាក្រាមរបារ): ស័ក្តិសមបំផុតសម្រាប់នាមករណ៍ និងលំដាប់លំដោយ។
– តារាងរបារដែលដាក់ជាជង់ (របារដែលដាក់ជាជង់)៖ ល្អសម្រាប់ការប្រៀបធៀបសមាសភាពប្រភេទនៅទូទាំងក្រុមច្រើន ឧទាហរណ៍ ការពេញចិត្តក្នុងមួយសាខា។
– តារាង​ចំណិត៖ អាច​ប្រើ​បាន ប៉ុន្តែ​វា​មិន​សូវ​មាន​ប្រសិទ្ធភាព​ទេ ប្រសិនបើ​មាន​ប្រភេទ​ច្រើន ឬ​មាន​ភាព​ខុស​គ្នា​តិចតួច។
– គ្រោង Mosaic៖ មានប្រយោជន៍សម្រាប់មើលទំនាក់ទំនងរវាងអថេរប្រភេទពីរ។
– តារាង Pareto៖ តារាងរបារដែលមានលំដាប់ពីប្រេកង់ខ្ពស់បំផុតទៅទាបបំផុត ដែលជារឿយៗត្រូវបានប្រើសម្រាប់ការវិភាគអាទិភាពបញ្ហា។

គន្លឹះ៖ សម្រាប់ទិន្នន័យលំដាប់លំដោយ សូមតម្រៀបប្រភេទតាមកម្រិត (ឧទាហរណ៍ ពី "មិនយល់ស្របយ៉ាងខ្លាំង" ទៅ "យល់ស្របយ៉ាងខ្លាំង") មិនមែនតាមលំដាប់អក្ខរក្រមទេ។

៥. ការបង្កើត Crosstab

ប្រសិនបើអ្នកចង់ឃើញទំនាក់ទំនងរវាងអថេរប្រភេទពីរ សូមប្រើផ្ទាំងឆ្លងកាត់។ ឧទាហរណ៍ ទំនាក់ទំនងរវាង “ភេទ” និង “ចំណូលចិត្តផលិតផល” ឬ “តំបន់” និង “ស្ថានភាពទិញ”។

ការវិភាគតារាងឆ្លងបង្កើតតារាងមួយដែលបង្ហាញពីចំនួននៃការសង្កេតដែលមាននៅក្នុងការរួមបញ្ចូលគ្នាជាក់លាក់នៃប្រភេទ។ អ្នកអាចបន្ថែម៖

– ភាគរយក្នុងមួយជួរ៖ ផ្តោតលើការចែកចាយប្រភេទជួរឈរនៅក្នុងជួរនីមួយៗ។
– ភាគរយក្នុងមួយជួរឈរ៖ ផ្តោតលើការចែកចាយប្រភេទជួរដេកនៅក្នុងជួរឈរនីមួយៗ។
– ភាគរយនៃចំនួនសរុប៖ ការរួមចំណែករបស់កោសិកានីមួយៗចំពោះចំនួនសរុប។

អាន  បច្ចេកទេសវិភាគទិន្នន័យស្ថិតិ

ជារឿយៗ Crosstabs ដើរតួជា "ស្ពាន" រវាងការធ្វើតេស្តពិពណ៌នា និងការធ្វើតេស្តស្ថិតិ។

៦. ការធ្វើតេស្ត Chi-Square សម្រាប់ឯករាជ្យភាព

ដើម្បីសាកល្បងថាតើអថេរប្រភេទពីរមានទំនាក់ទំនងគ្នា ឬឯករាជ្យ ការធ្វើតេស្តទូទៅបំផុតគឺការធ្វើតេស្តឯករាជ្យភាព Chi-Square (χ²)។ សម្មតិកម្មគឺ៖

– H0: គ្មានទំនាក់ទំនង (ឯករាជ្យ)
– H1: មានទំនាក់ទំនង (មិនឯករាជ្យ)

ប្រសិនបើតម្លៃ p តិចជាងកម្រិតសារៈសំខាន់ (ឧទាហរណ៍ 0,05) នោះមានភស្តុតាងនៃទំនាក់ទំនងរវាងអថេរទាំងពីរ។ កំណត់ចំណាំសំខាន់ៗមួយចំនួន៖ - ការធ្វើតេស្ត chi-square តម្រូវឱ្យមានទិន្នន័យគ្រប់គ្រាន់ ជាពិសេសនៅប្រេកង់ដែលរំពឹងទុក។ ប្រសិនបើមានក្រឡាច្រើនពេកដែលមានចំនួនដែលរំពឹងទុកទាប លទ្ធផលតេស្តអាចមិនត្រឹមត្រូវ។ - ប្រសិនបើគំរូមានទំហំតូច សូមពិចារណាការធ្វើតេស្ត Fisher's Exact (ជាពិសេសសម្រាប់តារាង 2x2)។ ៧. ការវាស់ស្ទង់កម្លាំងនៃទំនាក់ទំនង៖ Cramér's V និង Phi ការធ្វើតេស្ត chi-square បង្ហាញថាតើទំនាក់ទំនងមានឬអត់ ប៉ុន្តែមិនប្រាប់អ្នកថាវាខ្លាំងប៉ុណ្ណាទេ។ សម្រាប់គោលបំណងនេះ ទំហំបែបផែនត្រូវបានប្រើ៖ - Phi (φ)៖ សម្រាប់តារាង 2x2។ - Cramér's V៖ សម្រាប់តារាងធំជាង 2x2។ Cramér's V មានចាប់ពី 0–1៖ - ជិតនឹង 0៖ ទំនាក់ទំនងខ្សោយ - ជិតនឹង 1៖ ទំនាក់ទំនងខ្លាំង នៅក្នុងរបាយការណ៍ សូមលើកឡើងពីតម្លៃ p និងទំហំបែបផែនសម្រាប់ការបកស្រាយពេញលេញ។ ៨. ការវិភាគសម្រាប់ទិន្នន័យលំដាប់លំដោយ៖ ការធ្វើតេស្តទំនាក់ទំនងចំណាត់ថ្នាក់ និងនិន្នាការ ប្រសិនបើទិន្នន័យប្រភេទរបស់អ្នកជាលំដាប់លំដោយ អ្នកអាចប្រើវិធីសាស្រ្តដែលគិតគូរពីលំដាប់លំដោយ ឧទាហរណ៍៖ - ទំនាក់ទំនងចំណាត់ថ្នាក់ Spearman (សម្រាប់អថេរលំដាប់លំដោយពីរ ឬលំដាប់លំដោយទល់នឹងលេខមិនធម្មតា) - tau របស់ Kendall (ជម្រើសរបស់ Spearman ជាញឹកញាប់មានស្ថេរភាពសម្រាប់គំរូតូចៗ) - ការធ្វើតេស្តនិន្នាការនៅក្នុងតារាងបន្ទាន់ ដើម្បីមើលថាតើមានលំនាំកើនឡើង/ថយចុះជាប់លាប់ដែរឬទេ។ ឧទាហរណ៍៖ តើកម្រិតអប់រំ (វិទ្យាល័យ-បរិញ្ញាបត្រ-អនុបណ្ឌិត-បណ្ឌិត) ត្រូវបានផ្សារភ្ជាប់ជាមួយនឹងកម្រិតព្រមព្រៀង (1-5) ក្នុងលំនាំកើនឡើងដែរឬទេ? ៩. គំរូព្យាករណ៍៖ តំរែតំរង់ឡូជីស្ទីក ប្រសិនបើគោលដៅរបស់អ្នកមិនមែនគ្រាន់តែមើលទំនាក់ទំនងនោះទេ ប៉ុន្តែដើម្បីទស្សន៍ទាយប្រភេទដោយផ្អែកលើអថេរផ្សេងទៀត សូមប្រើតំរែតំរង់៖

អាន  បច្ចេកទេសបង្ហាញទិន្នន័យដោយប្រើអូហ្គៃវិជ្ជមាន និងអវិជ្ជមាន
- តំរែតំរង់ឡូជីស្ទីកគោលពីរ៖ សម្រាប់ទិន្នផលប្រភេទពីរ (ឧទាហរណ៍ "ទិញ" ទល់នឹង "កុំទិញ")។ - តំរែតំរង់ឡូជីស្ទីកពហុធា៖ ​​សម្រាប់ទិន្នផលដែលមានប្រភេទដែលមិនមានលំដាប់ច្រើនជាងពីរ (ឧទាហរណ៍ "កញ្ចប់ A/B/C")។ - តំរែតំរង់ឡូជីស្ទីកលំដាប់៖ សម្រាប់ទិន្នផលប្រភេទដែលមានលំដាប់ (ឧទាហរណ៍ ការពេញចិត្ត 1–5)។ គុណសម្បត្តិនៃតំរែតំរង់ឡូជីស្ទីក៖ អ្នកអាចរួមបញ្ចូលកត្តាព្យាករណ៍ច្រើនក្នុងពេលតែមួយ (អាយុ ទីតាំង បណ្តាញទីផ្សារ) និងទទួលបានការបកស្រាយដោយផ្អែកលើសមាមាត្រហាងឆេង ឧទាហរណ៍ "ប្រូបាប៊ីលីតេនៃការទិញបានកើនឡើង 1,8 ដងនៅក្នុងក្រុម X"។ 10. ការបកស្រាយលទ្ធផល និងការសរសេរសេចក្តីសន្និដ្ឋាន ការវិភាគទិន្នន័យប្រភេទល្អលើសពីចំនួន ប៉ុន្តែឆ្លើយសំណួរស្រាវជ្រាវយ៉ាងច្បាស់។ នៅពេលសរសេរសេចក្តីសន្និដ្ឋាន៖ - បញ្ជាក់ការចែកចាយសំខាន់ (ឧទាហរណ៍ "60% នៃអ្នកឆ្លើយតបពេញចិត្ត")។ - ប្រសិនបើមានការធ្វើតេស្តនៃការផ្សារភ្ជាប់ សូមរាយការណ៍ពីតម្លៃ p និងទំហំឥទ្ធិពល (ឧទាហរណ៍ Cramér's V)។ - ពន្យល់ពីសារៈសំខាន់ជាក់ស្តែង៖ ថាតើភាពខុសគ្នានេះសំខាន់សម្រាប់គោលនយោបាយ យុទ្ធសាស្ត្រទីផ្សារ ឬការសម្រេចចិត្តរបស់អង្គការដែរឬទេ។ - ជៀសវាងការអះអាងពីមូលហេតុ ប្រសិនបើទិន្នន័យមានលក្ខណៈសង្កេត។ ការផ្សារភ្ជាប់មិនតែងតែបញ្ជាក់ពីមូលហេតុនោះទេ។ ការវិភាគទិន្នន័យប្រភេទតម្រូវឱ្យមានការយល់ដឹងអំពីប្រភេទទិន្នន័យ (នាមធៀបនឹងលំដាប់) ការពិពណ៌នាច្បាស់លាស់អំពីប្រេកង់ ការមើលឃើញសមស្រប ការវិភាគឆ្លងកាត់តារាង និងការធ្វើតេស្តស្ថិតិដូចជា chi-square និងទំហំបែបផែនដូចជា Cramér's V។ សម្រាប់គោលបំណងព្យាករណ៍ តំរែតំរង់ឡូជីស្ទីកគឺជាឧបករណ៍ដ៏មានឥទ្ធិពលខ្លាំង។ ជាមួយនឹងជំហានទាំងនេះ អ្នកអាចបំលែងទិន្នន័យដែលមានស្លាកទៅជាការយល់ដឹងខាងស្ថិតិដែលមានប្រយោជន៍សម្រាប់ការធ្វើការសម្រេចចិត្ត។ ប្រសិនបើអ្នកចង់បាន ខ្ញុំអាចជួយអ្នកបង្កើតការវិភាគគំរូ (ឧទាហរណ៍ ការប្រើប្រាស់ Excel, SPSS, R ឬ Python) ដោយផ្អែកលើសំណុំទិន្នន័យ ឬការសិក្សាករណីរបស់អ្នក។

សូម​បញ្ចេញ​មតិ