តើអ្វីទៅជា outlier នៅក្នុងស្ថិតិ?

តើអ្វីទៅជា Outlier នៅក្នុងស្ថិតិ

នៅក្នុងស្ថិតិ ទិន្នន័យគឺជាវត្ថុធាតុដើមចម្បងសម្រាប់ការយល់ដឹងអំពីបាតុភូត៖ ឥរិយាបថអ្នកប្រើប្រាស់ លទ្ធផលតេស្ត សុខភាពអ្នកជំងឺ គុណភាពផលិតកម្ម និងសូម្បីតែនិន្នាការសេដ្ឋកិច្ច។ ទោះជាយ៉ាងណាក៏ដោយ មិនមែនចំណុចទិន្នន័យទាំងអស់សុទ្ធតែ "មានឥរិយាបថ" ដូចភាគច្រើននោះទេ។ ពេលខ្លះយើងជួបប្រទះតម្លៃមួយ ឬច្រើនដែលហាក់ដូចជាខុសគ្នាយ៉ាងខ្លាំងពីទិន្នន័យដែលនៅសល់។ កត្តាមិនប្រក្រតីទាំងនេះត្រូវបានគេស្គាល់ថាជាកត្តាមិនប្រក្រតី។ ការយល់ដឹងអំពីកត្តាមិនប្រក្រតីគឺមានសារៈសំខាន់ ពីព្រោះវាអាចផ្លាស់ប្តូរការសន្និដ្ឋានវិភាគ មានឥទ្ធិពលលើគំរូព្យាករណ៍ និងថែមទាំងបង្ហាញពីព្រឹត្តិការណ៍សំខាន់ៗដែលគួរស៊ើបអង្កេតទៀតផង។

ការយល់ដឹងអំពីភាពមិនប្រក្រតី

និយាយ​ឲ្យ​សាមញ្ញ​ទៅ តម្លៃ​ក្រៅ​ស្តង់ដារ (Outlier) គឺជា​តម្លៃ​សង្កេត ឬ​ទិន្នន័យ​ដែល​ខុសគ្នា​យ៉ាងខ្លាំង​ពី​ទិន្នន័យ​ភាគច្រើន។ តម្លៃ​ក្រៅ​ស្តង់ដារ​អាច​ខ្ពស់​ជាង (ខ្ពស់​ខ្លាំង) ឬ​ទាប​ជាង (ទាប​ខ្លាំង) ជាង​គំរូ​ទូទៅ។ ឧទាហរណ៍ ប្រសិនបើ​ពិន្ទុ​តេស្ត​របស់​សិស្ស​ភាគច្រើន​ធ្លាក់​ក្នុង​ចន្លោះ 60–90 ហើយ​ពិន្ទុ​តែមួយ​ពី 5 ឬ 100 ប្រែប្រួល​គួរឱ្យកត់សម្គាល់ ពិន្ទុ​នោះ​គួរតែ​ត្រូវបាន​សង្ស័យថា​ជា​តម្លៃ​ក្រៅ​ស្តង់ដារ។

ចំណុចសំខាន់ដែលត្រូវសង្កត់ធ្ងន់៖ តម្លៃ​ខុស​ប្រក្រតី​មិនតែងតែមានន័យថា "កំហុស" នោះទេ។ តម្លៃ​ខុស​ប្រក្រតី​គ្រាន់តែបង្ហាញថាតម្លៃនេះមិនធម្មតាបើប្រៀបធៀបទៅនឹងសំណុំទិន្នន័យ។ តម្លៃខុស​ប្រក្រតី​អាចកើតឡើងពីកំហុសក្នុងការបញ្ចូល ឧបករណ៍វាស់ស្ទង់ដែលមានបញ្ហា ឬគ្រាន់តែឆ្លុះបញ្ចាំងពីព្រឹត្តិការណ៍ដ៏កម្រ ប៉ុន្តែសំខាន់ក្នុងពិភពពិត។

ឧទាហរណ៍សាមញ្ញ

ស្រមៃមើលទិន្នន័យប្រាក់ចំណូលប្រចាំខែ (គិតជាលានរូពី) របស់មនុស្ស 10 នាក់៖
5, 5, 6, 6, 6, 7, 7, 7, 8, 50

នៅទីនេះ លេខ 50 លេចធ្លោយ៉ាងខ្លាំងបើប្រៀបធៀបទៅនឹងលេខដទៃទៀត។ តើលេខ 50 ជាកំហុសទេ? វាអាចជាការអានខុស (វាគួរតែមាន 5,0) ប៉ុន្តែវាក៏អាចត្រឹមត្រូវដែរ ព្រោះបុគ្គលនោះជាម្ចាស់អាជីវកម្មធំមួយ។ ក្នុងករណីណាក៏ដោយ លេខ 50 នៅតែជាលេខមិនសំខាន់ - អ្វីដែលខុសគ្នាគឺរបៀបដែលយើងចាត់ទុកវានៅក្នុងការវិភាគ។

ហេតុអ្វីបានជាអថេរក្រៅប្រព័ន្ធលេចឡើង?

មានមូលហេតុទូទៅជាច្រើនសម្រាប់ការលេចឡើងនៃកត្តាមិនប្រក្រតី៖

១. កំហុសក្នុងការវាស់វែង ឬឧបករណ៍
ឧទាហរណ៍ ឧបករណ៍ចាប់សញ្ញាសីតុណ្ហភាពពេលខ្លះអាចអានតម្លៃខ្លាំងដោយសារតែការជ្រៀតជ្រែក។

2. កំហុសក្នុងការកត់ត្រា ឬបញ្ចូលទិន្នន័យ
ឧទាហរណ៍បុរាណ៖ វាយបញ្ចូល 1000 ជំនួសឲ្យ 100 ឬឯកតាខុស (សង់ទីម៉ែត្រ ទល់នឹង ម៉ែត្រ)។

អាន  ស្ថិតិក្នុងការសិក្សាអំពីយេនឌ័រ

៣. បំរែបំរួលធម្មជាតិ
នៅក្នុងពិភពពិត មានបាតុភូតដ៏កម្រ ប៉ុន្តែប្រាកដនិយម៖ ការកើនឡើងនៃការលក់ដោយសារតែការផ្សព្វផ្សាយដ៏ធំមួយ អ្នកជំងឺមានប្រតិកម្មមិនធម្មតាចំពោះថ្នាំ ឬអត្តពលិកម្នាក់បានបង្កើតកំណត់ត្រាដ៏អាក្រក់បំផុត។

៤. ការផ្លាស់ប្តូរដំណើរការ ឬលក្ខខណ្ឌ
ឧទាហរណ៍ រោងចក្រមួយជួបប្រទះនឹងការខូចម៉ាស៊ីននៅថ្ងៃជាក់លាក់ណាមួយ ដែលបណ្តាលឱ្យចំនួនផលិតផលដែលមានបញ្ហាកើនឡើងយ៉ាងខ្លាំង។

៥. ប្រជាជនចម្រុះ
សំណុំទិន្នន័យអាចមានក្រុមផ្សេងៗគ្នាជាច្រើនរួមបញ្ចូលគ្នា។ ឧទាហរណ៍ កម្ពស់របស់សិស្សវិទ្យាល័យ និងនិស្សិតមហាវិទ្យាល័យគឺលាយឡំគ្នា។ តម្លៃ "ខ្លាំង" មួយចំនួនអាចលេចឡើងមិនមែនដោយសារតែភាពមិនប្រក្រតីនោះទេ ប៉ុន្តែដោយសារតែក្រុមទាំងនោះខុសគ្នាយ៉ាងពិតប្រាកដ។

ផលប៉ះពាល់នៃកត្តាខាងក្រៅលើការវិភាគស្ថិតិ

តម្លៃ​ខុស​ប្រក្រតី​មាន​សារៈសំខាន់​ពីព្រោះ​វា​អាច​ប៉ះពាល់​យ៉ាង​ខ្លាំង​ដល់​លទ្ធផល​នៃ​ការវិភាគ ជាពិសេស​ក្នុង​វិធីសាស្ត្រ​ដែល​ងាយ​នឹង​ប្រែប្រួល​ទៅ​តាម​តម្លៃ​ខ្លាំង។

១. ប៉ះពាល់ដល់មធ្យមភាគ (មធ្យមភាគ)
មធ្យមភាគ​ងាយ​នឹង​ត្រូវ​បាន "ទាញ" ដោយ​តម្លៃ​ខ្លាំង។ នៅ​ក្នុង​ឧទាហរណ៍​ចំណូល​ខាងលើ មធ្យមភាគ​នឹង​ត្រូវ​បាន​បំប៉ោង​យ៉ាង​ខ្លាំង​ដោយ​តម្លៃ 50 ទោះបីជា​ភាគច្រើន​មាន​ប្រហែល 5-8 ក៏ដោយ។

2. ប៉ះពាល់ដល់គម្លាតស្តង់ដារ និងភាពខុសគ្នា
ដោយសារតែការគណនាភាពខុសគ្នាពាក់ព័ន្ធនឹងភាពខុសគ្នាការ៉េពីមធ្យមភាគ ភាពខុសគ្នាអាចបំប៉ោងភាពខុសគ្នា និងគម្លាតស្តង់ដារ ដែលធ្វើឱ្យវាហាក់ដូចជាទិន្នន័យត្រូវបាន "រីករាលដាល" ច្រើនជាងការពិត។

៣. គំរូ​តំរែតំរង់​ដែល​រំខាន និង​ការ​រៀន​របស់​ម៉ាស៊ីន
នៅក្នុងការវិភាគតំរែតំរង់លីនេអ៊ែរ កត្តាខុសប្រក្រតីអាចធ្វើឱ្យបន្ទាត់តំរែតំរង់មានភាពលំអៀង ដែលធ្វើឱ្យការព្យាករណ៍មិនល្អសម្រាប់ទិន្នន័យភាគច្រើន។ នៅក្នុងក្បួនដោះស្រាយមួយចំនួន កត្តាខុសប្រក្រតីអាចបណ្តាលឱ្យគំរូសមពេក ឬប៉ះពាល់ដល់ប៉ារ៉ាម៉ែត្របណ្តុះបណ្តាល។

៤. ការធ្វើតេស្តសម្មតិកម្មឥទ្ធិពល
ភាពខុសគ្នាអាចបំពានលើសម្មតិកម្មនៃភាពធម្មតា និងភាពដូចគ្នានៃភាពខុសគ្នា ដែលត្រូវបានគេប្រើជាញឹកញាប់នៅក្នុងការធ្វើតេស្តប៉ារ៉ាម៉ែត្រ ដូច្នេះការសន្និដ្ឋានស្ថិតិក្លាយជាលំអៀង។

ទោះជាយ៉ាងណាក៏ដោយ កត្តាមិនប្រក្រតីក៏អាចជាសញ្ញាសំខាន់ៗផងដែរ។ ក្នុងការរកឃើញការក្លែងបន្លំ ប្រតិបត្តិការមិនប្រក្រតីគឺជាអ្វីដែលយើងចង់ស្វែងរក។ ក្នុងវិស័យថែទាំសុខភាព លទ្ធផលមន្ទីរពិសោធន៍ខុសគ្នាខ្លាំងអាចបង្ហាញពីស្ថានភាពវេជ្ជសាស្ត្រធ្ងន់ធ្ងរ។

របៀបរកឃើញភាពមិនប្រក្រតី

គ្មានវិធីសាស្ត្រ "ត្រឹមត្រូវ" ណាមួយឡើយ។ ការរកឃើញ Outlier ជារឿយៗអាស្រ័យលើបរិបទ ប្រភេទទិន្នន័យ និងគោលបំណងវិភាគ។ ខាងក្រោមនេះគឺជាវិធីសាស្ត្រទូទៅមួយចំនួន៖

អាន  ការធ្វើតេស្ត Kruskal Wallis ក្នុងស្ថិតិ

១. ការមើលឃើញ៖ Boxplot និង Scatterplot
– Boxplots មានប្រជាប្រិយភាពខ្លាំងសម្រាប់ការរកឃើញ outliers។ នៅក្នុង Boxplot ជាធម្មតា outliers ត្រូវបានសម្គាល់ជាចំណុចដែលធ្លាក់នៅខាងក្រៅប្រអប់ whisker។
– Scatterplots ជួយមើលឃើញភាពមិនប្រក្រតីនៃទំនាក់ទំនងរវាងអថេរពីរ ឧទាហរណ៍ ទម្ងន់ ទល់នឹង កម្ពស់។

ការមើលឃើញរូបភាពមានប្រយោជន៍ជាជំហានដំបូង ពីព្រោះវារហ័ស និងងាយស្រួលយល់។

2. វិធីសាស្ត្រ IQR (ជួរអន្តរក្វាទីល)
វិធីសាស្ត្រ IQR ត្រូវបានគេប្រើជាញឹកញាប់សម្រាប់ទិន្នន័យអថេរតែមួយ (univariate)។
– គណនា Q1 (quartile 1) និង Q3 (quartile 3)
– IQR = ត្រីមាសទី 3 − ត្រីមាសទី 1
– ដែនកំណត់ខាងក្រោម = Q1 − 1,5 × IQR
– ដែនកំណត់ខាងលើ = Q3 + 1,5 × IQR

តម្លៃ​ដែល​នៅ​ក្រៅ​ដែន​កំណត់​ទាំងនេះ​ជាធម្មតា​ត្រូវ​បាន​ចាត់​ទុក​ថា​ជា​តម្លៃ​មិន​ប្រក្រតី។ វិធីសាស្ត្រ​នេះ​មាន​ភាព​រឹងមាំ​ទាក់ទង​គ្នា​ព្រោះ​វា​មិន​ត្រូវ​បាន​ប៉ះពាល់​ខ្លាំង​ដោយ​តម្លៃ​ខ្លាំង​ពេក។

៣. ពិន្ទុ Z (ផ្អែកលើមធ្យមភាគ និងគម្លាតស្តង់ដារ)
ពិន្ទុ Z វាស់ចម្ងាយពីតម្លៃមួយជាឯកតាគម្លាតស្តង់ដារ។
– z = (x − មធ្យម) / sd
តម្លៃ​ដែល |z| > 3 (ពេលខ្លះ > 2,5) ជារឿយៗត្រូវបានចាត់ទុកថាជាតម្លៃក្រៅប្រព័ន្ធ។

ចំណុចខ្សោយ៖ ប្រសិនបើទិន្នន័យមាន outliers ធំៗរួចហើយ មធ្យមភាគ និង sd នឹងរងផលប៉ះពាល់ ដូច្នេះការរកឃើញអាចមានភាពត្រឹមត្រូវតិចជាង។

៤. វិធីសាស្ត្រផ្អែកលើគំរូ និងពហុអថេរ
ចំពោះទិន្នន័យពហុអថេរ កត្តា​មិនតែងតែអាចមើលឃើញនៅក្នុងជួរឈរតែមួយនោះទេ ប៉ុន្តែនៅក្នុងការរួមបញ្ចូលគ្នានៃអថេរជាច្រើន។
– ចម្ងាយ Mahalanobis ត្រូវបានគេប្រើជាញឹកញាប់ដើម្បីរកឃើញ outliers ពហុអថេរ។
– នៅក្នុងការរៀនម៉ាស៊ីន មានវិធីសាស្រ្តដូចជា Isolation Forest, Local Outlier Factor (LOF) ឬ One-Class SVM។

វិធីសាស្ត្រនេះគឺសមរម្យសម្រាប់សំណុំទិន្នន័យធំៗ និងស្មុគស្មាញ ឧទាហរណ៍ ការរកឃើញភាពមិនប្រក្រតីនៃប្រតិបត្តិការហិរញ្ញវត្ថុ។

អ្វីដែលត្រូវធ្វើប្រសិនបើអ្នករកឃើញ Outlier?

វិធីល្អបំផុតគឺមិនត្រូវលុបវាចោលនោះទេ។ ជាទូទៅ ដំណើរការដោះស្រាយ​កំហុស​ពាក់ព័ន្ធនឹងជំហានជាច្រើន៖

១. ការផ្ទៀងផ្ទាត់ទិន្នន័យ
- ពិនិត្យមើលការបញ្ចូលមិនត្រឹមត្រូវ ការចម្លង ឬឯកតាមិនត្រឹមត្រូវ។
– ប្រៀបធៀបជាមួយប្រភពទិន្នន័យដើម (ឧទាហរណ៍ ទម្រង់បែបបទ កំណត់ហេតុឧបករណ៍ចាប់សញ្ញា ឬកំណត់ត្រាដោយដៃ)។

២. យល់ពីបរិបទ
– តើតម្លៃខ្លាំងមានន័យនៅក្នុងដែនដែរឬទេ?
– ឧទាហរណ៍ សីតុណ្ហភាពរាងកាយមនុស្ស ៥០អង្សាសេ គឺស្ទើរតែមិនត្រឹមត្រូវទេ ប៉ុន្តែប្រាក់ចំណូល ៥០លានដុល្លារ អាចសមហេតុផល។

អាន  ការយល់ដឹងអំពីភាពលំអៀង និង ឃើតូស៊ីស

៣. កំណត់គោលបំណងនៃការវិភាគ
– ប្រសិនបើគោលដៅគឺដើម្បីយល់ពីឥរិយាបថ "ទូទៅ" នោះអ្នកដែលមានចរិតលក្ខណៈមិនប្រក្រតីអាចត្រូវដោះស្រាយ ដើម្បីការពារពួកគេពីការត្រួតត្រា។
– ប្រសិនបើគោលដៅគឺដើម្បីស្វែងរកព្រឹត្តិការណ៍កម្រ (ការក្លែងបន្លំ ការបរាជ័យរបស់ម៉ាស៊ីន) នោះចំណុចសំខាន់គឺការផ្តោតអារម្មណ៍ចម្បង។

៤. ជ្រើសរើសយុទ្ធសាស្ត្រដោះស្រាយ
ជម្រើសទូទៅមួយចំនួន៖
– ការដកចេញ៖ ធ្វើឡើងប្រសិនបើចំណុចខុសប្រក្រតីត្រូវបានបង្ហាញថាជាកំហុស ហើយមិនមែនជាតំណាង។
– ការបំលែងទិន្នន័យ៖ ឧទាហរណ៍ ការបំលែងឡូហ្គលសម្រាប់ទិន្នន័យដែលមានភាពលំអៀង។
– ការឈ្នះ / ការដាក់កម្រិត៖ កំណត់តម្លៃខ្លាំងចំពោះភាគរយជាក់លាក់ (ឧទាហរណ៍ p1 និង p99)។
– ប្រើវិធីសាស្ត្ររឹងមាំ៖ មេឌីយ៉ាន អាយឃ្យូអរ តំរែតំរង់រឹងមាំ ឬម៉ូដែលធន់នឹងការខុសប្រក្រតី។
– ការវិភាគដាច់ដោយឡែក៖ ពេលខ្លះវាសមស្របជាងក្នុងការវិភាគកត្តាមិនប្រក្រតីជាករណីពិសេស។

អ្វីដែលសំខាន់នោះ ការសម្រេចចិត្តត្រូវតែត្រូវបានកត់ត្រាទុក ដើម្បីឱ្យការវិភាគមានតម្លាភាព និងទទួលខុសត្រូវ។

Outliers: បញ្ហា ឬព័ត៌មានដ៏មានតម្លៃ?

ជារឿយៗ កត្តា​មិន​ប្រក្រតី​ត្រូវ​បាន​ចាត់​ទុក​ថា​ជា "សំឡេង​រំខាន" ពីព្រោះ​វា​អាច​បង្ខូច​ទ្រង់ទ្រាយ​សេចក្តី​សង្ខេប​ស្ថិតិ។ ទោះជាយ៉ាងណាក៏ដោយ ក្នុងករណីជាច្រើន កត្តា​មិន​ប្រក្រតី​គឺជា​ច្រកទ្វារ​ទៅកាន់​ការយល់ដឹង​ថ្មីៗ៖ អត្ថិភាព​នៃ​ផ្នែក​អតិថិជន​លំដាប់​ខ្ពស់ ស្ថានភាព​អ្នកជំងឺ​ដែល​ត្រូវការ​ការយកចិត្តទុកដាក់ ដំណាក់កាល​ថ្មី​ក្នុង​ដំណើរការ​ផលិតកម្ម ឬ​ការក្លែងបន្លំ​ដែល​អាច​កើតមាន។ ដូច្នេះ កត្តា​មិន​ប្រក្រតី​គួរ​ត្រូវ​បាន​ចាត់ទុក​ថា​ជា​អ្វីមួយ​ដែល​ត្រូវ​ការ​ស៊ើបអង្កេត មិនមែន​ត្រូវ​បាន​ច្រានចោល​ដោយ​ស្វ័យប្រវត្តិ​នោះទេ។

សេចក្តីសន្និដ្ឋាន

តម្លៃ​ខុស​ប្រក្រតី​ក្នុង​ស្ថិតិ គឺជា​តម្លៃ​ដែល​ងាក​ចេញ​យ៉ាង​ខ្លាំង​ពី​គំរូ​ទូទៅ​នៃ​ទិន្នន័យ។ តម្លៃ​ខុស​ប្រក្រតី​អាច​កើតឡើង​ដោយសារ​កំហុស ភាព​ប្រែប្រួល​ធម្មជាតិ ការ​ផ្លាស់ប្ដូរ​ដំណើរការ ឬ​ភាព​ខុស​គ្នា​ជា​ក្រុម​ក្នុង​សំណុំ​ទិន្នន័យ។ ផលប៉ះពាល់​របស់​វា​អាច​មាន​សារៈសំខាន់​លើ​មធ្យមភាគ ភាព​ប្រែប្រួល ការធ្វើតេស្ត​ស្ថិតិ និង​គំរូ​ព្យាករណ៍។ ការរកឃើញ​តម្លៃ​ខុស​ប្រក្រតី​អាច​សម្រេច​បាន​តាមរយៈ​ការមើលឃើញ វិធីសាស្ត្រ IQR ពិន្ទុ z និង​សូម្បីតែ​វិធីសាស្ត្រ​ពហុ​អថេរ និង​ការរៀន​ម៉ាស៊ីន។ ការដោះស្រាយ​ត្រូវតែ​ពិចារណា​ពី​បរិបទ និង​គោលបំណង៖ ការផ្ទៀងផ្ទាត់ ការយល់ដឹង​ពី​មូលហេតុ និង​បន្ទាប់មក​ជ្រើសរើស​យុទ្ធសាស្ត្រ​ដូចជា​ការដកចេញ ការបំប្លែង ការកំណត់​តម្លៃ ឬ​ការប្រើប្រាស់​វិធីសាស្ត្រ​រឹងមាំ។

ដោយមានការយល់ដឹងត្រឹមត្រូវ លេខខុសប្រក្រតីមិនមែនគ្រាន់តែជា "លេខសេស" នោះទេ ប៉ុន្តែវាក៏ជាធាតុផ្សំសំខាន់ៗនៃការអនុវត្តស្ថិតិ ដែលអាចធ្វើអោយប្រសើរឡើងនូវគុណភាពនៃការវិភាគ និងការសម្រេចចិត្តដែលជំរុញដោយទិន្នន័យ។

សូម​បញ្ចេញ​មតិ