តើអ្វីទៅជា Outlier នៅក្នុងស្ថិតិ
នៅក្នុងស្ថិតិ ទិន្នន័យគឺជាវត្ថុធាតុដើមចម្បងសម្រាប់ការយល់ដឹងអំពីបាតុភូត៖ ឥរិយាបថអ្នកប្រើប្រាស់ លទ្ធផលតេស្ត សុខភាពអ្នកជំងឺ គុណភាពផលិតកម្ម និងសូម្បីតែនិន្នាការសេដ្ឋកិច្ច។ ទោះជាយ៉ាងណាក៏ដោយ មិនមែនចំណុចទិន្នន័យទាំងអស់សុទ្ធតែ "មានឥរិយាបថ" ដូចភាគច្រើននោះទេ។ ពេលខ្លះយើងជួបប្រទះតម្លៃមួយ ឬច្រើនដែលហាក់ដូចជាខុសគ្នាយ៉ាងខ្លាំងពីទិន្នន័យដែលនៅសល់។ កត្តាមិនប្រក្រតីទាំងនេះត្រូវបានគេស្គាល់ថាជាកត្តាមិនប្រក្រតី។ ការយល់ដឹងអំពីកត្តាមិនប្រក្រតីគឺមានសារៈសំខាន់ ពីព្រោះវាអាចផ្លាស់ប្តូរការសន្និដ្ឋានវិភាគ មានឥទ្ធិពលលើគំរូព្យាករណ៍ និងថែមទាំងបង្ហាញពីព្រឹត្តិការណ៍សំខាន់ៗដែលគួរស៊ើបអង្កេតទៀតផង។
ការយល់ដឹងអំពីភាពមិនប្រក្រតី
និយាយឲ្យសាមញ្ញទៅ តម្លៃក្រៅស្តង់ដារ (Outlier) គឺជាតម្លៃសង្កេត ឬទិន្នន័យដែលខុសគ្នាយ៉ាងខ្លាំងពីទិន្នន័យភាគច្រើន។ តម្លៃក្រៅស្តង់ដារអាចខ្ពស់ជាង (ខ្ពស់ខ្លាំង) ឬទាបជាង (ទាបខ្លាំង) ជាងគំរូទូទៅ។ ឧទាហរណ៍ ប្រសិនបើពិន្ទុតេស្តរបស់សិស្សភាគច្រើនធ្លាក់ក្នុងចន្លោះ 60–90 ហើយពិន្ទុតែមួយពី 5 ឬ 100 ប្រែប្រួលគួរឱ្យកត់សម្គាល់ ពិន្ទុនោះគួរតែត្រូវបានសង្ស័យថាជាតម្លៃក្រៅស្តង់ដារ។
ចំណុចសំខាន់ដែលត្រូវសង្កត់ធ្ងន់៖ តម្លៃខុសប្រក្រតីមិនតែងតែមានន័យថា "កំហុស" នោះទេ។ តម្លៃខុសប្រក្រតីគ្រាន់តែបង្ហាញថាតម្លៃនេះមិនធម្មតាបើប្រៀបធៀបទៅនឹងសំណុំទិន្នន័យ។ តម្លៃខុសប្រក្រតីអាចកើតឡើងពីកំហុសក្នុងការបញ្ចូល ឧបករណ៍វាស់ស្ទង់ដែលមានបញ្ហា ឬគ្រាន់តែឆ្លុះបញ្ចាំងពីព្រឹត្តិការណ៍ដ៏កម្រ ប៉ុន្តែសំខាន់ក្នុងពិភពពិត។
ឧទាហរណ៍សាមញ្ញ
ស្រមៃមើលទិន្នន័យប្រាក់ចំណូលប្រចាំខែ (គិតជាលានរូពី) របស់មនុស្ស 10 នាក់៖
5, 5, 6, 6, 6, 7, 7, 7, 8, 50
នៅទីនេះ លេខ 50 លេចធ្លោយ៉ាងខ្លាំងបើប្រៀបធៀបទៅនឹងលេខដទៃទៀត។ តើលេខ 50 ជាកំហុសទេ? វាអាចជាការអានខុស (វាគួរតែមាន 5,0) ប៉ុន្តែវាក៏អាចត្រឹមត្រូវដែរ ព្រោះបុគ្គលនោះជាម្ចាស់អាជីវកម្មធំមួយ។ ក្នុងករណីណាក៏ដោយ លេខ 50 នៅតែជាលេខមិនសំខាន់ - អ្វីដែលខុសគ្នាគឺរបៀបដែលយើងចាត់ទុកវានៅក្នុងការវិភាគ។
ហេតុអ្វីបានជាអថេរក្រៅប្រព័ន្ធលេចឡើង?
មានមូលហេតុទូទៅជាច្រើនសម្រាប់ការលេចឡើងនៃកត្តាមិនប្រក្រតី៖
១. កំហុសក្នុងការវាស់វែង ឬឧបករណ៍
ឧទាហរណ៍ ឧបករណ៍ចាប់សញ្ញាសីតុណ្ហភាពពេលខ្លះអាចអានតម្លៃខ្លាំងដោយសារតែការជ្រៀតជ្រែក។
2. កំហុសក្នុងការកត់ត្រា ឬបញ្ចូលទិន្នន័យ
ឧទាហរណ៍បុរាណ៖ វាយបញ្ចូល 1000 ជំនួសឲ្យ 100 ឬឯកតាខុស (សង់ទីម៉ែត្រ ទល់នឹង ម៉ែត្រ)។
៣. បំរែបំរួលធម្មជាតិ
នៅក្នុងពិភពពិត មានបាតុភូតដ៏កម្រ ប៉ុន្តែប្រាកដនិយម៖ ការកើនឡើងនៃការលក់ដោយសារតែការផ្សព្វផ្សាយដ៏ធំមួយ អ្នកជំងឺមានប្រតិកម្មមិនធម្មតាចំពោះថ្នាំ ឬអត្តពលិកម្នាក់បានបង្កើតកំណត់ត្រាដ៏អាក្រក់បំផុត។
៤. ការផ្លាស់ប្តូរដំណើរការ ឬលក្ខខណ្ឌ
ឧទាហរណ៍ រោងចក្រមួយជួបប្រទះនឹងការខូចម៉ាស៊ីននៅថ្ងៃជាក់លាក់ណាមួយ ដែលបណ្តាលឱ្យចំនួនផលិតផលដែលមានបញ្ហាកើនឡើងយ៉ាងខ្លាំង។
៥. ប្រជាជនចម្រុះ
សំណុំទិន្នន័យអាចមានក្រុមផ្សេងៗគ្នាជាច្រើនរួមបញ្ចូលគ្នា។ ឧទាហរណ៍ កម្ពស់របស់សិស្សវិទ្យាល័យ និងនិស្សិតមហាវិទ្យាល័យគឺលាយឡំគ្នា។ តម្លៃ "ខ្លាំង" មួយចំនួនអាចលេចឡើងមិនមែនដោយសារតែភាពមិនប្រក្រតីនោះទេ ប៉ុន្តែដោយសារតែក្រុមទាំងនោះខុសគ្នាយ៉ាងពិតប្រាកដ។
ផលប៉ះពាល់នៃកត្តាខាងក្រៅលើការវិភាគស្ថិតិ
តម្លៃខុសប្រក្រតីមានសារៈសំខាន់ពីព្រោះវាអាចប៉ះពាល់យ៉ាងខ្លាំងដល់លទ្ធផលនៃការវិភាគ ជាពិសេសក្នុងវិធីសាស្ត្រដែលងាយនឹងប្រែប្រួលទៅតាមតម្លៃខ្លាំង។
១. ប៉ះពាល់ដល់មធ្យមភាគ (មធ្យមភាគ)
មធ្យមភាគងាយនឹងត្រូវបាន "ទាញ" ដោយតម្លៃខ្លាំង។ នៅក្នុងឧទាហរណ៍ចំណូលខាងលើ មធ្យមភាគនឹងត្រូវបានបំប៉ោងយ៉ាងខ្លាំងដោយតម្លៃ 50 ទោះបីជាភាគច្រើនមានប្រហែល 5-8 ក៏ដោយ។
2. ប៉ះពាល់ដល់គម្លាតស្តង់ដារ និងភាពខុសគ្នា
ដោយសារតែការគណនាភាពខុសគ្នាពាក់ព័ន្ធនឹងភាពខុសគ្នាការ៉េពីមធ្យមភាគ ភាពខុសគ្នាអាចបំប៉ោងភាពខុសគ្នា និងគម្លាតស្តង់ដារ ដែលធ្វើឱ្យវាហាក់ដូចជាទិន្នន័យត្រូវបាន "រីករាលដាល" ច្រើនជាងការពិត។
៣. គំរូតំរែតំរង់ដែលរំខាន និងការរៀនរបស់ម៉ាស៊ីន
នៅក្នុងការវិភាគតំរែតំរង់លីនេអ៊ែរ កត្តាខុសប្រក្រតីអាចធ្វើឱ្យបន្ទាត់តំរែតំរង់មានភាពលំអៀង ដែលធ្វើឱ្យការព្យាករណ៍មិនល្អសម្រាប់ទិន្នន័យភាគច្រើន។ នៅក្នុងក្បួនដោះស្រាយមួយចំនួន កត្តាខុសប្រក្រតីអាចបណ្តាលឱ្យគំរូសមពេក ឬប៉ះពាល់ដល់ប៉ារ៉ាម៉ែត្របណ្តុះបណ្តាល។
៤. ការធ្វើតេស្តសម្មតិកម្មឥទ្ធិពល
ភាពខុសគ្នាអាចបំពានលើសម្មតិកម្មនៃភាពធម្មតា និងភាពដូចគ្នានៃភាពខុសគ្នា ដែលត្រូវបានគេប្រើជាញឹកញាប់នៅក្នុងការធ្វើតេស្តប៉ារ៉ាម៉ែត្រ ដូច្នេះការសន្និដ្ឋានស្ថិតិក្លាយជាលំអៀង។
ទោះជាយ៉ាងណាក៏ដោយ កត្តាមិនប្រក្រតីក៏អាចជាសញ្ញាសំខាន់ៗផងដែរ។ ក្នុងការរកឃើញការក្លែងបន្លំ ប្រតិបត្តិការមិនប្រក្រតីគឺជាអ្វីដែលយើងចង់ស្វែងរក។ ក្នុងវិស័យថែទាំសុខភាព លទ្ធផលមន្ទីរពិសោធន៍ខុសគ្នាខ្លាំងអាចបង្ហាញពីស្ថានភាពវេជ្ជសាស្ត្រធ្ងន់ធ្ងរ។
របៀបរកឃើញភាពមិនប្រក្រតី
គ្មានវិធីសាស្ត្រ "ត្រឹមត្រូវ" ណាមួយឡើយ។ ការរកឃើញ Outlier ជារឿយៗអាស្រ័យលើបរិបទ ប្រភេទទិន្នន័យ និងគោលបំណងវិភាគ។ ខាងក្រោមនេះគឺជាវិធីសាស្ត្រទូទៅមួយចំនួន៖
១. ការមើលឃើញ៖ Boxplot និង Scatterplot
– Boxplots មានប្រជាប្រិយភាពខ្លាំងសម្រាប់ការរកឃើញ outliers។ នៅក្នុង Boxplot ជាធម្មតា outliers ត្រូវបានសម្គាល់ជាចំណុចដែលធ្លាក់នៅខាងក្រៅប្រអប់ whisker។
– Scatterplots ជួយមើលឃើញភាពមិនប្រក្រតីនៃទំនាក់ទំនងរវាងអថេរពីរ ឧទាហរណ៍ ទម្ងន់ ទល់នឹង កម្ពស់។
ការមើលឃើញរូបភាពមានប្រយោជន៍ជាជំហានដំបូង ពីព្រោះវារហ័ស និងងាយស្រួលយល់។
2. វិធីសាស្ត្រ IQR (ជួរអន្តរក្វាទីល)
វិធីសាស្ត្រ IQR ត្រូវបានគេប្រើជាញឹកញាប់សម្រាប់ទិន្នន័យអថេរតែមួយ (univariate)។
– គណនា Q1 (quartile 1) និង Q3 (quartile 3)
– IQR = ត្រីមាសទី 3 − ត្រីមាសទី 1
– ដែនកំណត់ខាងក្រោម = Q1 − 1,5 × IQR
– ដែនកំណត់ខាងលើ = Q3 + 1,5 × IQR
តម្លៃដែលនៅក្រៅដែនកំណត់ទាំងនេះជាធម្មតាត្រូវបានចាត់ទុកថាជាតម្លៃមិនប្រក្រតី។ វិធីសាស្ត្រនេះមានភាពរឹងមាំទាក់ទងគ្នាព្រោះវាមិនត្រូវបានប៉ះពាល់ខ្លាំងដោយតម្លៃខ្លាំងពេក។
៣. ពិន្ទុ Z (ផ្អែកលើមធ្យមភាគ និងគម្លាតស្តង់ដារ)
ពិន្ទុ Z វាស់ចម្ងាយពីតម្លៃមួយជាឯកតាគម្លាតស្តង់ដារ។
– z = (x − មធ្យម) / sd
តម្លៃដែល |z| > 3 (ពេលខ្លះ > 2,5) ជារឿយៗត្រូវបានចាត់ទុកថាជាតម្លៃក្រៅប្រព័ន្ធ។
ចំណុចខ្សោយ៖ ប្រសិនបើទិន្នន័យមាន outliers ធំៗរួចហើយ មធ្យមភាគ និង sd នឹងរងផលប៉ះពាល់ ដូច្នេះការរកឃើញអាចមានភាពត្រឹមត្រូវតិចជាង។
៤. វិធីសាស្ត្រផ្អែកលើគំរូ និងពហុអថេរ
ចំពោះទិន្នន័យពហុអថេរ កត្តាមិនតែងតែអាចមើលឃើញនៅក្នុងជួរឈរតែមួយនោះទេ ប៉ុន្តែនៅក្នុងការរួមបញ្ចូលគ្នានៃអថេរជាច្រើន។
– ចម្ងាយ Mahalanobis ត្រូវបានគេប្រើជាញឹកញាប់ដើម្បីរកឃើញ outliers ពហុអថេរ។
– នៅក្នុងការរៀនម៉ាស៊ីន មានវិធីសាស្រ្តដូចជា Isolation Forest, Local Outlier Factor (LOF) ឬ One-Class SVM។
វិធីសាស្ត្រនេះគឺសមរម្យសម្រាប់សំណុំទិន្នន័យធំៗ និងស្មុគស្មាញ ឧទាហរណ៍ ការរកឃើញភាពមិនប្រក្រតីនៃប្រតិបត្តិការហិរញ្ញវត្ថុ។
អ្វីដែលត្រូវធ្វើប្រសិនបើអ្នករកឃើញ Outlier?
វិធីល្អបំផុតគឺមិនត្រូវលុបវាចោលនោះទេ។ ជាទូទៅ ដំណើរការដោះស្រាយកំហុសពាក់ព័ន្ធនឹងជំហានជាច្រើន៖
១. ការផ្ទៀងផ្ទាត់ទិន្នន័យ
- ពិនិត្យមើលការបញ្ចូលមិនត្រឹមត្រូវ ការចម្លង ឬឯកតាមិនត្រឹមត្រូវ។
– ប្រៀបធៀបជាមួយប្រភពទិន្នន័យដើម (ឧទាហរណ៍ ទម្រង់បែបបទ កំណត់ហេតុឧបករណ៍ចាប់សញ្ញា ឬកំណត់ត្រាដោយដៃ)។
២. យល់ពីបរិបទ
– តើតម្លៃខ្លាំងមានន័យនៅក្នុងដែនដែរឬទេ?
– ឧទាហរណ៍ សីតុណ្ហភាពរាងកាយមនុស្ស ៥០អង្សាសេ គឺស្ទើរតែមិនត្រឹមត្រូវទេ ប៉ុន្តែប្រាក់ចំណូល ៥០លានដុល្លារ អាចសមហេតុផល។
៣. កំណត់គោលបំណងនៃការវិភាគ
– ប្រសិនបើគោលដៅគឺដើម្បីយល់ពីឥរិយាបថ "ទូទៅ" នោះអ្នកដែលមានចរិតលក្ខណៈមិនប្រក្រតីអាចត្រូវដោះស្រាយ ដើម្បីការពារពួកគេពីការត្រួតត្រា។
– ប្រសិនបើគោលដៅគឺដើម្បីស្វែងរកព្រឹត្តិការណ៍កម្រ (ការក្លែងបន្លំ ការបរាជ័យរបស់ម៉ាស៊ីន) នោះចំណុចសំខាន់គឺការផ្តោតអារម្មណ៍ចម្បង។
៤. ជ្រើសរើសយុទ្ធសាស្ត្រដោះស្រាយ
ជម្រើសទូទៅមួយចំនួន៖
– ការដកចេញ៖ ធ្វើឡើងប្រសិនបើចំណុចខុសប្រក្រតីត្រូវបានបង្ហាញថាជាកំហុស ហើយមិនមែនជាតំណាង។
– ការបំលែងទិន្នន័យ៖ ឧទាហរណ៍ ការបំលែងឡូហ្គលសម្រាប់ទិន្នន័យដែលមានភាពលំអៀង។
– ការឈ្នះ / ការដាក់កម្រិត៖ កំណត់តម្លៃខ្លាំងចំពោះភាគរយជាក់លាក់ (ឧទាហរណ៍ p1 និង p99)។
– ប្រើវិធីសាស្ត្ររឹងមាំ៖ មេឌីយ៉ាន អាយឃ្យូអរ តំរែតំរង់រឹងមាំ ឬម៉ូដែលធន់នឹងការខុសប្រក្រតី។
– ការវិភាគដាច់ដោយឡែក៖ ពេលខ្លះវាសមស្របជាងក្នុងការវិភាគកត្តាមិនប្រក្រតីជាករណីពិសេស។
អ្វីដែលសំខាន់នោះ ការសម្រេចចិត្តត្រូវតែត្រូវបានកត់ត្រាទុក ដើម្បីឱ្យការវិភាគមានតម្លាភាព និងទទួលខុសត្រូវ។
Outliers: បញ្ហា ឬព័ត៌មានដ៏មានតម្លៃ?
ជារឿយៗ កត្តាមិនប្រក្រតីត្រូវបានចាត់ទុកថាជា "សំឡេងរំខាន" ពីព្រោះវាអាចបង្ខូចទ្រង់ទ្រាយសេចក្តីសង្ខេបស្ថិតិ។ ទោះជាយ៉ាងណាក៏ដោយ ក្នុងករណីជាច្រើន កត្តាមិនប្រក្រតីគឺជាច្រកទ្វារទៅកាន់ការយល់ដឹងថ្មីៗ៖ អត្ថិភាពនៃផ្នែកអតិថិជនលំដាប់ខ្ពស់ ស្ថានភាពអ្នកជំងឺដែលត្រូវការការយកចិត្តទុកដាក់ ដំណាក់កាលថ្មីក្នុងដំណើរការផលិតកម្ម ឬការក្លែងបន្លំដែលអាចកើតមាន។ ដូច្នេះ កត្តាមិនប្រក្រតីគួរត្រូវបានចាត់ទុកថាជាអ្វីមួយដែលត្រូវការស៊ើបអង្កេត មិនមែនត្រូវបានច្រានចោលដោយស្វ័យប្រវត្តិនោះទេ។
សេចក្តីសន្និដ្ឋាន
តម្លៃខុសប្រក្រតីក្នុងស្ថិតិ គឺជាតម្លៃដែលងាកចេញយ៉ាងខ្លាំងពីគំរូទូទៅនៃទិន្នន័យ។ តម្លៃខុសប្រក្រតីអាចកើតឡើងដោយសារកំហុស ភាពប្រែប្រួលធម្មជាតិ ការផ្លាស់ប្ដូរដំណើរការ ឬភាពខុសគ្នាជាក្រុមក្នុងសំណុំទិន្នន័យ។ ផលប៉ះពាល់របស់វាអាចមានសារៈសំខាន់លើមធ្យមភាគ ភាពប្រែប្រួល ការធ្វើតេស្តស្ថិតិ និងគំរូព្យាករណ៍។ ការរកឃើញតម្លៃខុសប្រក្រតីអាចសម្រេចបានតាមរយៈការមើលឃើញ វិធីសាស្ត្រ IQR ពិន្ទុ z និងសូម្បីតែវិធីសាស្ត្រពហុអថេរ និងការរៀនម៉ាស៊ីន។ ការដោះស្រាយត្រូវតែពិចារណាពីបរិបទ និងគោលបំណង៖ ការផ្ទៀងផ្ទាត់ ការយល់ដឹងពីមូលហេតុ និងបន្ទាប់មកជ្រើសរើសយុទ្ធសាស្ត្រដូចជាការដកចេញ ការបំប្លែង ការកំណត់តម្លៃ ឬការប្រើប្រាស់វិធីសាស្ត្ររឹងមាំ។
ដោយមានការយល់ដឹងត្រឹមត្រូវ លេខខុសប្រក្រតីមិនមែនគ្រាន់តែជា "លេខសេស" នោះទេ ប៉ុន្តែវាក៏ជាធាតុផ្សំសំខាន់ៗនៃការអនុវត្តស្ថិតិ ដែលអាចធ្វើអោយប្រសើរឡើងនូវគុណភាពនៃការវិភាគ និងការសម្រេចចិត្តដែលជំរុញដោយទិន្នន័យ។