ការវិភាគសហសម្ព័ន្ធភាព Canonical

ការវិភាគទំនាក់ទំនង​តាម​បែប​ Canonical

Pendahuluan
នៅក្នុងការសិក្សាជាច្រើន អ្នកស្រាវជ្រាវតែងតែជួបប្រទះស្ថានភាពដែលមានសំណុំអថេរពីរឈុត ដែលសំណុំនីមួយៗមានសូចនាករជាច្រើន។ ឧទាហរណ៍ នៅក្នុងវិស័យអប់រំ យើងអាចមានសំណុំអថេរអំពីកត្តាសិក្សា (ការលើកទឹកចិត្ត ម៉ោងសិក្សា ការគាំទ្រពីគ្រួសារ ការចូលប្រើអ៊ីនធឺណិត) និងសំណុំអថេរអំពីលទ្ធផលសិក្សា (និទ្ទេសគណិតវិទ្យា និទ្ទេសភាសា និទ្ទេសវិទ្យាសាស្ត្រ និងមធ្យមភាគនិទ្ទេស)។ សំណួរសំខាន់មិនមែនគ្រាន់តែជា "តើការលើកទឹកចិត្តទាក់ទងនឹងនិទ្ទេសគណិតវិទ្យាទេ?" ប៉ុន្តែផ្ទុយទៅវិញ "តើទំនាក់ទំនងរួមរវាងសំណុំកត្តាសិក្សា និងសំណុំលទ្ធផលសិក្សាមានភាពរឹងមាំប៉ុណ្ណា?" ដើម្បីឆ្លើយសំណួរដូចនេះ ការវិភាគទំនាក់ទំនង Canonical (CCA) គឺជាវិធីសាស្ត្រស្ថិតិពហុអថេរដែលពាក់ព័ន្ធបំផុតមួយ។

ការវិភាគសហសម្ព័ន្ធ​កាណូនិកត្រូវបានបង្កើតឡើងដើម្បីវាស់វែង និងពន្យល់ពីទំនាក់ទំនងរវាងសំណុំអថេរពីរក្នុងពេលដំណាលគ្នា។ ម្យ៉ាងវិញទៀត CCA ពង្រីកគោលគំនិតនៃសហសម្ព័ន្ធសាមញ្ញ (រវាងអថេរពីរ) ទៅជាសហសម្ព័ន្ធរវាងបន្សំលីនេអ៊ែរពីរនៃសំណុំអថេរពីរ។ អត្ថបទនេះពិភាក្សាអំពីគោលគំនិតជាមូលដ្ឋាន គោលបំណង ជំហានវិភាគ ការបកស្រាយ និងគុណសម្បត្តិ និងដែនកំណត់នៃ CCA។

គោលគំនិតជាមូលដ្ឋាននៃទំនាក់ទំនង Canonical
សហសម្ព័ន្ធធម្មតា (ឧ. សហសម្ព័ន្ធ Pearson) វាស់ស្ទង់កម្លាំងនៃទំនាក់ទំនងលីនេអ៊ែររវាងអថេរពីរ ឧទាហរណ៍ X និង Y។ CCA ធ្វើឱ្យគោលគំនិតនេះមានលក្ខណៈទូទៅដោយបង្កើតអថេរថ្មីពីរជាបន្សំលីនេអ៊ែរ៖

– បំរែបំរួល​ស្តង់ដារ​ដំបូង​សម្រាប់​សំណុំ X៖
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– វ៉ារ្យ៉ង់​ស្តង់ដារ​ដំបូង​សម្រាប់​សំណុំ Y៖
V = b₁Y₁ + b₂Y₂ + … + b_qY_q

មេគុណ a និង b ត្រូវបានជ្រើសរើសដើម្បីឱ្យទំនាក់ទំនងរវាង U និង V មានកម្រិតអតិបរមា។ ទំនាក់ទំនងអតិបរមានេះត្រូវបានគេហៅថា ទំនាក់ទំនងស្តង់ដារទីមួយ។ នៅពេលដែលគូទីមួយត្រូវបានទទួល CCA អាចបង្កើតគូអថេរជាបន្តបន្ទាប់ (ទីពីរ ទីបី និងបន្តបន្ទាប់) ដែលមានលក្ខណៈអ័រថូហ្គោណាល់ (មិនទាក់ទងគ្នា) ទៅនឹងគូមុន។

ចំនួនគូអថេរស្តង់ដារដែលអាចធ្វើទៅបានគឺ min(p, q) ដែលជាចំនួនអថេរតូចបំផុតរវាងសំណុំទាំងពីរ។

គោលបំណង និងការប្រើប្រាស់
CCA ត្រូវបានប្រើនៅពេលដែលគោលបំណងស្រាវជ្រាវគឺ៖

១. វាស់ស្ទង់កម្លាំងនៃទំនាក់ទំនងរវាងសំណុំអថេរពីរទាំងមូល។
2. កំណត់អត្តសញ្ញាណបន្សំនៃអថេរដែលទាក់ទងគ្នាបំផុតនៅក្នុងសំណុំ X និងសំណុំ Y។
៣. កាត់បន្ថយវិមាត្រនៃទំនាក់ទំនងពហុអថេរទៅជាគូអថេរជាច្រើនដែលងាយស្រួលបកស្រាយ។
៤. ការរុករកលំនាំនៅក្នុងទិន្នន័យ៖ តើអថេរណាខ្លះដែលពន្យល់ជាចម្បងអំពីទំនាក់ទំនងរវាងដែនទាំងពីរ។

ឧទាហរណ៍នៃបរិបទកម្មវិធី៖
– ចិត្តវិទ្យា៖ ទំនាក់ទំនងរវាងសំណុំនៃ "លក្ខណៈបុគ្គលិកលក្ខណៈ" និងសំណុំនៃ "សូចនាករសុខភាពផ្លូវចិត្ត"។
– សេដ្ឋកិច្ច៖ ទំនាក់ទំនងរវាងសំណុំនៃ «សូចនាករម៉ាក្រូ» និងសំណុំនៃ «សូចនាករទីផ្សារការងារ»។
– វិទ្យាសាស្ត្រសុខភាព៖ ទំនាក់ទំនងរវាងសំណុំនៃ «ទម្លាប់ជីវិត» និងសំណុំនៃ «ប៉ារ៉ាម៉ែត្រគ្លីនិក»។

ការសន្មត់ទិន្នន័យ និងតម្រូវការ
ដូចវិធីសាស្ត្រពហុអថេរជាច្រើនដែរ CCA មានការសន្មត់មួយចំនួនដែលត្រូវពិចារណាដើម្បីឱ្យលទ្ធផលមានស្ថេរភាព និងអាចបកស្រាយបាន៖

១. ទំនាក់ទំនងលីនេអ៊ែរ៖ CCA ចាប់យកទំនាក់ទំនងលីនេអ៊ែររវាងសំណុំ។ ប្រសិនបើទំនាក់ទំនងនេះមិនមែនលីនេអ៊ែរ សហសម្ព័ន្ធស្តង់ដារអាចមើលស្រាលកម្លាំងនៃទំនាក់ទំនងនេះ។
២. បទដ្ឋានពហុអថេរ៖ តាមឧត្ដមគតិ អថេរធ្វើតាមការចែកចាយធម្មតាពហុអថេរ ជាពិសេសសម្រាប់ការធ្វើតេស្តសារៈសំខាន់។ ទោះជាយ៉ាងណាក៏ដោយ នៅក្នុងការអនុវត្តជាក់ស្តែង CCA ត្រូវបានគេប្រើជាញឹកញាប់ក្នុងការស្វែងយល់ ទោះបីជាទិន្នន័យមិនមានលក្ខណៈធម្មតាទាំងស្រុងក៏ដោយ។
៣. មិនមានពហុកូលីនេអ៊ែរខ្លាំងនៅក្នុងសំណុំនីមួយៗទេ៖ អថេរដែលមានទំនាក់ទំនងគ្នាខ្ពស់អាចធ្វើឱ្យការប៉ាន់ស្មានមេគុណមិនស្ថិតស្ថេរ។
៤. ទំហំគំរូគ្រប់គ្រាន់៖ ច្បាប់ទូទៅមួយគឺអប្បបរមានៃការសង្កេតចំនួន ១០-២០ ក្នុងមួយអថេរ ទោះបីជាបរិបទស្រាវជ្រាវអាចទាមទារច្រើនជាងនេះក៏ដោយ។

លើសពីនេះ អថេរត្រូវស្ថិតនៅលើមាត្រដ្ឋានដែលអាចប្រៀបធៀបបាន ឬស្តង់ដារ (ពិន្ទុ z) ដើម្បីឱ្យមេគុណងាយស្រួលប្រៀបធៀប។

ជំហាននៃការវិភាគទំនាក់ទំនង Canonical
ជាទូទៅ ដំណាក់កាលនៃការធ្វើ CCA រួមមាន៖

១. កំណត់សំណុំអថេរពីរ
ត្រូវប្រាកដថាអថេរត្រូវបានដាក់ជាក្រុមដោយផ្អែកលើទ្រឹស្តី ឬក្របខ័ណ្ឌគំនិត មិនមែនគ្រាន់តែការសាកល្បង និងកំហុសនោះទេ។

២. ការត្រួតពិនិត្យទិន្នន័យ
រួមទាំងទិន្នន័យដែលបាត់ (តម្លៃដែលបាត់) លក្ខណៈខុសប្រក្រតី ការធ្វើតេស្តបទដ្ឋាន និងសហសម្ព័ន្ធនៅក្នុងសំណុំនីមួយៗ (ដើម្បីរកឃើញពហុកូលីនេអ៊ែរ)។

៣. ការប៉ាន់ប្រមាណបំរែបំរួលស្តង់ដារ
បង្កើតគូអថេរ U₁–V₁, U₂–V₂ និងផ្សេងៗទៀត។

៤. ការគណនាសហសម្ព័ន្ធ​ស្តង់ដារ
ទំនាក់ទំនងរវាង U_k និង V_k សម្រាប់គូទី k នីមួយៗ។

៥. ការធ្វើតេស្តសារៈសំខាន់
សាកល្បងថាតើសហសម្ព័ន្ធស្តង់ដារដែលទទួលបានមានភាពខុសគ្នាខាងស្ថិតិពីសូន្យឬអត់។ ការធ្វើតេស្តដែលប្រើជាទូទៅគឺ Wilks' Lambda, Pillai's Trace (ញឹកញាប់ជាងនៅក្នុង MANOVA), Hotelling's Trace និង Roy's Largest Root។ នៅក្នុង CCA, Wilks' Lambda ជារឿយៗជាជម្រើសដែលពេញចិត្ត។

៦. ការបកស្រាយលទ្ធផល
រួមបញ្ចូលការវាយតម្លៃទំហំនៃសហសម្ព័ន្ធ បន្ទុក ទម្ងន់ និងការរួមចំណែកអថេរ។

របៀបអាន និងបកស្រាយលទ្ធផល CCA
ទិន្នផល CCA ជាធម្មតារួមបញ្ចូលសមាសធាតុសំខាន់ៗមួយចំនួន៖

១. ទំនាក់ទំនង​តាម​បែប​កាណូនិក
តម្លៃនេះបង្ហាញពីភាពខ្លាំងនៃទំនាក់ទំនងរវាងអថេរ U និង V នៅក្នុងគូជាក់លាក់មួយ។ ឧទាហរណ៍ សហសម្ព័ន្ធស្តង់ដារទីមួយនៃ 0,80 បង្ហាញពីទំនាក់ទំនងលីនេអ៊ែរខ្លាំងរវាងការរួមបញ្ចូលគ្នានៃអថេរ X និងការរួមបញ្ចូលគ្នានៃអថេរ Y នៅក្នុងវិមាត្រទីមួយ។

R² ស្តង់ដារ ដែលជាការ៉េនៃសហសម្ព័ន្ធស្តង់ដារ ក៏ត្រូវបានរាយការណ៍ជាញឹកញាប់ផងដែរ។ ប្រសិនបើ r = 0,80 នោះ R² = 0,64 មានន័យថាប្រហែល 64% នៃការប្រែប្រួលនៅក្នុងអថេរស្តង់ដារ Y អាចត្រូវបានពន្យល់ដោយអថេរស្តង់ដារ X (និងច្រាសមកវិញ) លើវិមាត្រនោះ ក្នុងន័យនៃទំនាក់ទំនងរវាងអថេរ មិនមែនរវាងអថេរដើមទេ។

2. ទម្ងន់​ស្តង់ដារ (ទម្ងន់ / មេគុណ​ស្តង់ដារ)
ទម្ងន់គឺជាមេគុណ a និង b ដែលបង្កើតជាអថេរ U និង V។ ទោះជាយ៉ាងណាក៏ដោយ ទម្ងន់ច្រើនតែងាយនឹងប្រែប្រួលទៅនឹងពហុកូលីនេអ៊ែរ ដូច្នេះការបកស្រាយខ្លឹមសារជាធម្មតាមិនពឹងផ្អែកទាំងស្រុងលើទម្ងន់នោះទេ។

៣. ការផ្ទុកតាមបែប Canonical (ការផ្ទុកតាមបែប Canonical / មេគុណរចនាសម្ព័ន្ធ)
ការផ្ទុក គឺជាទំនាក់ទំនងរវាងអថេរដើម និងអថេរស្តង់ដាររបស់វា។ ឧទាហរណ៍ ការផ្ទុក X₂ លើ U₁ 0,70 មានន័យថា X₂ រួមចំណែកយ៉ាងខ្លាំងដល់វិមាត្រស្តង់ដារទីមួយនៅម្ខាងនៃសំណុំ X។ ការផ្ទុកជាទូទៅមានស្ថេរភាព និងងាយស្រួលបកស្រាយជាងទម្ងន់។

៤. ការផ្ទុកឆ្លង
ការផ្ទុកឆ្លងគឺជាទំនាក់ទំនងរវាងអថេរពីសំណុំមួយជាមួយនឹងអថេរស្តង់ដារពីសំណុំមួយទៀត (ឧទាហរណ៍ ទំនាក់ទំនងនៃ X₁ ជាមួយ V₁)។ នេះជួយឱ្យយល់ថាអថេរណាដែលទាក់ទងយ៉ាងជិតស្និទ្ធបំផុតទៅនឹងវិមាត្រនៃទំនាក់ទំនងឆ្លងសំណុំ។

៥. សន្ទស្សន៍ភាពលើសលប់
សន្ទស្សន៍ភាពលើសបង្ហាញពីចំនួនភាពខុសគ្នានៃអថេរដើមនៅក្នុងសំណុំមួយដែលអាចពន្យល់បានដោយអថេរស្តង់ដារពីសំណុំមួយទៀត។ នេះជារឿងសំខាន់ព្រោះសហសម្ព័ន្ធភាពស្តង់ដារខ្ពស់មិនចាំបាច់បង្ហាញពីអំណាចពន្យល់ខ្ពស់សម្រាប់អថេរដើមនោះទេ។ ភាពលើសត្រូវបានប្រើជាញឹកញាប់ដើម្បីវាយតម្លៃតម្លៃជាក់ស្តែង (មិនមែនគ្រាន់តែសារៈសំខាន់ខាងស្ថិតិទេ)។

រូបភាពសាមញ្ញ
ឧបមាថាការសិក្សាមួយពិនិត្យមើលទំនាក់ទំនងរវាង៖

– សំណុំ X (លក្ខខណ្ឌការងារ)៖ X₁ = បន្ទុកការងារ, X₂ = ការគាំទ្រពីអ្នកគ្រប់គ្រង, X₃ = ភាពបត់បែននៃម៉ោងធ្វើការ
– កំណត់ Y (សុខុមាលភាព): Y₁ = ភាពតានតឹង, Y₂ = ការពេញចិត្តការងារ, Y₃ = គុណភាពនៃការគេង

CCA អាចរកឃើញសហសម្ព័ន្ធ​ស្តង់ដារ​ដំបូង​ដ៏សំខាន់​នៃ r = 0,75។ បន្ទុកបង្ហាញថា បន្ទុកការងារ និងការគាំទ្រពីអ្នកគ្រប់គ្រងបង្កើតបានជា U₁ ខ្លាំងបំផុត ខណៈដែលភាពតានតឹង និងការពេញចិត្តការងារបង្កើតបានជា V₁ ខ្លាំងបំផុត។ ការបកស្រាយ​ខ្លឹមសារ៖ វិមាត្រសំខាន់នៃទំនាក់ទំនងរវាងលក្ខខណ្ឌការងារ និងសុខុមាលភាពគឺការរួមបញ្ចូលគ្នានៃ "សម្ពាធការងារទល់នឹងការគាំទ្រ" ដែលទាក់ទងយ៉ាងជិតស្និទ្ធទៅនឹង "ភាពតានតឹង និងការពេញចិត្ត"។

គុណសម្បត្តិនៃការវិភាគទំនាក់ទំនង Canonical
១. ទូលំទូលាយ៖ ចាប់យកទំនាក់ទំនងរវាងសំណុំអថេរពីរក្នុងពេលតែមួយ។
2. កាត់បន្ថយហានិភ័យនៃការធ្វើតេស្តម្តងហើយម្តងទៀត៖ បើប្រៀបធៀបទៅនឹងការអនុវត្តសហសម្ព័ន្ធជាច្រើនម្តងមួយៗ ដែលបង្កើនឱកាសនៃកំហុសប្រភេទទី 1។
៣. ជួយស្វែងរករចនាសម្ព័ន្ធមិនទាន់ច្បាស់លាស់៖ បង្ហាញពីវិមាត្រនៃទំនាក់ទំនងដែលមើលមិនឃើញពីការវិភាគអថេរតែមួយ។

ដែនកំណត់ និងបញ្ហាប្រឈម
១. ការបកស្រាយអាចមានភាពស្មុគស្មាញ៖ សមាសធាតុជាច្រើន (ទម្ងន់ បន្ទុក ភាពលើស) ត្រូវតែមើលជាមួយគ្នា។
2. ងាយនឹងប្រតិកម្មទៅនឹងពហុកូលីនេអ៊ែរ និងទំហំគំរូតូច៖ អាចបង្កើតមេគុណមិនស្ថិតស្ថេរ។
៣. លក្ខណៈលីនេអ៊ែរ៖ ទំនាក់ទំនងមិនមែនលីនេអ៊ែរមិនត្រូវបានចាប់យកទេ លុះត្រាតែមានការបំលែង ឬវិធីសាស្រ្តផ្សេងទៀតត្រូវបានអនុវត្ត។
៤. តម្រូវឱ្យមានមូលដ្ឋានទ្រឹស្តី៖ បើគ្មានក្របខ័ណ្ឌគំនិតច្បាស់លាស់ទេ ការបកស្រាយវិមាត្រស្តង់ដារងាយនឹងក្លាយទៅជាការស្មាន។

Penutup
ការវិភាគសហសម្ព័ន្ធ​ស្តង់ដារ (Canonical Correlation Analysis) គឺជាវិធីសាស្ត្រពហុអថេរដ៏មានឥទ្ធិពលមួយសម្រាប់ការយល់ដឹងអំពីទំនាក់ទំនងរវាងសំណុំអថេរពីរក្នុងពេលដំណាលគ្នា។ តាមរយៈការបង្កើតអថេរស្តង់ដារដែលបង្កើនសហសម្ព័ន្ធឆ្លងសំណុំ (CCA) អនុញ្ញាតឱ្យអ្នកស្រាវជ្រាវមើលឃើញគំរូទំនាក់ទំនងកាន់តែទូលំទូលាយជាងសហសម្ព័ន្ធសាមញ្ញ ឬតំរែតំរង់តែមួយ។ ទោះជាយ៉ាងណាក៏ដោយ ការប្រើប្រាស់របស់វាតម្រូវឱ្យមានការយកចិត្តទុកដាក់ចំពោះការសន្មត់ គុណភាពទិន្នន័យ និងយុទ្ធសាស្ត្របកស្រាយសមស្រប (ជាពិសេសដោយសង្កត់ធ្ងន់លើការផ្ទុក ការផ្ទុកឆ្លង និងភាពលើសលប់)។ នៅក្នុងការស្រាវជ្រាវដែលពាក់ព័ន្ធនឹងសូចនាករច្រើននៅទូទាំងដែនចម្បងពីរ CCA អាចជាឧបករណ៍ដ៏មានឥទ្ធិពលមួយសម្រាប់ស្វែងយល់ និងសង្ខេបទំនាក់ទំនងស្មុគស្មាញទៅជាវិមាត្រដែលមានអត្ថន័យ។

សូម​បញ្ចេញ​មតិ