វិធានការនៃការរីករាលដាល៖ ការយល់ដឹងអំពីភាពប្រែប្រួលនៃទិន្នន័យ
នៅក្នុងស្ថិតិ និងការវិភាគទិន្នន័យ ការយល់ដឹងអំពីការចែកចាយ និងការប្រែប្រួលនៃទិន្នន័យគឺមានសារៈសំខាន់ខ្លាំងណាស់សម្រាប់ការធ្វើការសន្និដ្ឋានត្រឹមត្រូវ និងពាក់ព័ន្ធ។ គោលគំនិតសំខាន់មួយដែលប្រើដើម្បីពិពណ៌នាអំពីការប្រែប្រួលនៃទិន្នន័យគឺ "រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយ"។ អត្ថបទនេះនឹងពិភាក្សាអំពីរង្វាស់ផ្សេងៗនៃការបែកខ្ចាត់ខ្ចាយ ហេតុអ្វីបានជាវាសំខាន់ របៀបគណនាវា និងការបកស្រាយរបស់វានៅក្នុងបរិបទនៃការវិភាគទិន្នន័យ។
តើរង្វាស់នៃការរីករាលដាលគឺជាអ្វី?
រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយ គឺជារង្វាស់ដែលប្រើដើម្បីពិពណ៌នាអំពីវិសាលភាពដែលទិន្នន័យនៅក្នុងសំណុំមួយត្រូវបានរីករាលដាល ឬបែកខ្ចាត់ខ្ចាយចេញពីតម្លៃកណ្តាល។ តម្លៃកណ្តាលនេះជាធម្មតាត្រូវបានវាស់វែងដោយប្រើរង្វាស់នៃទំនោរកណ្តាលដូចជាមធ្យមភាគ ឬមេឌីយ៉ាន។ រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយផ្តល់នូវការយល់ដឹងអំពីជួរ បំរែបំរួល និងភាពស៊ីសង្វាក់គ្នានៃទិន្នន័យ។
ហេតុអ្វីបានជាទំហំរាលដាលមានសារៈសំខាន់?
១. ការយល់ដឹងអំពីភាពប្រែប្រួល៖
ភាពប្រែប្រួលគឺជាផ្នែកសំខាន់មួយនៃទិន្នន័យណាមួយ។ តាមរយៈការយល់ដឹងអំពីចំនួនទិន្នន័យដែលប្រែប្រួល យើងអាចយល់ពីឌីណាមិកមូលដ្ឋាននៃទិន្នន័យនោះ។
២. កំណត់អត្តសញ្ញាណចំណុចខុសប្រក្រតី៖
ការចែកចាយទិន្នន័យអាចជួយក្នុងការកំណត់អត្តសញ្ញាណ outliers (តម្លៃខ្លាំងដែលនៅឆ្ងាយពីទិន្នន័យដែលនៅសល់) ដែលអាចមានសារៈសំខាន់សម្រាប់ការវិភាគបន្ថែម ឬអាចជាទិន្នន័យកំហុស។
៣. ការប្រៀបធៀបសំណុំទិន្នន័យ៖
រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយអនុញ្ញាតឱ្យមានការប្រៀបធៀបរវាងសំណុំទិន្នន័យពីរ ឬច្រើន។ ឧទាហរណ៍ សំណុំទិន្នន័យពីរអាចមានតម្លៃមធ្យមដូចគ្នា ប៉ុន្តែមានភាពប្រែប្រួល ឬការបែកខ្ចាត់ខ្ចាយខុសគ្នា។
៤. ស្ថិតិសន្និដ្ឋាន៖
វិធីសាស្ត្រស្ថិតិសន្និដ្ឋានជាច្រើនតម្រូវឱ្យមានការយល់ដឹងល្អអំពីការចែកចាយទិន្នន័យដើម្បីធ្វើការសន្និដ្ឋានដែលមានសុពលភាពនិងសំខាន់។
ប្រភេទនៃទំហំរាលដាល
មានរង្វាស់ជាច្រើននៃការបែកខ្ចាត់ខ្ចាយដែលត្រូវបានគេប្រើជាទូទៅក្នុងការវិភាគទិន្នន័យស្ថិតិ៖
១. ជួរ
ជួរគឺជារង្វាស់សាមញ្ញបំផុតនៃការរីករាលដាល ហើយត្រូវបានគណនាជាភាពខុសគ្នារវាងតម្លៃអតិបរមា និងអប្បបរមានៅក្នុងសំណុំទិន្នន័យ។
\[ \text{ជួរ} = \text{តម្លៃអតិបរមា} – \text{តម្លៃអប្បបរមា} \]
ទោះបីជាងាយស្រួលក្នុងការគណនាក៏ដោយ ជួរនេះពិចារណាតែចំណុចទិន្នន័យពីរប៉ុណ្ណោះ ហើយមិនឆ្លុះបញ្ចាំងពីការចែកចាយទិន្នន័យរវាងតម្លៃអប្បបរមា និងអតិបរមានោះទេ។
៤. ជួរអន្តរក្វាទីល (IQR)
IQR គឺជារង្វាស់នៃការបែកខ្ចាត់ខ្ចាយដ៏រឹងមាំជាងជួរ ពីព្រោះវាមិនត្រូវបានប៉ះពាល់ដោយអថេរក្រៅជួរទេ។ វាគណនាជួរមធ្យមនៃទិន្នន័យដោយដកភាគរយទី 25 (Q1) ពីភាគរយទី 75 (Q3)។
\[ \text{IQR} = សំណួរទី 3 – សំណួរទី 1 \]
ដោយផ្តោតលើមធ្យមភាគ IQR ផ្តល់នូវរូបភាពកាន់តែប្រសើរឡើងនៃការចែកចាយទិន្នន័យមូលដ្ឋាន។
៣. ភាពខុសគ្នា
ភាពខុសគ្នាវាស់ស្ទង់ចម្ងាយដែលតម្លៃនីមួយៗនៅក្នុងសំណុំទិន្នន័យមានពីមធ្យមភាគ។ វាត្រូវបានគណនាដោយការបូកសរុបការ៉េនៃភាពខុសគ្នានៃតម្លៃនីមួយៗពីមធ្យមភាគ បន្ទាប់មកចែកនឹងចំនួនធាតុទិន្នន័យ (សម្រាប់ចំនួនប្រជាជន) ឬចំនួនធាតុដកមួយ (សម្រាប់គំរូ)។
សម្រាប់ចំនួនប្រជាជន (\(\sigma^2\)):
\[ \sigma^2 = \frac{\sum (X_i – \mu)^2}{N} \]
សម្រាប់គំរូ (\(s^2\)):
\[ s^2 = \frac{\sum (X_i – \overline{X})^2}{n-1} \]
ភាពខុសគ្នាផ្តល់នូវគំនិតអំពីភាពស៊ីសង្វាក់គ្នានៃទិន្នន័យ។ ទោះជាយ៉ាងណាក៏ដោយ ដោយសារតែភាពខុសគ្នាប្រើឯកតាការ៉េ វាអាចពិបាកក្នុងការបកស្រាយដោយផ្ទាល់។
៤. គម្លាតស្តង់ដារ
គម្លាតស្តង់ដារគឺជាឫសការ៉េនៃភាពខុសគ្នា ហើយស្ថិតនៅក្នុងឯកតាដូចគ្នានឹងទិន្នន័យដើម ដែលធ្វើឱ្យវាកាន់តែងាយស្រួលក្នុងការបកស្រាយ។
សម្រាប់ចំនួនប្រជាជន (\(\sigma\)):
\[ \sigma = \sqrt{\sigma^2} = \sqrt{\frac{\sum (X_i – \mu)^2}{N}} \]
សម្រាប់គំរូ (\(s\)):
\[ s = \sqrt{s^2} = \sqrt{\frac{\sum (X_i – \overline{X})^2}{n-1}} \]
គម្លាតស្តង់ដារគឺជារង្វាស់មួយក្នុងចំណោមរង្វាស់នៃការបែកខ្ចាត់ខ្ចាយដែលប្រើជាទូទៅបំផុត ពីព្រោះវាងាយស្រួលក្នុងការបកស្រាយ និងត្រូវបានគេប្រើជាញឹកញាប់នៅក្នុងការវិភាគស្ថិតិផ្សេងៗ។
៥. មេគុណនៃបំរែបំរួល (CV)
CV គឺជារង្វាស់នៃការបែកខ្ចាត់ខ្ចាយដែលទាក់ទង ដែលបង្ហាញជាសមាមាត្រនៃគម្លាតស្តង់ដារទៅនឹងមធ្យមភាគ ហើយជារឿយៗត្រូវបានបង្ហាញជាភាគរយ។
\[ \text{CV} = \frac{s}{\overline{X}} \គុណនឹង 100\% \]
CV មានប្រយោជន៍ខ្លាំងណាស់សម្រាប់ការប្រៀបធៀបភាពប្រែប្រួលរវាងសំណុំទិន្នន័យជាមួយនឹងមធ្យោបាយផ្សេងៗគ្នា។
របៀបគណនា និងបកស្រាយ
ឧទាហរណ៍នៃការគណនា
ចូរយើងបង្ហាញឧទាហរណ៍ទិន្នន័យខាងក្រោម៖
\[ \{១៥, ២០, ២៥, ៣៥, ៤៥, ៥៥, ៦៥, ៧៥, ៨៥, ៩៥\} \]
១. ជួរ៖
\[ \text{Range} = ៩៥ – ១៥ = ៨០ \]
២. ជួរអន្តរក្វាទីល (IQR):
បន្ទាប់ពីការតម្រៀបទិន្នន័យរួច យើងអាចរកឃើញក្វាទីល Q1 និង Q3។ ក្នុងករណីនេះ Q1 គឺ 25 និង Q3 គឺ 75។
\[ \text{IQR} = ៧៥ – ២៥ = ៥០ \]
១. ភាពខុសគ្នា និង គម្លាតស្តង់ដារ៖
មធ្យមភាគ (\(\overline{X}\)) នៃទិន្នន័យគឺ 51.5។ បន្ទាប់មកយើងគណនាភាពខុសគ្នា និងគម្លាតស្តង់ដារ។
\[ \text{វ៉ារ្យ៉ង់ (s^2)} = \frac{1}{n-1} \sum (X_i – \overline{X})^2 = 816.11 \]
\[ \text{គម្លាតស្តង់ដារ (s)} = \sqrt{816.11} = 28.57 \]
៤. មេគុណនៃបំរែបំរួល (CV):
\[ \text{CV} = \frac{28.57}{51.5} \x100% \ប្រហែល 55.48\% \]
ពីទីនេះ យើងអាចបកស្រាយថាគម្លាតស្តង់ដារគឺ 28.57 ខណៈពេលដែល CV បង្ហាញថាគម្លាតស្តង់ដារគឺប្រហែល 55.48% នៃមធ្យមភាគនៃទិន្នន័យដើម។
សេចក្តីសន្និដ្ឋាន
រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយគឺជាសមាសធាតុសំខាន់ៗនៃការវិភាគទិន្នន័យស្ថិតិ ពីព្រោះវាផ្តល់នូវការយល់ដឹងអំពីភាពប្រែប្រួល និងការរីករាលដាលនៃទិន្នន័យជុំវិញតម្លៃកណ្តាល។ រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយដែលប្រើជាទូទៅរួមមានជួរ ជួរអន្តរក្វាទីល ភាពខុសគ្នា គម្លាតស្តង់ដារ និងមេគុណនៃបំរែបំរួល។ រង្វាស់នីមួយៗមានការប្រើប្រាស់ជាក់លាក់ និងអាចផ្តល់នូវការយល់ដឹងដ៏មានតម្លៃអាស្រ័យលើបរិបទនៃទិន្នន័យ និងគោលបំណងនៃការវិភាគ។ តាមរយៈការយល់ដឹង និងការប្រើប្រាស់រង្វាស់នៃការបែកខ្ចាត់ខ្ចាយឱ្យបានត្រឹមត្រូវ យើងអាចធ្វើការសម្រេចចិត្តដែលមានព័ត៌មាន និងត្រឹមត្រូវជាងមុននៅក្នុងវិស័យស្រាវជ្រាវផ្សេងៗ និងកម្មវិធីវិទ្យាសាស្ត្រទិន្នន័យ។