ຂະໜາດຂອງການແຜ່ກະຈາຍ

ມາດຕະການການແຜ່ກະຈາຍ: ການເຂົ້າໃຈການປ່ຽນແປງຂອງຂໍ້ມູນ

ໃນສະຖິຕິ ແລະ ການວິເຄາະຂໍ້ມູນ, ການເຂົ້າໃຈການແຈກຢາຍ ແລະ ການປ່ຽນແປງຂອງຂໍ້ມູນແມ່ນມີຄວາມສຳຄັນຫຼາຍສຳລັບການສະຫຼຸບທີ່ຖືກຕ້ອງ ແລະ ກ່ຽວຂ້ອງ. ແນວຄວາມຄິດຫຼັກອັນໜຶ່ງທີ່ໃຊ້ເພື່ອອະທິບາຍການປ່ຽນແປງຂອງຂໍ້ມູນແມ່ນ "ມາດຕະການຂອງການກະຈາຍຕົວ". ບົດຄວາມນີ້ຈະປຶກສາຫາລືກ່ຽວກັບມາດຕະການຕ່າງໆຂອງການກະຈາຍຕົວ, ເຫດຜົນທີ່ພວກມັນມີຄວາມສຳຄັນ, ວິທີການຄິດໄລ່ພວກມັນ, ແລະ ການຕີຄວາມໝາຍຂອງພວກມັນໃນສະພາບການຂອງການວິເຄາະຂໍ້ມູນ.

ມາດຕະການການແຜ່ລະບາດແມ່ນຫຍັງ?

ມາດຕະການການກະຈາຍຕົວແມ່ນຕົວຊີ້ວັດທີ່ໃຊ້ເພື່ອອະທິບາຍຂອບເຂດທີ່ຂໍ້ມູນໃນຊຸດຖືກກະຈາຍອອກ ຫຼື ກະຈາຍອອກຈາກຄ່າສູນກາງ. ຄ່າສູນກາງນີ້ໂດຍທົ່ວໄປແລ້ວແມ່ນວັດແທກໂດຍໃຊ້ມາດຕະການຂອງແນວໂນ້ມສູນກາງ ເຊັ່ນ: ຄ່າສະເລ່ຍ ຫຼື ຄ່າກາງ. ມາດຕະການການກະຈາຍຕົວໃຫ້ຄວາມເຂົ້າໃຈກ່ຽວກັບຂອບເຂດ, ການປ່ຽນແປງ ແລະ ຄວາມສອດຄ່ອງຂອງຂໍ້ມູນ.

ເປັນຫຍັງຂະໜາດຂອງການແຜ່ກະຈາຍຈຶ່ງສຳຄັນ?

1. ເຂົ້າໃຈຄວາມແປປ່ວນ:
ຄວາມແປປ່ວນແມ່ນສ່ວນໜຶ່ງທີ່ສຳຄັນຂອງຂໍ້ມູນໃດໆ. ໂດຍການເຂົ້າໃຈວ່າຂໍ້ມູນແຕກຕ່າງກັນຫຼາຍປານໃດ, ພວກເຮົາສາມາດເຂົ້າໃຈການເຄື່ອນໄຫວພື້ນຖານຂອງຂໍ້ມູນນັ້ນໄດ້.

2. ລະບຸຄ່າຜິດປົກກະຕິ:
ການແຈກຢາຍຂໍ້ມູນສາມາດຊ່ວຍໃນການລະບຸຄ່າຜິດປົກກະຕິ (ຄ່າທີ່ຮຸນແຮງທີ່ຢູ່ໄກຈາກສ່ວນທີ່ເຫຼືອຂອງຂໍ້ມູນ), ເຊິ່ງອາດຈະມີຄວາມສໍາຄັນສໍາລັບການວິເຄາະຕື່ມອີກ ຫຼື ອາດຈະເປັນຂໍ້ມູນຄວາມຜິດພາດ.

3. ການປຽບທຽບຊຸດຂໍ້ມູນ:
ມາດຕະການການກະຈາຍຊ່ວຍໃຫ້ສາມາດປຽບທຽບລະຫວ່າງຊຸດຂໍ້ມູນສອງຊຸດ ຫຼື ຫຼາຍກວ່ານັ້ນ. ຕົວຢ່າງ, ຊຸດຂໍ້ມູນສອງຊຸດອາດມີຄ່າສະເລ່ຍຄືກັນ ແຕ່ມີຄວາມແปรປ່ວນ ຫຼື ການກະຈາຍທີ່ແຕກຕ່າງກັນ.

ອ່ານເພີ່ມເຕີມ  ຄວາມສຳພັນລະຫວ່າງແມັດຕຣິກ ແລະ ການຫັນປ່ຽນ

4. ສະຖິຕິອະນຸມານ:
ວິທີການທາງສະຖິຕິອະນຸມານຫຼາຍຢ່າງຮຽກຮ້ອງໃຫ້ມີຄວາມເຂົ້າໃຈທີ່ດີກ່ຽວກັບການແຈກຢາຍຂອງຂໍ້ມູນເພື່ອເຮັດໃຫ້ມີການສະຫຼຸບທີ່ຖືກຕ້ອງ ແລະ ມີຄວາມໝາຍ.

ປະເພດຂອງຂະໜາດຂອງການແຜ່ກະຈາຍ

ມີມາດຕະການການກະຈາຍຫຼາຍຢ່າງທີ່ນຳໃຊ້ທົ່ວໄປໃນການວິເຄາະຂໍ້ມູນທາງສະຖິຕິ:

1. ຂອບເຂດ

ຂອບເຂດ (Range) ແມ່ນມາດຕະການທີ່ງ່າຍທີ່ສຸດຂອງການແຜ່ກະຈາຍ ແລະ ຖືກຄິດໄລ່ເປັນຄວາມແຕກຕ່າງລະຫວ່າງຄ່າສູງສຸດ ແລະ ຄ່າຕໍ່າສຸດໃນຊຸດຂໍ້ມູນ.

\[ \text{Range} = \text{ຄ່າສູງສຸດ} – \text{ຄ່າຕໍ່າສຸດ} \]

ເຖິງແມ່ນວ່າຈະຄິດໄລ່ໄດ້ງ່າຍ, ແຕ່ຂອບເຂດດັ່ງກ່າວພິຈາລະນາພຽງແຕ່ສອງຈຸດຂໍ້ມູນເທົ່ານັ້ນ ແລະ ບໍ່ໄດ້ສະທ້ອນເຖິງການແຈກຢາຍຂອງຂໍ້ມູນລະຫວ່າງຄ່າຕໍ່າສຸດ ແລະ ສູງສຸດ.

2. ລະດັບຄວາມແຕກຕ່າງລະຫວ່າງຄວາໄທລ໌ (IQR)

IQR ເປັນມາດຕະການການກະຈາຍທີ່ແຂງແກ່ນກວ່າຂອບເຂດ ເພາະມັນບໍ່ໄດ້ຮັບຜົນກະທົບຈາກຄ່າຜິດປົກກະຕິ. ມັນຄິດໄລ່ຂອບເຂດກາງຂອງຂໍ້ມູນໂດຍການຫັກເປີເຊັນໄທລ໌ທີ 25 (Q1) ອອກຈາກເປີເຊັນໄທລ໌ທີ 75 (Q3).

\[ \text{IQR} = Q3 – Q1 \]

ໂດຍການສຸມໃສ່ຄ່າສະເລ່ຍ, IQR ໃຫ້ພາບທີ່ດີຂຶ້ນກ່ຽວກັບການແຈກຢາຍຂໍ້ມູນພື້ນຖານ.

3. ຄວາມແປປ່ວນ

ຄວາມແปรປ່ວນວັດແທກວ່າແຕ່ລະຄ່າໃນຊຸດຂໍ້ມູນຢູ່ໄກຈາກຄ່າສະເລ່ຍເທົ່າໃດ. ມັນຖືກຄິດໄລ່ໂດຍການລວມກຳລັງສອງຂອງຄວາມແຕກຕ່າງຂອງແຕ່ລະຄ່າຈາກຄ່າສະເລ່ຍ, ຈາກນັ້ນຫານດ້ວຍຈຳນວນອົງປະກອບຂໍ້ມູນ (ສຳລັບປະຊາກອນ) ຫຼື ຈຳນວນອົງປະກອບລົບໜຶ່ງ (ສຳລັບຕົວຢ່າງ).

ອ່ານເພີ່ມເຕີມ  ຊຸດເລກຄະນິດ

ສຳລັບປະຊາກອນ (\(\sigma^2\)):

\[ \sigma^2 = \frac{\sum (X_i – \mu)^2}{N} \]

ສຳລັບຕົວຢ່າງ (\(s^2\)):

\[ s^2 = \frac{\sum (X_i – X)^2}{n-1} \]

ຄວາມແปรປ່ວນໃຫ້ແນວຄວາມຄິດກ່ຽວກັບຄວາມສອດຄ່ອງຂອງຂໍ້ມູນ; ເຖິງຢ່າງໃດກໍ່ຕາມ, ເນື່ອງຈາກຄວາມແปรປ່ວນໃຊ້ຫົວໜ່ວຍກຳລັງສອງ, ມັນອາດຈະເປັນການຍາກທີ່ຈະຕີຄວາມໝາຍໂດຍກົງ.

4. ຄ່າຜັນປ່ຽນມາດຕະຖານ

ຄ່າຜັນປ່ຽນມາດຕະຖານແມ່ນຮາກຂັ້ນສອງຂອງຄວາມແปรປ່ວນ ແລະ ຢູ່ໃນຫົວໜ່ວຍດຽວກັນກັບຂໍ້ມູນຕົ້ນສະບັບ, ເຮັດໃຫ້ມັນງ່າຍຕໍ່ການຕີຄວາມ.

ສຳລັບປະຊາກອນ (\(\sigma\)):

\[ \sigma = \sqrt{\sigma^2} = \sqrt{\frac{\sum (X_i – \mu)^2}{N}} \]

ສຳລັບຕົວຢ່າງ (\(s\)):

\[ s = \sqrt{s^2} = \sqrt{\frac{\sum (X_i – \overline{X})^2}{n-1}} \]

ຄ່າຜັນປ່ຽນມາດຕະຖານແມ່ນໜຶ່ງໃນມາດຕະການການກະຈາຍທີ່ນິຍົມໃຊ້ຫຼາຍທີ່ສຸດ ເພາະມັນງ່າຍຕໍ່ການຕີຄວາມ ແລະ ມັກຖືກນຳໃຊ້ໃນການວິເຄາະທາງສະຖິຕິຕ່າງໆ.

5. ສຳປະສິດການປ່ຽນແປງ (CV)

CV ແມ່ນມາດຕະການຂອງການກະຈາຍຕົວທຽບຖານ ທີ່ສະແດງເປັນອັດຕາສ່ວນຂອງຄ່າຜັນປ່ຽນມາດຕະຖານຕໍ່ຄ່າສະເລ່ຍ ແລະ ມັກສະແດງເປັນເປີເຊັນ.

\[ \text{CV} = \frac{s}{\overline{X}} \ຄູນ 100\% \]

CV ມີປະໂຫຍດຫຼາຍສຳລັບການປຽບທຽບຄວາມແປປ່ວນລະຫວ່າງຊຸດຂໍ້ມູນດ້ວຍວິທີການທີ່ແຕກຕ່າງກັນ.

ວິທີການຄິດໄລ່ ແລະ ຕີຄວາມໝາຍ

ຕົວຢ່າງ Perhitungan

ໃຫ້ພວກເຮົາສະແດງໃຫ້ເຫັນຕົວຢ່າງຂໍ້ມູນຕໍ່ໄປນີ້:

\[ \{15, 20, 25, 35, 45, 55, 65, 75, 85, 95\} \]

ອ່ານເພີ່ມເຕີມ  ຄວາມຄ້າຍຄືກັນຂອງສອງແມັດຕຣິກ

1. ຂອບເຂດ:

\[ \text{Range} = 95 – 15 = 80 \]

2. ລະດັບຄວາມແຕກຕ່າງລະຫວ່າງຄວາໄທລ໌ (IQR):

ຫຼັງຈາກຈັດຮຽງຂໍ້ມູນແລ້ວ, ພວກເຮົາສາມາດຊອກຫາຄວາໄທລ໌ Q1 ແລະ Q3. ໃນກໍລະນີນີ້, Q1 ແມ່ນ 25 ແລະ Q3 ແມ່ນ 75.

\[ \text{IQR} = 75 – 25 = 50 \]

3. ຄວາມແปรປ່ວນ ແລະ ຄວາມຜັນຜວນມາດຕະຖານ:

ຄ່າສະເລ່ຍ (\(\overline{X}\)) ຂອງຂໍ້ມູນແມ່ນ 51.5. ຫຼັງຈາກນັ້ນ, ພວກເຮົາຄິດໄລ່ຄ່າແปรປ່ວນ ແລະ ຄ່າຜັນປ່ຽນມາດຕະຖານ.

\[ \text{ຄວາມແປປ່ວນ (s^2)} = \frac{1}{n-1} \sum (X_i – \overline{X})^2 = 816.11 \]

\[ \text{ຄ່າບ່ຽງເບນມາດຕະຖານ} = \sqrt{816.11} = 28.57 \]

4. ສຳປະສິດການປ່ຽນແປງ (CV):

\[ \text{CV} = \frac{28.57}{51.5} \ຄູນ 100\% \ປະມານ 55.48\% \]

ຈາກບ່ອນນີ້, ພວກເຮົາສາມາດຕີຄວາມໄດ້ວ່າຄ່າຜັນປ່ຽນມາດຕະຖານແມ່ນ 28.57, ໃນຂະນະທີ່ CV ສະແດງໃຫ້ເຫັນວ່າຄ່າຜັນປ່ຽນມາດຕະຖານແມ່ນປະມານ 55.48% ຂອງຄ່າສະເລ່ຍຂອງຂໍ້ມູນຕົ້ນສະບັບ.

ສະຫຼຸບ

ມາດຕະການການກະຈາຍແມ່ນອົງປະກອບທີ່ສຳຄັນຂອງການວິເຄາະຂໍ້ມູນທາງສະຖິຕິ ເພາະວ່າມັນໃຫ້ຄວາມເຂົ້າໃຈກ່ຽວກັບຄວາມແປປ່ວນ ແລະ ການແຜ່ກະຈາຍຂອງຂໍ້ມູນອ້ອມຮອບຄ່າສູນກາງ. ມາດຕະການການກະຈາຍທີ່ນິຍົມໃຊ້ປະກອບມີຂອບເຂດ, ຂອບເຂດລະຫວ່າງຄວາໄທ, ຄວາມແปรປ່ວນ, ຄ່າຜັນປ່ຽນມາດຕະຖານ, ແລະ ສຳປະສິດການປ່ຽນແປງ. ແຕ່ລະມາດຕະການເຫຼົ່ານີ້ມີການນຳໃຊ້ສະເພາະ ແລະ ສາມາດໃຫ້ຄວາມເຂົ້າໃຈທີ່ມີຄຸນຄ່າໂດຍອີງຕາມສະພາບການຂອງຂໍ້ມູນ ແລະ ຈຸດປະສົງຂອງການວິເຄາະ. ໂດຍການເຂົ້າໃຈ ແລະ ການນຳໃຊ້ມາດຕະການການກະຈາຍຢ່າງເໝາະສົມ, ພວກເຮົາສາມາດຕັດສິນໃຈທີ່ມີຂໍ້ມູນ ແລະ ຖືກຕ້ອງຫຼາຍຂຶ້ນໃນຂົງເຂດການຄົ້ນຄວ້າ ແລະ ການນຳໃຊ້ວິທະຍາສາດຂໍ້ມູນຕ່າງໆ.

ຂຽນຄຳເຫັນ