ເຕັກນິກການຄິດໄລ່ຄ່າກາງສຳລັບຂໍ້ມູນດຽວ ແລະ ຂໍ້ມູນກຸ່ມ
ຄ່າກາງແມ່ນມາດຕະການຂອງແນວໂນ້ມສູນກາງທີ່ມັກໃຊ້ໃນສະຖິຕິ. ບໍ່ເຫມືອນກັບຄ່າສະເລ່ຍ (ຄ່າສະເລ່ຍ), ເຊິ່ງບວກຄ່າທັງໝົດແລ້ວຫານດ້ວຍຈຳນວນຄ່າ, ຄ່າກາງເນັ້ນໃສ່ "ຄ່າກາງ" ຂອງຊຸດຂໍ້ມູນທີ່ຈັດຮຽງ. ເນື່ອງຈາກມັນສຸມໃສ່ຕຳແໜ່ງ, ຄ່າກາງຈຶ່ງມີຄວາມຕ້ານທານກັບຄ່າທີ່ຮຸນແຮງ (ຄ່າຜິດປົກກະຕິ), ເຊັ່ນວ່າເມື່ອຄ່າໜຶ່ງໃຫຍ່ຫຼາຍ ຫຼື ນ້ອຍຫຼາຍເມື່ອທຽບກັບຄ່າອື່ນໆ. ນີ້ແມ່ນເຫດຜົນທີ່ຄ່າກາງຖືກນຳໃຊ້ຢ່າງກວ້າງຂວາງໃນການວິເຄາະຂໍ້ມູນທາງເສດຖະກິດ, ການສຶກສາ, ການຄົ້ນຄວ້າທາງສັງຄົມ, ແລະແມ່ນແຕ່ການປະເມີນຄະແນນການທົດສອບ.
ໃນບົດຄວາມນີ້, ພວກເຮົາຈະສົນທະນາກ່ຽວກັບເຕັກນິກການຄິດໄລ່ຄ່າກາງສຳລັບຂໍ້ມູນສອງປະເພດຄື: ຂໍ້ມູນດຽວ (ບໍ່ໄດ້ຈັດກຸ່ມ) ແລະ ຂໍ້ມູນຈັດກຸ່ມ (ນຳສະເໜີໃນຕາຕະລາງການແຈກຢາຍຄວາມຖີ່). ນອກເໜືອໄປຈາກສູດແລ້ວ, ການສົນທະນາຍັງຈະປະກອບມີຂັ້ນຕອນການປະຕິບັດຕົວຈິງເພື່ອການຈັດຕັ້ງປະຕິບັດທີ່ງ່າຍດາຍ.
-
1. ແນວຄວາມຄິດພື້ນຖານຂອງຄ່າກາງ
ຄ່າກາງແມ່ນຄ່າກາງຫຼັງຈາກຂໍ້ມູນຖືກຈັດຮຽງຈາກນ້ອຍທີ່ສຸດໄປຫາໃຫຍ່ທີ່ສຸດ. ຖ້າຈຳນວນຈຸດຂໍ້ມູນເປັນເລກຄີກ, ຄ່າກາງແມ່ນຄ່າກາງທີ່ແນ່ນອນ. ຖ້າຈຳນວນຈຸດຂໍ້ມູນເປັນເລກຄູ່, ຄ່າກາງແມ່ນຄ່າສະເລ່ຍຂອງຄ່າກາງສອງຄ່າ.
ໂດຍສັນຊາດຕະຍານແລ້ວ, ຄ່າກາງແບ່ງຂໍ້ມູນອອກເປັນສອງສ່ວນຄື:
- 50% ຂອງຂໍ້ມູນແມ່ນຕໍ່າກວ່າ (ຫຼືເທົ່າກັບ) ຄ່າກາງ
- 50% ຂອງຂໍ້ມູນຢູ່ຂ້າງເທິງ (ຫຼືເທົ່າກັບ) ຄ່າກາງ
ເນື່ອງຈາກຄ່າກາງແມ່ນອີງໃສ່ລຳດັບ, ຂັ້ນຕອນທຳອິດທີ່ຕ້ອງການເກືອບສະເໝີແມ່ນການຈັດຮຽງຂໍ້ມູນ.
-
2. ການຄິດໄລ່ຄ່າກາງສຳລັບຂໍ້ມູນດ່ຽວ
ຂໍ້ມູນດ່ຽວແມ່ນຂໍ້ມູນທີ່ນຳສະເໜີຕາມສະພາບທີ່ເປັນຢູ່ (ຕົວຢ່າງເຊັ່ນ ລາຍຊື່ຂອງເກຣດນັກຮຽນ), ບໍ່ໄດ້ສະຫຼຸບໄວ້ໃນຫ້ອງຮຽນແບບຊ່ວງເວລາຄືກັບຂໍ້ມູນກຸ່ມ.
ກ. ຂັ້ນຕອນທົ່ວໄປ
1. ຈັດຮຽງຂໍ້ມູນຈາກຄ່ານ້ອຍທີ່ສຸດໄປຫາຄ່າໃຫຍ່ທີ່ສຸດ.
2. ກຳນົດປະລິມານຂໍ້ມູນ, ຕົວຢ່າງ n.
3. ກຳນົດຕຳແໜ່ງຂອງຕົວກາງ:
- ຖ້າ n ເປັນເລກຄີກ, ຄ່າກາງຈະຢູ່ທີ່ຕຳແໜ່ງ \((n+1)/2\).
- ຖ້າ n ເປັນຄ່າຄູ່, ຄ່າກາງແມ່ນຄ່າສະເລ່ຍຂອງຂໍ້ມູນທີ່ຕຳແໜ່ງ \(n/2\) ແລະ \((n/2)+1\).
ຂ. ສູດມັດທະຍະຖານສຳລັບຂໍ້ມູນດ່ຽວ
- ຖ້າ n ເປັນຄີກ:
\[
ຂ້ອຍ = x_{(n+1)/2}
\]
ນີ້ໝາຍຄວາມວ່າຄ່າກາງແມ່ນຄ່າຂໍ້ມູນໃນລຳດັບ \((n+1)/2\).
- ຖ້າ n ເປັນເລກຄູ່:
\[
ຂ້ອຍ = \frac{x_{n/2} + x_{(n/2)+1}}{2}
\]
ຄ. ຕົວຢ່າງຂອງຂໍ້ມູນດ່ຽວ (n ຄີກ)
ຂໍ້ມູນ: 7, 2, 9, 4, 3
1) ຈັດຮຽງ: 2, 3, 4, 7, 9
2) n = 5 (ຄີກ)
3) ຕຳແໜ່ງກາງ = \((5+1)/2 = 3\)
ຄ່າກາງ = ຂໍ້ມູນທີ 3 = 4
ສະນັ້ນຄ່າກາງຂອງຂໍ້ມູນແມ່ນ 4.
ງ. ຕົວຢ່າງຂອງຂໍ້ມູນດ່ຽວ (n ຄູ່)
ຂໍ້ມູນ: 10, 4, 6, 8
1) ຈັດຮຽງ: 4, 6, 8, 10
2) n = 4 (ຄູ່)
3) ຕຳແໜ່ງກາງແມ່ນຂໍ້ມູນທີ 2 ແລະ ທີ 3
ຄ່າກາງ = (6 + 8)/2 = 7)
ສະນັ້ນຄ່າກາງຂອງຂໍ້ມູນແມ່ນ 7.
ອ. ໝາຍເຫດສຳຄັນ: ຂໍ້ມູນທີ່ມີຄວາມຖີ່
ບາງຄັ້ງຊຸດຂໍ້ມູນດຽວສາມາດຖືກກຳນົດເປັນຄ່າ ແລະ ຄວາມຖີ່ (ຕົວຢ່າງ, 60 ປາກົດສອງຄັ້ງ, 70 ປາກົດຫ້າຄັ້ງ). ໃນກໍລະນີນີ້, ຄ່າກາງຍັງຖືກພົບເຫັນໂດຍອີງໃສ່ "ການຈັດລຽງ" ຂອງຂໍ້ມູນ, ແຕ່ພວກເຮົາສາມາດໃຊ້ຄວາມຖີ່ສະສົມເພື່ອກຳນົດຕຳແໜ່ງກາງໂດຍບໍ່ຕ້ອງລະບຸຈຸດຂໍ້ມູນແຕ່ລະອັນ. ຫຼັກການແມ່ນຄືກັນ: ຊອກຫາຕຳແໜ່ງ (n+1)/2 (ຄີກ) ຫຼື ຕຳແໜ່ງ (n/2) ແລະ (n/2)+1 (ຄູ່), ຈາກນັ້ນເບິ່ງຄ່າທີ່ກວມເອົາຕຳແໜ່ງນັ້ນໂດຍອີງໃສ່ຄວາມຖີ່ສະສົມ.
-
3. ການຄິດໄລ່ຄ່າກາງສຳລັບຂໍ້ມູນທີ່ຈັດກຸ່ມ
ຂໍ້ມູນທີ່ຈັດກຸ່ມແມ່ນຂໍ້ມູນທີ່ໄດ້ຖືກສະຫຼຸບເປັນຊ່ວງເວລາຂອງຫ້ອງຮຽນ ແລະ ຄວາມຖີ່ຂອງມັນ. ຕົວຢ່າງ: 3 ຄົນທີ່ມີຄວາມສູງ 150–154 ຊມ, 8 ຄົນທີ່ມີຄວາມສູງ 155–159 ຊມ, ແລະອື່ນໆ. ບໍ່ເຫມືອນກັບຂໍ້ມູນດຽວ, ຄ່າກາງຂອງຂໍ້ມູນທີ່ຈັດກຸ່ມມັກຈະບໍ່ໄດ້ຖືກກຳນົດຢ່າງແນ່ນອນ ເພາະວ່າພວກເຮົາບໍ່ຮູ້ຄ່າສ່ວນບຸກຄົນພາຍໃນຊ່ວງເວລາ. ດັ່ງນັ້ນ, ຄ່າກາງຈຶ່ງຖືກຄິດໄລ່ໂດຍໃຊ້ການປະມານ (ການຄາດຄະເນ) ໂດຍໃຊ້ສູດຄ່າກາງສຳລັບການແຈກຢາຍທີ່ຈັດກຸ່ມ.
ກ. ຄຳສັບທີ່ສຳຄັນໃນຄ່າກາງຂອງຂໍ້ມູນກຸ່ມ
ກ່ອນທີ່ຈະໃຊ້ສູດ, ພວກເຮົາຈໍາເປັນຕ້ອງເຂົ້າໃຈຫຼາຍອົງປະກອບຄື:
- n = ຄວາມຖີ່ທັງໝົດ (ຈຳນວນຂໍ້ມູນທັງໝົດ)
- n/2 = ຕຳແໜ່ງກາງສະສົມ
- ຄລາສກາງ = ຄລາສຊ່ວງທຳອິດທີ່ຜະລິດຄວາມຖີ່ສະສົມ ≥ n/2
- L = ຂອບລຸ່ມຂອງຄລາສກາງ (ບໍ່ແມ່ນຂອບເຂດລຸ່ມ, ແຕ່ແມ່ນຂອບຂອງຄລາສ; ສຳລັບຂໍ້ມູນຕໍ່ເນື່ອງມັກໃຊ້ການປັບ 0,5 ຖ້າຂໍ້ມູນເປັນຈຳນວນເຕັມ)
- F = ຄວາມຖີ່ສະສົມກ່ອນຊັ້ນກາງ
- f = ຄວາມຖີ່ຂອງຊັ້ນກາງ
- c = ຄວາມຍາວຂອງຊັ້ນຮຽນ (ຄວາມກວ້າງຂອງໄລຍະຫ່າງ)
ຂ. ຂັ້ນຕອນໃນການກຳນົດຄ່າກາງຂອງຂໍ້ມູນກຸ່ມ
1. ສ້າງຕາຕະລາງການແຈກຢາຍຄວາມຖີ່ ແລະ ຕື່ມຖັນຄວາມຖີ່ສະສົມ.
2. ຄິດໄລ່ n (ຈຳນວນຄວາມຖີ່) ແລະ ກຳນົດ n/2.
3. ກຳນົດຊັ້ນກາງ, ຄືຊັ້ນທີ່ປະກອບມີຕຳແໜ່ງ n/2 ໂດຍອີງໃສ່ຄວາມຖີ່ສະສົມ.
4. ໃສ່ຄ່າຕ່າງໆເຂົ້າໃນສູດຄ່າກາງສຳລັບຂໍ້ມູນກຸ່ມ.
ຄ. ສູດມັດທະຍະຖານສຳລັບຂໍ້ມູນກຸ່ມ
\[
ຂ້ອຍ = L + \left(\frac{\frac{n}{2} – F}{f}\right)\ຄູນ c
\]
ສູດນີ້ປະຕິບັດການແຊກແຊງເສັ້ນຊື່ພາຍໃນຄລາສກາງ, ໂດຍສົມມຸດວ່າຂໍ້ມູນຖືກແຈກຢາຍຢ່າງເທົ່າທຽມກັນໃນຊ່ວງເວລາຂອງຄລາສ.
ງ. ຕົວຢ່າງຂອງຄ່າກາງຂອງຂໍ້ມູນກຸ່ມ
ຕົວຢ່າງ, ຂໍ້ມູນຄະແນນການທົດສອບຕໍ່ໄປນີ້:
| ຊ່ວງເວລາຄ່າ | ຄວາມຖີ່ (f) |
|—|—:|
| 40–49 | 5 |
| 50–59 | 8 |
| 60–69 | 12 |
| 70–79 | 10 |
| 80–89 | 5 |
1) ຄວາມຖີ່ທັງໝົດ:
\[
n = 5 + 8 + 12 + 10 + 5 = 40
\]
2) ຄິດໄລ່ n/2:
\[
n/2 = 20
\]
3) ຄວາມຖີ່ສະສົມ:
– 40–49:5
– 50–59: 5+8 = 13
– 60–69: 13+12 = 25
– 70–79:35
– 80–89:40
ຕຳແໜ່ງທີ 20 ຢູ່ໃນຊັ້ນຮຽນທີ່ມີຄະແນນສະສົມທຳອິດ ≥ 20, ຄື 60–69. ສະນັ້ນນີ້ແມ່ນຊັ້ນກາງ.
4) ກຳນົດສ່ວນປະກອບຕ່າງໆ:
- L = ຂອບລຸ່ມຂອງຊັ້ນກາງ. ສຳລັບຊ່ວງເວລາ 60–69, ຂອບລຸ່ມແມ່ນ 59,5 (ຖ້າຂໍ້ມູນເປັນຄ່າຈຳນວນເຕັມ).
- F = ຄວາມຖີ່ສະສົມກ່ອນຊັ້ນກາງ = 13
- f = ຄວາມຖີ່ຂອງຊັ້ນກາງ = 12
- c = ຄວາມຍາວຂອງຫ້ອງຮຽນ = 10
5) ໃສ່ສູດ:
\[
ຂ້ອຍ = 59,5 + \left(\frac{20 – 13}{12}\right)\ຄູນ 10
\]
\[
ຂ້ອຍ = 59,5 + \left(\frac{7}{12}\right)\ຄູນ 10
\]
\[
ຂ້ອຍ = 59,5 + 5,833… = 65,333…
\]
ສະນັ້ນຄ່າກາງຂອງຂໍ້ມູນກຸ່ມແມ່ນປະມານ 65,33.
-
4. ຄວາມຜິດພາດທົ່ວໄປ
ຄວາມຜິດພາດທົ່ວໄປບາງຢ່າງເມື່ອຄິດໄລ່ຄ່າກາງ:
1. ບໍ່ໄດ້ຈັດຮຽງຂໍ້ມູນສຳລັບຂໍ້ມູນດຽວ, ດັ່ງນັ້ນຄ່າກາງຈຶ່ງບໍ່ຖືກຕ້ອງ.
2. ການກຳນົດຕຳແໜ່ງຂອງຄ່າກາງຜິດເມື່ອ n ເປັນຄ່າຄູ່ (ຕ້ອງເອົາຄ່າສະເລ່ຍຂອງຄ່າກາງສອງຄ່າ).
3. ສຳລັບຂໍ້ມູນກຸ່ມ, ມັນຜິດທີ່ຈະເລືອກຄລາສກາງ ເພາະມັນບໍ່ໄດ້ສ້າງຄວາມຖີ່ສະສົມ.
4. ການໃຊ້ຂີດຈຳກັດລຸ່ມຂອງຄລາສຂອບລຸ່ມ (L) ເມື່ອຂໍ້ມູນເປັນຂໍ້ມູນຕໍ່ເນື່ອງ/ໄລຍະຫ່າງເປັນຈຳນວນເຕັມ.
5. ການກຳນົດຄວາມຍາວຂອງຫ້ອງຮຽນບໍ່ຖືກຕ້ອງ (ຄ), ໂດຍສະເພາະຖ້າໄລຍະຫ່າງບໍ່ສອດຄ່ອງກັນ.
-
5. ປິດ
ຄ່າກາງແມ່ນມາດຕະການທີ່ງ່າຍດາຍແຕ່ມີປະສິດທິພາບຂອງແນວໂນ້ມສູນກາງ, ໂດຍສະເພາະເມື່ອຂໍ້ມູນມີຄ່າສູງສຸດ. ສຳລັບຊຸດຂໍ້ມູນດຽວ, ຄ່າກາງແມ່ນຖືກກຳນົດໂດຍກົງຈາກຕຳແໜ່ງກາງຫຼັງຈາກຂໍ້ມູນຖືກຈັດຮຽງ, ໂດຍມີການປະຕິບັດທີ່ແຕກຕ່າງກັນສຳລັບຊຸດຂໍ້ມູນຈຳນວນຄີກ ແລະ ຄູ່. ໃນຂະນະດຽວກັນ, ສຳລັບຊຸດຂໍ້ມູນທີ່ຈັດກຸ່ມ, ຄ່າກາງແມ່ນຄິດໄລ່ໂດຍໃຊ້ສູດການແຊກແຊງໂດຍອີງໃສ່ຊັ້ນກາງ, ຄວາມຖີ່ສະສົມ, ແລະ ຄວາມຍາວຂອງຊັ້ນ.
ໂດຍການເຂົ້າໃຈແນວຄວາມຄິດ ແລະ ຂັ້ນຕອນຕ່າງໆ, ທ່ານສາມາດຄິດໄລ່ຄ່າກາງໄດ້ຢ່າງວ່ອງໄວ ແລະ ຖືກຕ້ອງ, ທັງໃນຂໍ້ມູນງ່າຍໆ ແລະ ຂໍ້ມູນທີ່ສະຫຼຸບໄວ້ໃນຕາຕະລາງ. ໃນສະຖານະການວິເຄາະຫຼາຍໆຢ່າງ, ຄ່າກາງແມ່ນຕົວເລືອກທີ່ເປັນຕົວແທນຫຼາຍກວ່າຄ່າສະເລ່ຍ, ໂດຍສະເພາະເມື່ອການແຈກຢາຍຂໍ້ມູນບໍ່ສະເໝີພາບ ຫຼື ມີຄ່າຜິດປົກກະຕິ.
ຖ້າທ່ານຕ້ອງການ, ຂ້ອຍຍັງສາມາດເພີ່ມຄຳຖາມຝຶກຊ້ອມພ້ອມກັບການສົນທະນາເພື່ອເສີມສ້າງຄວາມເຂົ້າໃຈຂອງເຈົ້າກ່ຽວກັບຄ່າກາງຂອງຂໍ້ມູນດ່ຽວ ແລະ ຂໍ້ມູນກຸ່ມ.