ສູດການຖົດຖອຍໂລຈິດສະຕິກ
ການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກແມ່ນໜຶ່ງໃນວິທີການທີ່ໄດ້ຮັບຄວາມນິຍົມຫຼາຍທີ່ສຸດໃນສະຖິຕິ ແລະ ວິທະຍາສາດຂໍ້ມູນ ສຳລັບການສ້າງແບບຈຳລອງຄວາມສຳພັນລະຫວ່າງຕົວແປເອກະລາດຈຳນວນໜຶ່ງ (ຕົວຄາດຄະເນ) ແລະ ຕົວແປທີ່ຂຶ້ນກັບປະເພດ, ໂດຍສະເພາະແມ່ນຕົວແປຖານສອງ (ເຊັ່ນ: ແມ່ນ/ບໍ່, ສຳເລັດ/ລົ້ມເຫຼວ, ເຈັບປ່ວຍ/ມີສຸຂະພາບດີ). ບໍ່ເໝືອນກັບການວິເຄາະການຖົດຖອຍເສັ້ນຊື່, ເຊິ່ງສ້າງຄ່າຢ່າງຕໍ່ເນື່ອງ, ການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກຖືກອອກແບບມາເພື່ອປະເມີນຄວາມເປັນໄປໄດ້ຂອງເຫດການ, ສະນັ້ນຜົນໄດ້ຮັບສຸດທ້າຍແມ່ນຢູ່ໃນລະດັບ 0 ຫາ 1. ໃນບົດຄວາມນີ້, ພວກເຮົາຈະປຶກສາຫາລືກ່ຽວກັບສູດການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກ, ຄວາມໝາຍຂອງແຕ່ລະອົງປະກອບ, ແລະວິທີການຕີຄວາມໝາຍມັນ.
ເປັນຫຍັງການຖົດຖອຍທາງໂລຈິດສະຕິກຈຶ່ງຈຳເປັນ?
ຖ້າພວກເຮົາໃຊ້ການຖົດຖອຍເສັ້ນຊື່ເພື່ອຄາດຄະເນຄວາມເປັນໄປໄດ້, ຮູບແບບສາມາດສ້າງຄ່າທີ່ຕໍ່າກວ່າ 0 ຫຼືສູງກວ່າ 1, ເຊິ່ງເຫັນໄດ້ຊັດເຈນວ່າບໍ່ສົມເຫດສົມຜົນສຳລັບຄວາມເປັນໄປໄດ້. ການຖົດຖອຍໂລຈິດສະຕິກແກ້ໄຂບັນຫານີ້ໂດຍການໃຊ້ຟັງຊັນບໍ່ເປັນເສັ້ນຊື່ທີ່ແຜນທີ່ຜົນໄດ້ຮັບທີ່ຄິດໄລ່ (ເຊິ່ງສາມາດເປັນຄ່າໃດກໍໄດ້) ກັບຄ່າຄວາມເປັນໄປໄດ້ລະຫວ່າງ 0 ແລະ 1. ຟັງຊັນທີ່ໃຊ້ທົ່ວໄປທີ່ສຸດແມ່ນຟັງຊັນໂລຈິດສະຕິກ ຫຼື ຊິກມອຍ.
ຕົວຢ່າງ, ສົມມຸດວ່າພວກເຮົາຕ້ອງການຄາດຄະເນວ່າລູກຄ້າຈະປ່ຽນການບໍລິການໂດຍອີງໃສ່ອາຍຸ, ໄລຍະເວລາຂອງການສະໝັກສະມາຊິກ, ແລະຄວາມຖີ່ຂອງການນຳໃຊ້. ຜົນໄດ້ຮັບທີ່ຄາດຄະເນມີພຽງສອງຄວາມເປັນໄປໄດ້ຄື: ປ່ຽນການບໍລິການ (1) ຫຼືບໍ່ມີການປ່ຽນການບໍລິການ (0). ການວິເຄາະການຖົດຖອຍທາງໂລຈິດສະຕິກແມ່ນເໝາະສົມກັບສະຖານະການປະເພດນີ້.
ສູດພື້ນຖານສຳລັບການຖົດຖອຍໂລຈິດສະຕິກ
ສາລະສຳຄັນຂອງການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກແມ່ນການສ້າງແບບຈຳລອງຄວາມເປັນໄປໄດ້ \(p\) ທີ່ \(Y = 1\) (ເຫດການເກີດຂຶ້ນ), ໂດຍໃຫ້ຄ່າຂອງຕົວແປຄາດຄະເນ \(X\).
ຮູບແບບການຖົດຖອຍໂລຈິດສະຕິກມັກຖືກຂຽນໃນສອງຮູບແບບທີ່ສຳຄັນຄື:
1) ຮູບແບບຄວາມເປັນໄປໄດ້ (Sigmoid)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
ກັບ
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
ຂໍ້ມູນ:
-\( p\) ແມ່ນຄວາມເປັນໄປໄດ້ຂອງເຫດການ (ຕົວຢ່າງ: churn = 1).
– \( e \) ແມ່ນຕົວເລກຂອງ Euler (ປະມານ 2,71828).
- \( z \) ເປັນການລວມຕົວເສັ້ນຊື່ຂອງຕົວຄາດຄະເນ.
- \( \beta_0 \) ແມ່ນຈຸດຕັດ (ຄ່າຄົງທີ່).
- \( \beta_1, \beta_2, \ldots, \beta_k \) ແມ່ນສຳປະສິດການຖົດຖອຍ.
- \( X_1, X_2, \ldots, X_k \) ແມ່ນຕົວແປເອກະລາດ.
ຟັງຊັນ sigmoid ຮັບປະກັນວ່າບໍ່ວ່າຄ່າຂອງ \(z\) ຈະເປັນແນວໃດ, ຄ່າຂອງ \(p\) ຈະຍັງຄົງຢູ່ລະຫວ່າງ 0 ແລະ 1.
2) ແບບຟອມ Logit (ອັດຕາການລ້າສຸດ)
ຮູບແບບທີ່ສຳຄັນອີກອັນໜຶ່ງແມ່ນຮູບແບບໂລກິດ, ເຊິ່ງເປັນໂລກາລິດຂອງອັດຕາຕໍ່ຮອງ:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
ຂໍ້ມູນ:
- \( \frac{p}{1-p} \) ເອີ້ນວ່າ ໂອກາດ (ໂອກາດທຽບເທົ່າ).
- \( \ln \) ແມ່ນ logarithm ທຳມະຊາດ.
ຮູບແບບໂລຈິດອະທິບາຍວ່າ ການວິເຄາະການຖົດຖອຍໂລຈິດຕົວຈິງແລ້ວສ້າງແບບຈຳລອງອັດຕາການເກີດຂອງໂລຈິດເປັນຟັງຊັນເສັ້ນຊື່ຂອງຕົວຄາດຄະເນ. ສິ່ງນີ້ເຮັດໃຫ້ການຕີຄວາມໝາຍຂອງສຳປະສິດມີຄວາມຊັດເຈນຂຶ້ນ, ໂດຍສະເພາະໃນສະພາບການຂອງອັດຕາສ່ວນອັດຕາການເກີດ.
ເຂົ້າໃຈອັດຕາຕໍ່ຮອງ ແລະ ອັດຕາຕໍ່ຮອງ
ເພື່ອເຂົ້າໃຈສູດການຖົດຖອຍໂລຈິດສະຕິກຢ່າງແທ້ຈິງ, ພວກເຮົາຈຳເປັນຕ້ອງແຍກແຍະລະຫວ່າງຄວາມເປັນໄປໄດ້ ແລະ ອັດຕາໂອກາດ.
- ຄວາມເປັນໄປໄດ້ \(p\): ໂອກາດຂອງເຫດການທີ່ຈະເກີດຂຶ້ນ (0 ຫາ 1).
- ອັດຕາຕໍ່ຮອງ: ການປຽບທຽບຄວາມເປັນໄປໄດ້ຂອງສິ່ງທີ່ເກີດຂຶ້ນກັບສິ່ງທີ່ບໍ່ເກີດຂຶ້ນ:
\[
ອັດຕາຕໍ່ຮອງ = \frac{p}{1-p}
\]
ຕົວຢ່າງ: ຖ້າ \( p = 0{,}8 \), ແລ້ວ:
\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]
ນີ້ໝາຍຄວາມວ່າເຫດການດັ່ງກ່າວມີໂອກາດເກີດຂຶ້ນຫຼາຍກວ່າ 4 ເທົ່າກ່ວາທີ່ບໍ່ເກີດຂຶ້ນ.
ໃນການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກ, ສຳປະສິດ \(\beta\) ມັກຈະຖືກຕີຄວາມຜ່ານອັດຕາສ່ວນອັດຕາຕໍ່ຮອງ:
\[
\text{OR} = e^{\beta}
\]
- ຖ້າ \( \beta > 0 \), ຫຼັງຈາກນັ້ນ \( e^{\beta} > 1 \): ຕົວຄາດເດົາເພີ່ມໂອກາດຂອງເຫດການ.
- ຖ້າ \( \beta < 0 \), ແລ້ວ \( e^{\beta} < 1 \): ຕົວຄາດເດົາຫຼຸດໂອກາດຂອງເຫດການ. - ຖ້າ \( \beta = 0 \), ແລ້ວ \( e^{\beta} = 1 \): ບໍ່ມີຜົນກະທົບຕໍ່ໂອກາດ. ຕົວຢ່າງ, ຖ້າ \( \beta_1 = 0{,}7 \), ແລ້ວ: \[ e^{0{,}7} \approx 2{,}01 \] ນີ້ໝາຍຄວາມວ່າທຸກໆ 1 ຫົວໜ່ວຍເພີ່ມຂຶ້ນໃນ \( X_1 \) ຈະຄູນໂອກາດຂອງເຫດການປະມານ 2,01 ເທົ່າ (ສົມມຸດວ່າຕົວແປອື່ນໆຍັງຄົງທີ່). ຕົວຢ່າງຂອງຮູບແບບການຖົດຖອຍໂລຈິດສະຕິກແບບງ່າຍດາຍ ສົມມຸດວ່າພວກເຮົາມີຕົວແປຄາດຄະເນພຽງຕົວດຽວ \( X \), ຕົວຢ່າງເຊັ່ນ ຈຳນວນຊົ່ວໂມງຮຽນຕໍ່ອາທິດ, ເພື່ອຄາດຄະເນການຜ່ານການສອບເສັງ (ຜ່ານ = 1, ບໍ່ຜ່ານ = 0). ຮູບແບບ: