ສູດການຖົດຖອຍໂລຈິດສະຕິກ

ສູດການຖົດຖອຍໂລຈິດສະຕິກ

ການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກແມ່ນໜຶ່ງໃນວິທີການທີ່ໄດ້ຮັບຄວາມນິຍົມຫຼາຍທີ່ສຸດໃນສະຖິຕິ ແລະ ວິທະຍາສາດຂໍ້ມູນ ສຳລັບການສ້າງແບບຈຳລອງຄວາມສຳພັນລະຫວ່າງຕົວແປເອກະລາດຈຳນວນໜຶ່ງ (ຕົວຄາດຄະເນ) ແລະ ຕົວແປທີ່ຂຶ້ນກັບປະເພດ, ໂດຍສະເພາະແມ່ນຕົວແປຖານສອງ (ເຊັ່ນ: ແມ່ນ/ບໍ່, ສຳເລັດ/ລົ້ມເຫຼວ, ເຈັບປ່ວຍ/ມີສຸຂະພາບດີ). ບໍ່ເໝືອນກັບການວິເຄາະການຖົດຖອຍເສັ້ນຊື່, ເຊິ່ງສ້າງຄ່າຢ່າງຕໍ່ເນື່ອງ, ການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກຖືກອອກແບບມາເພື່ອປະເມີນຄວາມເປັນໄປໄດ້ຂອງເຫດການ, ສະນັ້ນຜົນໄດ້ຮັບສຸດທ້າຍແມ່ນຢູ່ໃນລະດັບ 0 ຫາ 1. ໃນບົດຄວາມນີ້, ພວກເຮົາຈະປຶກສາຫາລືກ່ຽວກັບສູດການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກ, ຄວາມໝາຍຂອງແຕ່ລະອົງປະກອບ, ແລະວິທີການຕີຄວາມໝາຍມັນ.

ເປັນຫຍັງການຖົດຖອຍທາງໂລຈິດສະຕິກຈຶ່ງຈຳເປັນ?

ຖ້າພວກເຮົາໃຊ້ການຖົດຖອຍເສັ້ນຊື່ເພື່ອຄາດຄະເນຄວາມເປັນໄປໄດ້, ຮູບແບບສາມາດສ້າງຄ່າທີ່ຕໍ່າກວ່າ 0 ຫຼືສູງກວ່າ 1, ເຊິ່ງເຫັນໄດ້ຊັດເຈນວ່າບໍ່ສົມເຫດສົມຜົນສຳລັບຄວາມເປັນໄປໄດ້. ການຖົດຖອຍໂລຈິດສະຕິກແກ້ໄຂບັນຫານີ້ໂດຍການໃຊ້ຟັງຊັນບໍ່ເປັນເສັ້ນຊື່ທີ່ແຜນທີ່ຜົນໄດ້ຮັບທີ່ຄິດໄລ່ (ເຊິ່ງສາມາດເປັນຄ່າໃດກໍໄດ້) ກັບຄ່າຄວາມເປັນໄປໄດ້ລະຫວ່າງ 0 ແລະ 1. ຟັງຊັນທີ່ໃຊ້ທົ່ວໄປທີ່ສຸດແມ່ນຟັງຊັນໂລຈິດສະຕິກ ຫຼື ຊິກມອຍ.

ຕົວຢ່າງ, ສົມມຸດວ່າພວກເຮົາຕ້ອງການຄາດຄະເນວ່າລູກຄ້າຈະປ່ຽນການບໍລິການໂດຍອີງໃສ່ອາຍຸ, ໄລຍະເວລາຂອງການສະໝັກສະມາຊິກ, ແລະຄວາມຖີ່ຂອງການນຳໃຊ້. ຜົນໄດ້ຮັບທີ່ຄາດຄະເນມີພຽງສອງຄວາມເປັນໄປໄດ້ຄື: ປ່ຽນການບໍລິການ (1) ຫຼືບໍ່ມີການປ່ຽນການບໍລິການ (0). ການວິເຄາະການຖົດຖອຍທາງໂລຈິດສະຕິກແມ່ນເໝາະສົມກັບສະຖານະການປະເພດນີ້.

ສູດພື້ນຖານສຳລັບການຖົດຖອຍໂລຈິດສະຕິກ

ສາລະສຳຄັນຂອງການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກແມ່ນການສ້າງແບບຈຳລອງຄວາມເປັນໄປໄດ້ \(p\) ທີ່ \(Y = 1\) (ເຫດການເກີດຂຶ້ນ), ໂດຍໃຫ້ຄ່າຂອງຕົວແປຄາດຄະເນ \(X\).

ຮູບແບບການຖົດຖອຍໂລຈິດສະຕິກມັກຖືກຂຽນໃນສອງຮູບແບບທີ່ສຳຄັນຄື:

1) ຮູບແບບຄວາມເປັນໄປໄດ້ (Sigmoid)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

ກັບ

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

ຂໍ້ມູນ:
-\( p\) ແມ່ນຄວາມເປັນໄປໄດ້ຂອງເຫດການ (ຕົວຢ່າງ: churn = 1).
– \( e \) ແມ່ນຕົວເລກຂອງ Euler (ປະມານ 2,71828).
- \( z \) ເປັນການລວມຕົວເສັ້ນຊື່ຂອງຕົວຄາດຄະເນ.
- \( \beta_0 \) ແມ່ນຈຸດຕັດ (ຄ່າຄົງທີ່).
- \( \beta_1, \beta_2, \ldots, \beta_k \) ແມ່ນສຳປະສິດການຖົດຖອຍ.
- \( X_1, X_2, \ldots, X_k \) ແມ່ນຕົວແປເອກະລາດ.

READ  ຄວາມສຳຄັນຂອງສະຖິຕິໃນການພົວພັນສາກົນ

ຟັງຊັນ sigmoid ຮັບປະກັນວ່າບໍ່ວ່າຄ່າຂອງ \(z\) ຈະເປັນແນວໃດ, ຄ່າຂອງ \(p\) ຈະຍັງຄົງຢູ່ລະຫວ່າງ 0 ແລະ 1.

2) ແບບຟອມ Logit (ອັດຕາການລ້າສຸດ)

ຮູບແບບທີ່ສຳຄັນອີກອັນໜຶ່ງແມ່ນຮູບແບບໂລກິດ, ເຊິ່ງເປັນໂລກາລິດຂອງອັດຕາຕໍ່ຮອງ:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

ຂໍ້ມູນ:
- \( \frac{p}{1-p} \) ເອີ້ນວ່າ ໂອກາດ (ໂອກາດທຽບເທົ່າ).
- \( \ln \) ແມ່ນ logarithm ທຳມະຊາດ.

ຮູບແບບໂລຈິດອະທິບາຍວ່າ ການວິເຄາະການຖົດຖອຍໂລຈິດຕົວຈິງແລ້ວສ້າງແບບຈຳລອງອັດຕາການເກີດຂອງໂລຈິດເປັນຟັງຊັນເສັ້ນຊື່ຂອງຕົວຄາດຄະເນ. ສິ່ງນີ້ເຮັດໃຫ້ການຕີຄວາມໝາຍຂອງສຳປະສິດມີຄວາມຊັດເຈນຂຶ້ນ, ໂດຍສະເພາະໃນສະພາບການຂອງອັດຕາສ່ວນອັດຕາການເກີດ.

ເຂົ້າໃຈອັດຕາຕໍ່ຮອງ ແລະ ອັດຕາຕໍ່ຮອງ

ເພື່ອເຂົ້າໃຈສູດການຖົດຖອຍໂລຈິດສະຕິກຢ່າງແທ້ຈິງ, ພວກເຮົາຈຳເປັນຕ້ອງແຍກແຍະລະຫວ່າງຄວາມເປັນໄປໄດ້ ແລະ ອັດຕາໂອກາດ.

- ຄວາມເປັນໄປໄດ້ \(p\): ໂອກາດຂອງເຫດການທີ່ຈະເກີດຂຶ້ນ (0 ຫາ 1).
- ອັດຕາຕໍ່ຮອງ: ການປຽບທຽບຄວາມເປັນໄປໄດ້ຂອງສິ່ງທີ່ເກີດຂຶ້ນກັບສິ່ງທີ່ບໍ່ເກີດຂຶ້ນ:

\[
ອັດຕາຕໍ່ຮອງ = \frac{p}{1-p}
\]

ຕົວຢ່າງ: ຖ້າ \( p = 0{,}8 \), ແລ້ວ:

\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]

ນີ້ໝາຍຄວາມວ່າເຫດການດັ່ງກ່າວມີໂອກາດເກີດຂຶ້ນຫຼາຍກວ່າ 4 ເທົ່າກ່ວາທີ່ບໍ່ເກີດຂຶ້ນ.

ໃນການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກ, ສຳປະສິດ \(\beta\) ມັກຈະຖືກຕີຄວາມຜ່ານອັດຕາສ່ວນອັດຕາຕໍ່ຮອງ:

\[
\text{OR} = e^{\beta}
\]

- ຖ້າ \( \beta > 0 \), ຫຼັງຈາກນັ້ນ \( e^{\beta} > 1 \): ຕົວຄາດເດົາເພີ່ມໂອກາດຂອງເຫດການ.
- ຖ້າ \( \beta < 0 \), ແລ້ວ \( e^{\beta} < 1 \): ຕົວຄາດເດົາຫຼຸດໂອກາດຂອງເຫດການ. - ຖ້າ \( \beta = 0 \), ແລ້ວ \( e^{\beta} = 1 \): ບໍ່ມີຜົນກະທົບຕໍ່ໂອກາດ. ຕົວຢ່າງ, ຖ້າ \( \beta_1 = 0{,}7 \), ແລ້ວ: \[ e^{0{,}7} \approx 2{,}01 \] ນີ້ໝາຍຄວາມວ່າທຸກໆ 1 ຫົວໜ່ວຍເພີ່ມຂຶ້ນໃນ \( X_1 \) ຈະຄູນໂອກາດຂອງເຫດການປະມານ 2,01 ເທົ່າ (ສົມມຸດວ່າຕົວແປອື່ນໆຍັງຄົງທີ່). ຕົວຢ່າງຂອງຮູບແບບການຖົດຖອຍໂລຈິດສະຕິກແບບງ່າຍດາຍ ສົມມຸດວ່າພວກເຮົາມີຕົວແປຄາດຄະເນພຽງຕົວດຽວ \( X \), ຕົວຢ່າງເຊັ່ນ ຈຳນວນຊົ່ວໂມງຮຽນຕໍ່ອາທິດ, ເພື່ອຄາດຄະເນການຜ່ານການສອບເສັງ (ຜ່ານ = 1, ບໍ່ຜ່ານ = 0). ຮູບແບບ:

READ  ການທົດສອບ t ໃນສະຖິຕິອະນຸມານ
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] ຖ້າຜົນໄດ້ຮັບທີ່ຄາດຄະເນແມ່ນ: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) ຫຼັງຈາກນັ້ນ: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] ຖ້າ \( X = 6 \) ຊົ່ວໂມງຂອງການສຶກສາ: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] ການຕີຄວາມໝາຍ: ດ້ວຍການສຶກສາ 6 ຊົ່ວໂມງຕໍ່ອາທິດ, ຄວາມເປັນໄປໄດ້ຜ່ານໄປດ້ວຍຄະແນນປະມານ 69%. ການປະເມີນຄ່າສຳປະສິດ: ເປັນຫຍັງຈຶ່ງບໍ່ແມ່ນວິທີການກຳລັງສອງນ້ອຍທີ່ສຸດ? ໃນການວິເຄາະການຖົດຖອຍເສັ້ນຊື່, ສຳປະສິດມັກຖືກຄິດໄລ່ໂດຍໃຊ້ວິທີການກຳລັງສອງນ້ອຍສຸດ. ຢ່າງໃດກໍຕາມ, ໃນການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກ, ຄວາມສຳພັນລະຫວ່າງຕົວຄາດຄະເນ ແລະ ຄວາມເປັນໄປໄດ້ແມ່ນບໍ່ເປັນເສັ້ນຊື່, ສະນັ້ນວິທີການກຳລັງສອງນ້ອຍສຸດຈຶ່ງບໍ່ແມ່ນວິທີທີ່ດີທີ່ສຸດ. ໂດຍທົ່ວໄປແລ້ວການວິເຄາະການຖົດຖອຍໂລຈິດສະຕິກໃຊ້ການປະເມີນຄວາມເປັນໄປໄດ້ສູງສຸດ (MLE) ເພື່ອຊອກຫາຄ່າສຳປະສິດ \( \beta \) ທີ່ເພີ່ມຄວາມເປັນໄປໄດ້ສູງສຸດຂອງຂໍ້ມູນທີ່ສັງເກດເຫັນ. ສະຫຼຸບແລ້ວ, ຄວາມເປັນໄປໄດ້ສຳລັບການສັງເກດການແບບໄບນາຣີ \( y_i \in \{0,1\} \) ແລະ ການຄາດຄະເນ \( p_i \) ແມ່ນ: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] ຫຼັງຈາກນັ້ນມັນມັກຈະຖືກປ່ຽນເປັນຄວາມເປັນໄປໄດ້ຂອງ log ເພື່ອເຮັດໃຫ້ມັນງ່າຍຕໍ່ການຄິດໄລ່: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] ຄ່າຂອງ \( \beta \) ຖືກເລືອກເພື່ອເພີ່ມ \( \ell(\beta) \). ວິທີການຕົວເລກເຊັ່ນ: Newton-Raphson ຫຼື gradient descent ມັກຖືກໃຊ້ໂດຍຊອບແວສະຖິຕິ. ຂໍ້ດີ ແລະ ຂໍ້ຈຳກັດຂອງ Logistic Regression ຂໍ້ດີ 1. ຜົນໄດ້ຮັບແມ່ນຢູ່ໃນຮູບແບບຂອງຄວາມເປັນໄປໄດ້ ດັ່ງນັ້ນພວກມັນຈຶ່ງງ່າຍຕໍ່ການແປເປັນການຕັດສິນໃຈ. 2. ການຕີຄວາມໝາຍຂອງສຳປະສິດແມ່ນຈະແຈ້ງຜ່ານອັດຕາສ່ວນໂອກາດ. 3. ເໝາະສົມສຳລັບບັນຫາການຈັດປະເພດໄບນາຣີ ແລະ ສາມາດຂະຫຍາຍໄປເຖິງຫຼາຍນາມ/ລຳດັບ. ຂໍ້ຈຳກັດ 1. ສົມມຸດວ່າມີຄວາມສຳພັນເສັ້ນຊື່ລະຫວ່າງຕົວຄາດຄະເນ ແລະ ອັດຕາການເກີດຂອງ log, ບໍ່ແມ່ນໂດຍກົງກັບຄວາມເປັນໄປໄດ້. 2. ສາມາດເປັນບັນຫາໄດ້ຖ້າມີຂໍ້ມູນຫຼາຍເສັ້ນ ຫຼື ມີຄວາມສົມດຸນສູງ. 3. ສຳລັບຮູບແບບຄວາມສຳພັນທີ່ສັບສົນຫຼາຍ, ວິທີການທີ່ບໍ່ແມ່ນເສັ້ນຊື່ອື່ນໆ (ເຊັ່ນ: ປ່າແບບສຸ່ມ ຫຼື ເຄືອຂ່າຍປະສາດ) ອາດຈະດີກວ່າ.
READ  ສະຖິຕິຫຼາຍຕົວແປແມ່ນຫຍັງ?
ສະຫຼຸບ ສູດການຖົດຖອຍໂລຈິດສະຕິກໄດ້ລວມເອົາການລວມກັນເສັ້ນຊື່ຂອງຕົວແປຄາດຄະເນກັບຟັງຊັນຊິກມອຍເພື່ອສ້າງຄວາມເປັນໄປໄດ້. ຮູບແບບທົ່ວໄປທີ່ສຸດແມ່ນ: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] ຫຼືໃນຮູບແບບໂລຈິດ: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] ໂດຍການເຂົ້າໃຈສອງຮູບແບບຂອງສູດນີ້, ພວກເຮົາສາມາດສ້າງແບບຈຳລອງການຄາດເດົາສຳລັບບັນຫາການຈັດປະເພດໄບນາຣີຕ່າງໆ ໃນຂະນະທີ່ຕີຄວາມໝາຍອິດທິພົນຂອງຕົວແປຜ່ານອັດຕາສ່ວນໂອກາດ \( e^{\beta} \). ການຖົດຖອຍໂລຈິດສະຕິກຍັງຄົງເປັນພື້ນຖານທີ່ສຳຄັນໃນການວິເຄາະຂໍ້ມູນ ເພາະມັນງ່າຍດາຍ, ມີປະສິດທິພາບ, ແລະສາມາດຕີຄວາມໝາຍໄດ້ - ແລະມັກຈະເປັນຂັ້ນຕອນທຳອິດກ່ອນທີ່ຈະພະຍາຍາມໃຊ້ແບບຈຳລອງທີ່ສັບສົນກວ່າ. ຖ້າທ່ານຕ້ອງການ, ຂ້ອຍສາມາດເພີ່ມຕົວຢ່າງການຄິດໄລ່ດ້ວຍຂໍ້ມູນຂະໜາດນ້ອຍ (ຕາຕະລາງ), ຫຼືຕົວຢ່າງການປະຕິບັດຂອງການຖົດຖອຍໂລຈິດສະຕິກໃນ Python/R ພ້ອມກັບການຕີຄວາມໝາຍຂອງຜົນຜະລິດ.

ຂຽນຄຳເຫັນ