ການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ
ການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ ແມ່ນເຕັກນິກທາງສະຖິຕິທີ່ໃຊ້ເພື່ອວິເຄາະຄວາມສຳພັນລະຫວ່າງສອງຕົວແປດ້ານປະລິມານ. ຕົວແປທີ່ພວກເຮົາພະຍາຍາມຄາດຄະເນເອີ້ນວ່າຕົວແປຕາມ ຫຼື ຕົວແປຕອບສະໜອງ, ໃນຂະນະທີ່ຕົວແປທີ່ໃຊ້ເພື່ອເຮັດການຄາດຄະເນເອີ້ນວ່າຕົວແປເອກະລາດ ຫຼື ຕົວແປຄາດຄະເນ. ໃນການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ, ພວກເຮົາພະຍາຍາມຊອກຫາເສັ້ນຊື່ທີ່ດີທີ່ສຸດທີ່ອະທິບາຍຄວາມສຳພັນລະຫວ່າງສອງຕົວແປເຫຼົ່ານີ້.
ແນວຄວາມຄິດພື້ນຖານຂອງການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ
ການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆແມ່ນອີງໃສ່ສົມມຸດຕິຖານວ່າມີຄວາມສຳພັນເສັ້ນຊື່ລະຫວ່າງຕົວແປຕາມ \(Y\) ແລະຕົວແປເອກະລາດ \(X\). ຮູບແບບທົ່ວໄປຂອງຮູບແບບການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆແມ່ນ:
\[ Y = \beta_0 + \beta_1 X + \epsilon \]
ຢູ່ໃສ:
-\(Y\) ແມ່ນຕົວແປທີ່ຂຶ້ນກັບ.
-\(X\) ແມ່ນຕົວແປເອກະລາດ.
- \( \beta_0 \) ແມ່ນຈຸດຕັດ, ເຊິ່ງເປັນຄ່າຂອງ \(Y\) ເມື່ອ \(X = 0\).
– \( \beta_1 \) ແມ່ນຄວາມຊັນ ຫຼື ຄວາມຊັນ, ເຊິ່ງເປັນການປ່ຽນແປງສະເລ່ຍໃນ \(Y\) ສຳລັບການປ່ຽນແປງແຕ່ລະຫົວໜ່ວຍໃນ \(X\).
– \( \epsilon \) ແມ່ນຄວາມຜິດພາດ ຫຼື ຄ່າທີ່ເຫຼືອຢູ່ ເຊິ່ງສະແດງເຖິງການປ່ຽນແປງໃນ \(Y\) ທີ່ບໍ່ສາມາດອະທິບາຍໄດ້ດ້ວຍ \(X\).
ເປົ້າໝາຍຂອງການວິເຄາະຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆແມ່ນເພື່ອປະເມີນພາລາມິເຕີ \(\beta_0\) ແລະ \(\beta_1\) ເພື່ອໃຫ້ຮູບແບບສາມາດໃຊ້ເພື່ອຄາດຄະເນຄ່າຂອງ \(Y\) ທີ່ກ່ຽວຂ້ອງກັບຄ່າຂອງ \(X\).
ວິທີການກຳລັງສອງໜ້ອຍທີ່ສຸດ
ໜຶ່ງໃນວິທີການທີ່ນິຍົມໃຊ້ຫຼາຍທີ່ສຸດສຳລັບການຈັດຮູບແບບການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆແມ່ນວິທີການກຳລັງສອງນ້ອຍທີ່ສຸດ. ວິທີການນີ້ມີຈຸດປະສົງເພື່ອຫຼຸດຜ່ອນຜົນບວກຂອງກຳລັງສອງຂອງຄວາມແຕກຕ່າງແນວຕັ້ງລະຫວ່າງການສັງເກດຕົວຈິງ ແລະ ຄ່າທີ່ຄາດຄະເນໂດຍຮູບແບບ. ສົມມຸດວ່າພວກເຮົາມີການສັງເກດ n ອັນທີ່ປະກອບດ້ວຍຄູ່ \((x_i, y_i)\) ສຳລັບ \(i = 1, 2, …, n\). ຟັງຊັນທີ່ຕ້ອງຫຼຸດຜ່ອນແມ່ນ:
\[ S(\beta_0, \beta_1) = \sum_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]
ເພື່ອຊອກຫາ \(\beta_0\) ແລະ \(\beta_1\) ທີ່ຫຼຸດຈຳນວນຟັງຊັນນີ້ລົງ, ເຮົາເອົາອະນຸພັນບາງສ່ວນຂອງ \(S(\beta_0, \beta_1)\) ທຽບກັບແຕ່ລະພາລາມິເຕີ ແລະ ກຳນົດອະນຸພັນເຫຼົ່ານີ້ໃຫ້ເປັນສູນ. ການຄິດໄລ່ທາງຄະນິດສາດສາມາດງ່າຍດາຍໄດ້ດັ່ງຕໍ່ໄປນີ້:
\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – x)(y_i – y)}{\sum_{i=1}^{n} (x_i – x)^2} \]
\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]
ຢູ່ໃສ:
- \(\bar{x}\) ແມ່ນຄ່າສະເລ່ຍຂອງ \(X\)
- \(\bar{y}\) ແມ່ນຄ່າສະເລ່ຍຂອງ \(Y\)
ຫຼັງຈາກໄດ້ຮັບພາລາມິເຕີ \(\beta_0\) ແລະ \(\beta_1\), ຮູບແບບການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆສາມາດໃຊ້ເພື່ອຄາດຄະເນຄ່າຂອງ \(Y\) ສຳລັບແຕ່ລະຄ່າຂອງ \(X\).
ສົມມຸດຕິຖານໃນການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ
ສຳລັບຜົນໄດ້ຮັບທີ່ຖືກຕ້ອງ ແລະ ໜ້າເຊື່ອຖື, ການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆສົມມຸດວ່າມີຫຼາຍສິ່ງຫຼາຍຢ່າງ:
1. ຄວາມເປັນເສັ້ນຊື່: ຄວາມສຳພັນລະຫວ່າງຕົວແປຕາມ ແລະ ຕົວແປອິດສະຫຼະຕ້ອງເປັນເສັ້ນຊື່.
2. ຄວາມເປັນເອກະລາດ: ການສັງເກດການຕ້ອງເປັນອິດສະຫຼະຈາກກັນແລະກັນ.
3. ຄວາມສົມດຸນ: ຄວາມແປປ່ວນທີ່ເຫຼືອຕ້ອງຄົງທີ່ຕະຫຼອດຂອບເຂດຂອງຄ່າຂອງຕົວແປເອກະລາດ.
4. ສະພາບປົກກະຕິທີ່ເຫຼືອ: ສະພາບປົກກະຕິ (ຄວາມຜິດພາດ) ຕ້ອງປະຕິບັດຕາມການແຈກຢາຍປົກກະຕິ.
ຖ້າບໍ່ຕອບສະໜອງສົມມຸດຕິຖານເຫຼົ່ານີ້, ຜົນຂອງຮູບແບບການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆຈະບໍ່ໜ້າເຊື່ອຖື ແລະ ອາດຈະບໍ່ສາມາດຄາດຄະເນໄດ້ຢ່າງຖືກຕ້ອງ.
ການປະເມີນຮູບແບບການຖົດຖອຍ
ວິທີໜຶ່ງໃນການປະເມີນວ່າຮູບແບບການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆໄດ້ຄາດຄະເນໄດ້ດີປານໃດແມ່ນການໃຊ້ສຳປະສິດການກຳນົດ (\(R^2\)). ສຳປະສິດການກຳນົດສະແດງໃຫ້ເຫັນສັດສ່ວນຂອງການປ່ຽນແປງໃນຕົວແປຕາມທີ່ສາມາດອະທິບາຍໄດ້ໂດຍການປ່ຽນແປງໃນຕົວແປເອກະລາດ.
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
ຢູ່ໃສ:
– \(\hat{y}_i\) ແມ່ນຄ່າທີ່ຄາດຄະເນໄວ້ຂອງ \(Y\).
- \(y_i\) ແມ່ນຄ່າຕົວຈິງຂອງ \(Y\).
- \(\bar{y}\) ແມ່ນຄ່າສະເລ່ຍຂອງຄ່າຂອງ \(Y\).
ຄ່າ \(R^2\) ມີຄ່າຕັ້ງແຕ່ 0 ຫາ 1. ຄ່າ \(R^2\) ທີ່ໃກ້ຄຽງກັບ 1 ຊີ້ບອກວ່າຮູບແບບສາມາດອະທິບາຍຄວາມແຕກຕ່າງສ່ວນໃຫຍ່ໃນຕົວແປທີ່ຂຶ້ນກັບ.
ການຈັດຕັ້ງປະຕິບັດໃນພາສາການຂຽນໂປຣແກຣມ
ເພື່ອຈັດຕັ້ງປະຕິບັດການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆ, ພວກເຮົາສາມາດໃຊ້ຊອບແວສະຖິຕິ ຫຼື ພາສາການຂຽນໂປຣແກຣມຕ່າງໆ. ຂ້າງລຸ່ມນີ້ແມ່ນຕົວຢ່າງການປະຕິບັດໃນ Python ໂດຍໃຊ້ຫ້ອງສະໝຸດ `scikit-learn`:
“` python
ນໍາເຂົ້າຕົວເລກເປັນ np
ນໍາເຂົ້າ matplotlib.pyplot ເປັນ plt
ຈາກ sklearn.linear_model ນໍາເຂົ້າ LinearRegression
ຈາກ sklearn.metrics import mean_squared_error, r2_score
ຂໍ້ມູນ
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
ຮູບແບບ
ແບບຈຳລອງ = LinearRegression ()
model.fit (X, y)
ການຄາດເດົາ
y_pred = model.predict (X)
ສຳປະສິດ
beta_0 = ຮູບແບບ.intercept_
beta_1 = ຮູບແບບ.coef_[0]
ພິມ (f'ຕັດ: {beta_0}')
ພິມ (f'ຄວາມຊັນ: {beta_1}')
ພິມ (f'ຄວາມຜິດພາດຂອງຄ່າສະເລ່ຍກຳລັງສອງ: {mean_squared_error(y, y_pred)}')
ພິມ (f'ສຳປະສິດການກຳນົດ (R^2): {r2_score(y, y_pred)}')
ເສັ້ນສະແດງຂໍ້ມູນ ແລະ ເສັ້ນຖົດຖອຍ
plt.scatter(X, y, color='blue')
plt.plot(X, y_pred, color='ສີແດງ')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
“ `
ໃນຕົວຢ່າງຂ້າງເທິງ, ກ່ອນອື່ນໝົດພວກເຮົານຳເຂົ້າຫ້ອງສະໝຸດທີ່ຈຳເປັນ, ກຳນົດຂໍ້ມູນ \(X\) ແລະ \(Y\), ແລະຈາກນັ້ນໃຊ້ວັດຖຸ `LinearRegression` ຈາກ `scikit-learn` ເພື່ອໃຫ້ຮູບແບບເໝາະສົມກັບຂໍ້ມູນ. ເມື່ອຮູບແບບເໝາະສົມແລ້ວ, ພວກເຮົາຈະເຮັດການຄາດຄະເນ ແລະ ຄິດໄລ່ຄ່າສຳປະສິດ, ເຊັ່ນດຽວກັນກັບຄ່າຄວາມຜິດພາດກຳລັງສອງສະເລ່ຍ ແລະ ຄ່າສຳປະສິດຂອງການກຳນົດ. ສຸດທ້າຍ, ພວກເຮົາວາງແຜນຂໍ້ມູນ ແລະ ເສັ້ນຖົດຖອຍ.
ສະຫຼຸບ
ການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆແມ່ນເຄື່ອງມືການວິເຄາະທາງສະຖິຕິທີ່ມີປະສິດທິພາບທີ່ໃຊ້ເພື່ອອະທິບາຍຄວາມສຳພັນລະຫວ່າງສອງຕົວແປດ້ານປະລິມານ. ດ້ວຍສົມມຸດຕິຖານພື້ນຖານບາງຢ່າງກ່ຽວກັບຄວາມເປັນເສັ້ນຊື່, ຄວາມເປັນເອກະລາດ, ຄວາມເປັນເອກະພາບ, ແລະ ຄວາມປົກກະຕິ, ພວກເຮົາສາມາດຄາດຄະເນຄ່າຂອງຕົວແປທີ່ຂຶ້ນກັບຄ່າຂອງຕົວແປເອກະລາດ. ວິທີການ Least Squares ໃຫ້ວິທີທີ່ມີປະສິດທິພາບໃນການປັບເສັ້ນການຖົດຖອຍ ແລະ ກຳນົດພາລາມິເຕີທີ່ດີທີ່ສຸດ. ການປະເມີນຮູບແບບຜ່ານສຳປະສິດການກຳນົດ (R2) ໃຫ້ຄວາມເຂົ້າໃຈກ່ຽວກັບວ່າຮູບແບບຂອງພວກເຮົາມີປະສິດທິພາບແນວໃດ.
ເຖິງແມ່ນວ່າການວິເຄາະການຖົດຖອຍເສັ້ນຊື່ແບບງ່າຍໆມີຂໍ້ຈຳກັດ, ເຊັ່ນວ່າສາມາດຈັດການກັບຕົວແປໄດ້ພຽງສອງຕົວ ແລະ ສົມມຸດຕິຖານທີ່ຕ້ອງໄດ້ບັນລຸ, ແຕ່ເຕັກນິກນີ້ຍັງຄົງເປັນພື້ນຖານທີ່ສຳຄັນໃນສະຖິຕິ ແລະ ການວິເຄາະຂໍ້ມູນ, ແລະ ມັກຖືກນຳໃຊ້ເປັນຂັ້ນຕອນທຳອິດໃນການເຂົ້າໃຈຄວາມສຳພັນລະຫວ່າງຕົວແປກ່ອນທີ່ຈະກ້າວໄປສູ່ວິທີການທີ່ສັບສົນຫຼາຍຂຶ້ນ.