Foirmle Ath-tharraing Lòdaistic
’S e ath-tharraing loidsistigeach aon de na dòighean as mòr-chòrdte ann an staitistig agus saidheans dàta airson modaladh a dhèanamh air a’ cheangal eadar grunn chaochladairean neo-eisimeileach (ro-innsearan) agus caochladair eisimeileach roinneil, gu h-àraidh dà-chànanach (me, tha/chan eil, soirbheachas/fàilligeadh, tinn/fallain). Eu-coltach ri ath-tharraing loidhneach, a bhios a’ toirt a-mach luachan leantainneach, tha ath-tharraing loidsistigeach air a dhealbhadh gus coltachd tachartais a thomhas, agus mar sin tha an toradh deireannach anns an raon 0 gu 1. San artaigil seo, bruidhnidh sinn air foirmle ath-tharraing loidsistigeach, brìgh gach pàirt, agus mar a mhìnicheas sinn e.
Carson a tha feum air ath-thilleadh loidsistigeach?
Ma chleachdas sinn ath-tharraing loidhneach gus coltachdan a ro-innse, faodaidh am modail luachan a thoirt gu buil fo 0 no os cionn 1, rud a tha gu soilleir mì-reusanta airson coltachd. Bidh ath-tharraing loidsistigeach a’ dèiligeadh ris a’ chùis seo le bhith a’ cleachdadh gnìomh neo-loidhneach a bhios a’ mapadh an toradh obraichte (a dh’ fhaodadh a bhith na luach sam bith) gu luach coltachd eadar 0 agus 1. Is e an gnìomh loidsistigeach no sigmoid an gnìomh as cumanta a thathas a’ cleachdadh.
Mar eisimpleir, can gu bheil sinn airson ro-innse an tèid neach-ceannach a-mach à reic stèidhichte air an aois, fad ballrachd, agus tricead cleachdaidh. Chan eil ach dà roghainn aig an toradh a thathar a’ ro-innse: gluasad (1) no gun gluasad (0). Tha ath-tharraing loidsistigeach gu math freagarrach airson an t-seòrsa suidheachaidh seo.
Foirmle Bhunasach airson Ath-thilleadh Lòdaistic
Is e bun-bheachd ath-tharraing loidsistig modail a dhèanamh den choltachd \(p \) gum bi \(Y = 1 \) (an tachartas a’ tachairt), air a thoirt seachad le luach a’ chaochladair ro-innse \(X \).
Mar as trice bidh modalan ath-tharraing loidsistigeach air an sgrìobhadh ann an dà chruth chudromach:
1) Foirm Cothromachd (Sigmoid)
\[
p = P(Y=1 \meadhon X) = \frac{1}{1 + e^{-z}}
\]
còmhla ris
\[
z = β₀ + β₁ X₁ + β₂ X₂ + β₇ + β₇ X₇
\]
Fiosrachadh:
– ’S e \(p \) coltachd an tachartais (m.e.: churn = 1).
– ’S e àireamh Euler a th’ ann an \(e \) (timcheall air 2,71828).
– ’S e measgachadh loidhneach de ro-innsearan a th’ ann an \(z \).
– Is e (β0) an eadar-ghearradh (cunbhalach).
– ’S iad (β₁, β₂, ..., βk) na co-èifeachdan ath-tharraing.
– Tha \(X_1, X_2, \ldots, X_k \) nan caochladairean neo-eisimeileach.
Tha an gnìomh sigmoid a’ dèanamh cinnteach ge bith dè an luach a th’ aig \(z \), gum fuirich luach \(p \) eadar 0 agus 1.
2) Foirm Logit (Cothroman Log)
Is e cruth eile glè chudromach cruth an logit, is e sin logarithm nan cothroman:
\[
logit(p) = ln(p}{1-p) = β0 + β1 X1 + β2 X2 + cdots + βk Xk
\]
Fiosrachadh:
– Canar na cothroman (cothrom coimeasach) ri \( \frac{p}{1-p} \).
– ’S e \( \ln \) an logaritam nàdarrach.
Tha am foirm logit a’ mìneachadh gu bheil ath-tharraing logistic a’ modaladh nan cothroman log mar ghnìomh loidhneach de na ro-innsearan. Tha seo a’ dèanamh mìneachadh nan co-èifeachdan nas soilleire, gu h-àraidh ann an co-theacsa co-mheasan cothroman.
A’ Tuigsinn Cothroman agus Co-mheasan Cothroman
Gus tuigse cheart fhaighinn air foirmle ath-tharraing loidsistigseach, feumaidh sinn eadar-dhealachadh a dhèanamh eadar coltachd agus cothroman.
– Cothrom \(p \): an cothrom gun tachair tachartas (0 gu 1).
– Cothroman: coimeas eadar coltachd rudeigin a thachras agus nach tachair e:
\[
Cothroman = p/1-p
\]
Eisimpleir: ma tha \(p = 0{,}8 \), an uairsin:
\[
Cothroman = 0,8}{0,2 = 4
\]
Tha seo a’ ciallachadh gu bheil e 4 tursan nas dualtaiche gun tachair an tachartas na nach tachair.
Ann an ath-tharraing loidsistigeach, bidh an co-èifeachd β gu tric air a mhìneachadh tron cho-mheas odds:
\[
NO = e^{\beta}
\]
– Ma tha \( \β > 0 \), an uairsin \( e^{\β} > 1 \): bidh an ro-innseadair a’ meudachadh na cothroman gum bi an tachartas ann.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.