Formula regressionis logisticae

Formula Regressionis Logisticae

Regressio logistica est una ex methodis popularissimis in statistica et scientia datorum ad relationem inter numerum variabilium independentium (praedictoria) et variabilem dependentem categorialem, praesertim binariam (e.g., ita/non, successus/defectus, aeger/sanus), simulandam. Dissimilis regressioni lineari, quae valores continuos producit, regressio logistica ad probabilitatem eventus aestimandam destinata est, ita ut eventus finalis in spatio 0 ad 1 sit. In hoc articulo, formulam regressionis logisticae, significationem cuiusque componentis, et quomodo eam interpretari, tractabimus.

Cur Regressio Logistica Necessaria Est?

Si regressione lineari utimur ad probabilitates praedicendas, exemplar valores infra 0 vel supra 1 producere potest, quod probabilitati manifeste absurdum est. Regressio logistica hanc difficultatem tractat utens functione non lineari quae exitum calculatum (qui quilibet valor esse potest) ad valorem probabilitatis inter 0 et 1 transfert. Functio frequentissime adhibita est functio logistica vel sigmoidea.

Exempli gratia, ponamus nos velle praedicere utrum cliens discedat secundum aetatem, longitudinem subscriptionis, et frequentiam usus. Eventus praedictus duas tantum possibilitates habet: discessum (1) vel nullum discessum (0). Regressio logistica huic generi situationis bene apta est.

Formula Fundamentalis Regressionis Logisticae

Essentia regressionis logisticae est simulare probabilitatem ∫(p) ut ∫(Y = 1) (eventum occurrat), dato valore variabilis praedictoris ∫(X).

Modela regressionis logisticae plerumque duabus formis magni momenti scribuntur:

1) Forma Probabilitatis (Sigmoidea)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

apud

\[
z = β₀ + β₁ X₁ + β₂ X₂ + ∫₀ + β₂ Xₚ
\]

Information:
– \(p\) est probabilitas eventus (e.g.: churn = 1).
– \(e \) est numerus Euleri (circiter 2,71828).
– \(z \) est combinatio linearis praedictorum.
– \( \beta_0 \) est intersectio aequae (constans).
– (β1, β2, ..., βk) sunt coefficientes regressionis.
– (X_1, X_2, ..., X_k) sunt variabiles independentes.

Functio sigmoidea efficit ut, quicumque valor \(z\), valor \(p\) inter 0 et 1 maneat.

2) Forma Logit (Log Odds)

Alia forma permagni momenti est forma logit, quae est logarithmus probabilitatum:

\[
`logit(p)` = ln(p)(1-p) = β₀ + β₁ X₁ + β₂ X₂ + ... + βₖ Xₖ
\]

Information:
– \( \frac{p}{1-p} \) casus (fortuitas relativa) appellatur.
– \( \ln \) est logarithmus naturalis.

Forma logit explicat regressionem logisticam re vera logarithmicam probabilitatum ut functionem linearem praedictorum repraesentare. Hoc interpretationem coefficientium clariorem reddit, praesertim in contextu proportionum probabilitatum.

Intellegendo Probabilitates et Rationes Probabilitatis

Ut formulam regressionis logisticae vere intellegamus, inter probabilitatem et casus distinguere debemus.

– Probabilitas (p) : casus eventus occurrendi (0 ad 1).
– Probabilitas: comparatio probabilitatis alicuius rei evenientis cum non evenienti:

\[
`odds` = `p` (vel `1-p`)
\]

Exemplum: si (p = 0, 8), tum:

\[
`proportio` = `0, 8}{0, 2}` = 4
\]

Hoc significat eventum quater probabilius esse ut eveniat quam non.

In regressione logistica, coefficiens β saepe per rationem probabilitatis interpretatur:

\[
`AUT` = e^beta
\]

– Si β > 0, tum e β > 1: praedictor probabilitatem eventus auget.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Commentarium relinquere