Fórmula de regressió logística

Fórmula de regressió logística

La regressió logística és un dels mètodes més populars en estadística i ciència de dades per modelar la relació entre diverses variables independents (predictors) i una variable dependent categòrica, especialment binària (per exemple, sí/no, èxit/fracàs, malalt/saludable). A diferència de la regressió lineal, que produeix valors continus, la regressió logística està dissenyada per estimar la probabilitat d'un esdeveniment, de manera que el resultat final es troba en el rang de 0 a 1. En aquest article, parlarem de la fórmula de la regressió logística, el significat de cada component i com interpretar-la.

Per què cal la regressió logística?

Si fem servir la regressió lineal per predir probabilitats, el model pot produir valors inferiors a 0 o superiors a 1, cosa que és clarament irraonable per a la probabilitat. La regressió logística aborda aquest problema mitjançant una funció no lineal que assigna el resultat calculat (que pot ser qualsevol valor) a un valor de probabilitat entre 0 i 1. La funció més utilitzada és la funció logística o sigmoide.

Per exemple, suposem que volem predir si un client abandonarà el servei en funció de la seva edat, la durada de la subscripció i la freqüència d'ús. El resultat previst només té dues possibilitats: abandonament (1) o cap abandonament (0). La regressió logística és adequada per a aquest tipus de situació.

Fórmula bàsica per a la regressió logística

L'essència de la regressió logística és modelar la probabilitat (p) que (Y = 1) (l'esdeveniment es produeixi), donat el valor de la variable predictora (X).

Els models de regressió logística s'escriuen normalment en dues formes importants:

1) Forma de probabilitat (sigmoide)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

dengan

\[
z = β0 + β1 X1 + β2 X2 + βk Xk
\]

Informació:
– \(p\) és la probabilitat de l'esdeveniment (per exemple: churn = 1).
– \(e \) és el nombre d'Euler (aproximadament 2,71828).
– \(z\) és una combinació lineal de predictors.
– \( \beta_0 \) és la intersecció (constant).
– \( \beta_1, \beta_2, \ldots, \beta_k \) són els coeficients de regressió.
– \(X_1, X_2, ..., X_k \) són variables independents.

La funció sigmoide garanteix que, independentment del valor de \(z\), el valor de \(p\) es mantingui entre 0 i 1.

2) Formulari Logit (Log Odds)

Una altra forma molt important és la forma logit, que és el logaritme de les probabilitats:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Informació:
– \( \frac{p}{1-p} \) s'anomena probabilitat (oportunitat relativa).
– \( \ln \) és el logaritme natural.

La forma logit explica que la regressió logística en realitat modela les probabilitats logarítmiques com una funció lineal dels predictors. Això fa que la interpretació dels coeficients sigui més clara, especialment en el context de les ràtios de probabilitats.

Comprensió de les probabilitats i les ràtios de probabilitats

Per entendre realment la fórmula de regressió logística, hem de distingir entre probabilitat i odds.

– Probabilitat \(p \): la possibilitat que es produeixi un esdeveniment (0 a 1).
– Probabilitats: comparació de la probabilitat que alguna cosa passi amb la que no passi:

\[
\text{probabilitats} = \frac{p}{1-p}
\]

Exemple: si \(p = 0{,}8 \), aleshores:

\[
\text{probabilitats} = \frac{0{,}8}{0{,}2} = 4
\]

Això significa que l'esdeveniment té 4 vegades més probabilitats que passi que no.

En la regressió logística, el coeficient β sovint s'interpreta mitjançant la raó de probabilitats:

\[
O = e^{\beta}
\]

– Si (β > 0), aleshores (e β > 1): el predictor augmenta les probabilitats de l'esdeveniment.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Deixa un comentari