Vzorec logistickej regresie
Logistická regresia je jednou z najpopulárnejších metód v štatistike a dátovej vede na modelovanie vzťahu medzi viacerými nezávislými premennými (prediktormi) a kategorickou závislou premennou, najmä binárnou (napr. áno/nie, úspech/neúspech, chorý/zdravý). Na rozdiel od lineárnej regresie, ktorá produkuje spojité hodnoty, je logistická regresia navrhnutá tak, aby odhadovala pravdepodobnosť udalosti, takže konečný výsledok je v rozsahu od 0 do 1. V tomto článku sa budeme venovať vzorcu logistickej regresie, významu každej zložky a jej interpretácii.
Prečo je potrebná logistická regresia?
Ak na predpovedanie pravdepodobností použijeme lineárnu regresiu, model môže produkovať hodnoty pod 0 alebo nad 1, čo je z hľadiska pravdepodobnosti jednoznačne neprimerané. Logistická regresia rieši tento problém použitím nelineárnej funkcie, ktorá mapuje vypočítaný výsledok (ktorým môže byť ľubovoľná hodnota) na hodnotu pravdepodobnosti medzi 0 a 1. Najčastejšie používanou funkciou je logistická alebo sigmoidná funkcia.
Predpokladajme napríklad, že chceme predpovedať, či zákazník odíde na základe jeho veku, dĺžky predplatného a frekvencie používania. Predpokladaný výsledok má iba dve možnosti: odchod (1) alebo žiadny odchod (0). Pre tento typ situácie je vhodná logistická regresia.
Základný vzorec pre logistickú regresiu
Podstatou logistickej regresie je modelovať pravdepodobnosť (p), že (Y = 1) (udalosť nastane), pri danej hodnote prediktorovej premennej (X).
Logistické regresné modely sa zvyčajne zapisujú v dvoch dôležitých formách:
1) Pravdepodobnostný tvar (sigmoid)
\[
p = P(Y=1 v strede X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Keterangan:
– \( p \) je pravdepodobnosť udalosti (napr.: churn = 1).
– \( e \) je Eulerovo číslo (približne 2,71828).
– \(z \) je lineárna kombinácia prediktorov.
– \( \beta_0 \) je priesečník (konštanta).
– \( \beta_1, \beta_2, \ldots, \beta_k \) sú regresné koeficienty.
– \(X_1, X_2, \ldots, X_k \) sú nezávislé premenné.
Sigmoidná funkcia zabezpečuje, že bez ohľadu na hodnotu \(z \) zostane hodnota \(p \) medzi 0 a 1.
2) Logitový tvar (logaritmické kurzy)
Ďalším veľmi dôležitým tvarom je logitový tvar, čo je logaritmus pravdepodobnosti:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Keterangan:
– \( \frac{p}{1-p} \) sa nazýva pravdepodobnosť (relatívna šanca).
– \( \ln \) je prirodzený logaritmus.
Logitová forma vysvetľuje, že logistická regresia v skutočnosti modeluje logaritmické šance ako lineárnu funkciu prediktorov. To uľahčuje interpretáciu koeficientov, najmä v kontexte pomerov šancí.
Pochopenie kurzov a pomerov kurzov
Aby sme skutočne pochopili vzorec logistickej regresie, musíme rozlišovať medzi pravdepodobnosťou a šancami.
– Pravdepodobnosť (p): pravdepodobnosť, že sa udalosť vyskytne (0 až 1).
– Pravdepodobnosť: porovnanie pravdepodobnosti, že sa niečo stane, s tým, že sa niečo nestane:
\[
\text{pravdepodobnosť} = \frac{p}{1-p}
\]
Príklad: ak \( p = 0{,}8 \), potom:
\[
\text{pravdepodobnosť} = \frac{0{,}8}{0{,}2} = 4
\]
To znamená, že je štyrikrát pravdepodobnejšie, že sa udalosť stane, ako nie.
V logistickej regresii sa koeficient (β) často interpretuje ako pomer šancí:
\[
\text{OR} = e^{\beta}
\]
– Ak \( \beta > 0 \), potom \( e^{\beta} > 1 \): prediktor zvyšuje pravdepodobnosť udalosti.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.