Формула логистичке регресије
Логистичка регресија је једна од најпопуларнијих метода у статистици и науци о подацима за моделирање односа између више независних варијабли (предиктора) и категоријалне зависне варијабле, посебно бинарне (нпр. да/не, успех/неуспех, болест/здравље). За разлику од линеарне регресије, која производи континуиране вредности, логистичка регресија је осмишљена да процени вероватноћу догађаја, тако да је коначни резултат у опсегу од 0 до 1. У овом чланку ћемо размотрити формулу логистичке регресије, значење сваке компоненте и како је тумачити.
Зашто је потребна логистичка регресија?
Ако користимо линеарну регресију за предвиђање вероватноћа, модел може произвести вредности испод 0 или изнад 1, што је очигледно неразумно за вероватноћу. Логистичка регресија решава овај проблем коришћењем нелинеарне функције која пресликава израчунати резултат (који може бити било која вредност) на вредност вероватноће између 0 и 1. Најчешће коришћена функција је логистичка или сигмоидна функција.
На пример, претпоставимо да желимо да предвидимо да ли ће купац одустати на основу својих година, дужине претплате и учесталости коришћења. Предвиђени исход има само две могућности: одустајање (1) или без одустајања (0). Логистичка регресија је веома погодна за ову врсту ситуације.
Основна формула за логистичку регресију
Суштина логистичке регресије је моделирање вероватноће \(p \) да \(Y = 1 \) (догађај се деси), на основу вредности предикторске променљиве \(X \).
Модели логистичке регресије се обично пишу у два важна облика:
1) Облик вероватноће (сигмоид)
\[
p = P(Y=1 ∈ X) = ∈ {1}{1 + e^{-z}}
\]
со
\[
z = β0 + β1 X1 + β2 X2 + β2 + βk Xk
\]
Информације:
– \( p \) је вероватноћа догађаја (нпр.: одлив = 1).
– \( e \) је Ојлеров број (приближно 2,71828).
– \( z \) је линеарна комбинација предиктора.
– \( \beta_0 \) је пресек са тачком (константа).
– \( \beta_1, \beta_2, \ldots, \beta_k \) су коефицијенти регресије.
– \(X_1, X_2, \ldots, X_k \) су независне променљиве.
Сигмоидна функција осигурава да без обзира на вредност \(z \), вредност \(p \) остаје између 0 и 1.
2) Логит облик (логаритам квота)
Још један веома важан облик је логит облик, који је логаритам шанси:
\[
логит(p) = √(p1-p) = β0 + β1 X1 + β2 X2 + ∫___ + β__k X_k
\]
Информације:
– \( \frac{p}{1-p} \) се назива шанса (релативна шанса).
– \( \ln \) је природни логаритам.
Логит облик објашњава да логистичка регресија заправо моделира логаритамске шансе као линеарну функцију предиктора. Ово чини тумачење коефицијената јаснијим, посебно у контексту односа шанси.
Разумевање шанси и односа шанси
Да бисмо заиста разумели формулу логистичке регресије, морамо разликовати вероватноћу и шансе.
– Вероватноћа (p): шанса да се догађај догоди (од 0 до 1).
– Шансе: поређење вероватноће да се нешто деси са вероватноћом да се нешто не деси:
\[
\text{квота} = \frac{p}{1-p}
\]
Пример: ако је \( p = 0{,}8 \), онда:
\[
\text{квота} = \frac{0{,}8}{0{,}2} = 4
\]
То значи да је 4 пута већа вероватноћа да ће се догађај догодити него да се неће догодити.
У логистичкој регресији, коефицијент \( \бета \) се често тумачи кроз однос шанси:
\[
\text{ИЛИ} = e^{\бета}
\]
– Ако је \( \beta > 0 \), онда \( e^{\beta} > 1 \): предиктор повећава вероватноћу догађаја.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.