Logistisk regressionsformel
Logistisk regression är en av de mest populära metoderna inom statistik och datavetenskap för att modellera sambandet mellan ett antal oberoende variabler (prediktorer) och en kategorisk beroende variabel, särskilt binär (t.ex. ja/nej, framgång/misslyckande, sjuk/frisk). Till skillnad från linjär regression, som producerar kontinuerliga värden, är logistisk regression utformad för att uppskatta sannolikheten för en händelse, så att slutresultatet ligger i intervallet 0 till 1. I den här artikeln kommer vi att diskutera den logistiska regressionsformeln, betydelsen av varje komponent och hur man tolkar den.
Varför behövs logistisk regression?
Om vi använder linjär regression för att förutsäga sannolikheter kan modellen producera värden under 0 eller över 1, vilket är uppenbart orimligt för sannolikheten. Logistisk regression åtgärdar detta problem genom att använda en ickelinjär funktion som mappar det beräknade resultatet (som kan vara vilket värde som helst) till ett sannolikhetsvärde mellan 0 och 1. Den vanligaste funktionen är den logistiska eller sigmoide funktionen.
Anta till exempel att vi vill förutsäga om en kund kommer att lämna kund baserat på deras ålder, prenumerationslängd och användningsfrekvens. Det förutspådda resultatet har bara två möjligheter: kundbortfall (1) eller ingen kundbortfall (0). Logistisk regression är väl lämpad för denna typ av situation.
Grundläggande formel för logistisk regression
Kärnan i logistisk regression är att modellera sannolikheten \(p \) att \(Y = 1 \) (händelsen inträffar), givet värdet på prediktorvariabeln \(X \).
Logistiska regressionsmodeller skrivs vanligtvis i två viktiga former:
1) Sannolikhetsform (Sigmoid)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
med
\[
z = β₀ + β₁ X₁ + β₂ X₂ + β₀ + β₇ X₇
\]
Information:
– \(p \) är sannolikheten för händelsen (t.ex.: churn = 1).
– \(e \) är Eulers tal (ungefär 2,71828).
– \(z \) är en linjär kombination av prediktorer.
– \( \β_0 \) är skärningspunkten (konstanten).
– (β₁, β₂, ..., βk) är regressionskoefficienterna.
– \(X_1, X_2, \ldots, X_k \) är oberoende variabler.
Sigmoidfunktionen säkerställer att oavsett värdet på \(z \), så förblir värdet på \(p \) mellan 0 och 1.
2) Logit-formulär (Log Odds)
En annan mycket viktig form är logitformen, som är logaritmen för oddsen:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \β₀ + \β₁ X₁ + \β₂ X₂ + \cdots + \β₁ X₁
\]
Information:
– \( \frac{p}{1-p} \) kallas oddsen (relativ chans).
– \( \ln \) är den naturliga logaritmen.
Logitformen förklarar att logistisk regression faktiskt modellerar logaritmiska odds som en linjär funktion av prediktorerna. Detta gör tolkningen av koefficienterna tydligare, särskilt i samband med oddskvoter.
Förstå odds och oddskvoter
För att verkligen förstå den logistiska regressionsformeln måste vi skilja mellan sannolikhet och odds.
– Sannolikhet \(p \): chansen att en händelse inträffar (0 till 1).
– Odds: jämförelse av sannolikheten för att något händer med att det inte händer:
\[
\text{odds} = \frac{p}{1-p}
\]
Exempel: om \(p = 0,8 \), så:
\[
odds = 0,8/0,2 = 4
\]
Det betyder att det är fyra gånger mer sannolikt att händelsen inträffar än att den inte inträffar.
I logistisk regression tolkas koefficienten β ofta genom oddskvoten:
\[
ELLER = e^{\beta}
\]
– Om \( \β > 0 \), så ökar \(e^{\β} > 1 \): prediktorn oddsen för händelsen.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.