Logistisk regressionsformel

Logistisk regressionsformel

Logistisk regression er en af ​​de mest populære metoder inden for statistik og datalogi til modellering af forholdet mellem et antal uafhængige variabler (prædiktorer) og en kategorisk afhængig variabel, især binær (f.eks. ja/nej, succes/fiasko, syg/rask). I modsætning til lineær regression, som producerer kontinuerlige værdier, er logistisk regression designet til at estimere sandsynligheden for en begivenhed, så det endelige resultat ligger i intervallet 0 til 1. I denne artikel vil vi diskutere den logistiske regressionsformel, betydningen af ​​hver komponent, og hvordan man fortolker den.

Hvorfor er logistisk regression nødvendig?

Hvis vi bruger lineær regression til at forudsige sandsynligheder, kan modellen producere værdier under 0 eller over 1, hvilket er klart urimeligt for sandsynligheden. Logistisk regression løser dette problem ved at bruge en ikke-lineær funktion, der kortlægger det beregnede resultat (som kan være en hvilken som helst værdi) til en sandsynlighedsværdi mellem 0 og 1. Den mest almindeligt anvendte funktion er den logistiske eller sigmoide funktion.

Antag for eksempel, at vi ønsker at forudsige, om en kunde vil forlade kundeporteføljen baseret på deres alder, abonnementsvarighed og brugshyppighed. Det forudsagte resultat har kun to muligheder: churn (1) eller ingen churn (0). Logistisk regression er velegnet til denne type situation.

Grundlæggende formel for logistisk regression

Essensen af ​​logistisk regression er at modellere sandsynligheden \(p \) for at \(Y = 1 \) (hændelsen indtræffer), givet værdien af ​​prædiktorvariablen \(X \).

Logistiske regressionsmodeller skrives normalt i to vigtige former:

1) Sandsynlighedsform (Sigmoid)

\[
p = P(Y=1\mid X) = \frac{1}{1 + e^{-z}}
\]

med

\[
z = β₀ + β₁ X₁ + β₂ X₂ + β₇ X₇
\]

Keterangan:
– \(p \) er sandsynligheden for hændelsen (f.eks.: churn = 1).
– \(e \) er Eulers tal (omtrent 2,71828).
– \(z \) er en lineær kombination af prædiktorer.
– \( \β_0 \) er skæringspunktet (konstanten).
– (β₁, β₂, ..., βk) er regressionskoefficienterne.
– \(X_1, X_2, \ldots, X_k \) er uafhængige variable.

Sigmoidfunktionen sikrer, at uanset værdien af ​​\(z\), forbliver værdien af ​​\(p\) mellem 0 og 1.

2) Logit-formular (logaritmiske odds)

En anden meget vigtig form er logitformen, som er logaritmen af ​​oddsene:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \β₀ + \β₁ X₁ + \β₂ X₂ + \cdots + \β₁ X₁
\]

Keterangan:
– \( \frac{p}{1-p} \) kaldes oddsene (relativ chance).
– \( \ln \) er den naturlige logaritme.

Logit-formen forklarer, at logistisk regression faktisk modellerer logaritmiske odds som en lineær funktion af prædiktorerne. Dette gør fortolkningen af ​​koefficienterne tydeligere, især i sammenhæng med odds ratioer.

Forståelse af odds og oddsforhold

For virkelig at forstå den logistiske regressionsformel, er vi nødt til at skelne mellem sandsynlighed og odds.

– Sandsynlighed \(p \): chancen for, at en begivenhed indtræffer (0 til 1).
– Odds: sammenligning af sandsynligheden for, at noget sker, med sandsynligheden for, at noget ikke sker:

\[
\text{odds} = \frac{p}{1-p}
\]

Eksempel: hvis \(p = 0,8 \), så:

\[
\text{odds} = \frac{0,8}{0,2} = 4
\]

Det betyder, at der er fire gange større sandsynlighed for, at begivenheden indtræffer end for, at den ikke indtræffer.

I logistisk regression fortolkes koefficienten β ofte gennem odds ratioen:

\[
ELLER = e^{\beta}
\]

– Hvis \( \β > 0 \), så \( e^{\β} > 1 \): prædiktoren øger oddsene for begivenheden.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Tinggalkan kommentarer