逻辑回归公式
逻辑回归是统计学和数据科学中最常用的方法之一,用于建模多个自变量(预测变量)与分类因变量(尤其是二元因变量,例如,是/否、成功/失败、生病/健康)之间的关系。与生成连续值的线性回归不同,逻辑回归旨在估计事件发生的概率,因此最终结果介于 0 到 1 之间。本文将讨论逻辑回归公式、各组成部分的含义以及如何解释结果。
为什么需要逻辑回归?
如果我们使用线性回归来预测概率,模型可能会产生小于 0 或大于 1 的值,这显然不符合概率的实际情况。逻辑回归通过使用非线性函数来解决这个问题,该函数将计算结果(可以是任何值)映射到 0 到 1 之间的概率值。最常用的函数是逻辑函数或 Sigmoid 函数。
例如,假设我们想根据客户的年龄、订阅时长和使用频率来预测其是否会流失。预测结果只有两种可能:流失 (1) 或不流失 (0)。逻辑回归非常适合这种情况。
逻辑回归的基本公式
逻辑回归的本质是,在给定预测变量 \( X \) 的值的情况下,对 \( Y = 1 \)(事件发生)的概率 \( p \) 进行建模。
逻辑回归模型通常以两种重要形式表示:
1)概率形式(S型曲线)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
凯特兰甘(Keterangan):
– \( p \) 是事件发生的概率(例如:流失 = 1)。
– \( e \) 是欧拉数(约等于 2,71828)。
– \( z \) 是预测变量的线性组合。
– \( \beta_0 \) 是截距(常数)。
– \( \beta_1, \beta_2, \ldots, \beta_k \) 是回归系数。
– \( X_1, X_2, \ldots, X_k \) 是独立变量。
sigmoid 函数保证无论 \( z \) 的值如何,\( p \) 的值都保持在 0 到 1 之间。
2) Logit 形式(对数比值)
另一种非常重要的形式是logit形式,即赔率的对数:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
凯特兰甘(Keterangan):
– \( \frac{p}{1-p} \) 称为赔率(相对机会)。
– \( \ln \) 是自然对数。
逻辑回归模型中的logit形式解释了逻辑回归实际上是将对数比值建模为预测变量的线性函数。这使得系数的解释更加清晰,尤其是在比值比的背景下。
理解赔率和赔率比
为了真正理解逻辑回归公式,我们需要区分概率和比值。
– 概率 \( p \): 事件发生的机会(0 到 1)。
赔率:某事发生的概率与某事不发生的概率的比较:
\[
赔率 = p/(1-p)
\]
例如:如果 \( p = 0{,}8 \),则:
\[
赔率 = 0.8 / 0.2 = 4
\]
这意味着该事件发生的可能性是不发生的4倍。
在逻辑回归中,系数 \( \beta \) 通常通过优势比来解释:
\[
\text{OR} = e^{\beta}
\]
– 如果 \( \beta > 0 \),则 \( e^{\beta} > 1 \):预测因子增加了事件发生的几率。
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.