Формула логистической регрессии
Логистическая регрессия — один из самых популярных методов в статистике и анализе данных для моделирования взаимосвязи между рядом независимых переменных (предикторов) и категориальной зависимой переменной, особенно бинарной (например, да/нет, успех/неудача, больной/здоровый). В отличие от линейной регрессии, которая выдает непрерывные значения, логистическая регрессия предназначена для оценки вероятности события, поэтому конечный результат находится в диапазоне от 0 до 1. В этой статье мы обсудим формулу логистической регрессии, значение каждого компонента и способы его интерпретации.
Зачем нужна логистическая регрессия?
Если мы используем линейную регрессию для прогнозирования вероятностей, модель может выдавать значения ниже 0 или выше 1, что явно неразумно для вероятности. Логистическая регрессия решает эту проблему, используя нелинейную функцию, которая сопоставляет вычисленный результат (который может быть любым значением) со значением вероятности от 0 до 1. Наиболее часто используемой функцией является логистическая или сигмоидная функция.
Например, предположим, мы хотим предсказать, откажется ли клиент от услуг, исходя из его возраста, продолжительности подписки и частоты использования. Предсказанный результат имеет только две возможности: отток (1) или отсутствие оттока (0). Логистическая регрессия хорошо подходит для подобных ситуаций.
Базовая формула для логистической регрессии
Суть логистической регрессии заключается в моделировании вероятности \( p \) того, что \( Y = 1 \) (событие происходит), при условии значения переменной-предиктора \( X \).
Модели логистической регрессии обычно представляются в двух важных формах:
1) Вероятностная форма (сигмоидная)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
с
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Примечания:
– \( p \) – это вероятность события (например: отток клиентов = 1).
– \( e \) – это число Эйлера (примерно 2,71828).
– \( z \) представляет собой линейную комбинацию предикторов.
– \( \beta_0 \) – это точка пересечения с осью Y (константа).
– \( \beta_1, \beta_2, \ldots, \beta_k \) – коэффициенты регрессии.
– \( X_1, X_2, \ldots, X_k \) являются независимыми переменными.
Сигмоидная функция гарантирует, что независимо от значения \( z \), значение \( p \) остается в пределах от 0 до 1.
2) Логит-форма (логарифм отношения шансов)
Ещё одна очень важная форма — это логит-форма, которая представляет собой логарифм отношения шансов:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Примечания:
– \( \frac{p}{1-p} \) называется шансом (относительной вероятностью).
– \( \ln \) — натуральный логарифм.
Логит-форма объясняет, что логистическая регрессия фактически моделирует логарифм отношения шансов как линейную функцию предикторов. Это делает интерпретацию коэффициентов более понятной, особенно в контексте отношения шансов.
Понимание шансов и коэффициентов шансов
Для того чтобы по-настоящему понять формулу логистической регрессии, необходимо различать вероятность и шансы.
– Вероятность (p): вероятность наступления события (от 0 до 1).
– Шансы: сравнение вероятности того, что событие произойдет, с вероятностью того, что оно не произойдет:
\[
\text{шансы} = \frac{p}{1-p}
\]
Пример: если \( p = 0{,}8 \), то:
\[
\text{шансы} = \frac{0{,}8}{0{,}2} = 4
\]
Это означает, что вероятность того, что событие произойдёт, в 4 раза выше, чем вероятность того, что оно не произойдёт.
В логистической регрессии коэффициент \( \beta \) часто интерпретируется через отношение шансов:
\[
ИЛИ = e^{\beta}
\]
– Если \( \beta > 0 \), то \( e^{\beta} > 1 \): предиктор увеличивает вероятность события.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.