Формула за логистична регресия

Формула за логистична регресия

Логистичната регресия е един от най-популярните методи в статистиката и науката за данни за моделиране на връзката между редица независими променливи (предиктори) и категорична зависима променлива, особено бинарна (напр. да/не, успех/неуспех, болен/здрав). За разлика от линейната регресия, която дава непрекъснати стойности, логистичната регресия е предназначена да оцени вероятността за дадено събитие, така че крайният резултат е в диапазона от 0 до 1. В тази статия ще обсъдим формулата на логистичната регресия, значението на всеки компонент и как да го интерпретираме.

Защо е необходима логистична регресия?

Ако използваме линейна регресия за прогнозиране на вероятности, моделът може да генерира стойности под 0 или над 1, което очевидно е неразумно за вероятност. Логистичната регресия решава този проблем, като използва нелинейна функция, която съпоставя изчисления резултат (който може да бъде всяка стойност) със стойност на вероятността между 0 и 1. Най-често използваната функция е логистичната или сигмоидната функция.

Например, да предположим, че искаме да предвидим дали даден клиент ще се откаже от услугата въз основа на възрастта, продължителността на абонамента и честотата на използване. Прогнозираният резултат има само две възможности: отлив (1) или липса на отлив (0). Логистичната регресия е подходяща за този тип ситуации.

Основна формула за логистична регресия

Същността на логистичната регресия е да моделира вероятността (p) (събитието да се случи) (Y = 1), при дадена стойност на предсказващата променлива (X).

Моделите на логистичната регресия обикновено се записват в две важни форми:

1) Вероятностна форма (сигмоидна)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

с

\[
z = β0 + β1 X1 + β2 X2 + cdots + βk Xk
\]

Информация:
– \( p \) е вероятността на събитието (напр.: отлив = 1).
– \(e \) е числото на Ойлер (приблизително 2,71828).
– \(z \) е линейна комбинация от предиктори.
– \( \beta_0 \) е пресечната точка (константа).
– \( \beta_1, \beta_2, \ldots, \beta_k \) са коефициентите на регресия.
– \(X_1, X_2, \ldots, X_k \) са независими променливи.

Сигмоидната функция гарантира, че независимо от стойността на \(z\), стойността на \(p\) остава между 0 и 1.

2) Логит форма (логаритмични коефициенти)

Друга много важна форма е логит формата, която е логаритъм на коефициентите:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Информация:
– ( \frac{p}{1-p} \) се нарича коефициент (относителен шанс).
– \( \ln \) е натурален логаритъм.

Логиталната форма обяснява, че логистичната регресия всъщност моделира логаритмичните коефициенти като линейна функция на предикторите. Това прави интерпретацията на коефициентите по-ясна, особено в контекста на коефициентите на коефициентите.

Разбиране на коефициентите и коефициентите на коефициентите

За да разберем истински формулата на логистичната регресия, трябва да правим разлика между вероятност и коефициент.

– Вероятност (p): шансът дадено събитие да се случи (от 0 до 1).
– Вероятности: сравнение на вероятността нещо да се случи с това да не се случи:

\[
\text{коефициенти} = \frac{p}{1-p}
\]

Пример: ако \( p = 0{,}8 \), тогава:

\[
\text{коефициенти} = \frac{0{,}8}{0{,}2} = 4
\]

Това означава, че е 4 пъти по-вероятно събитието да се случи, отколкото да не се случи.

В логистичната регресия коефициентът \( \beta \) често се интерпретира чрез коефициента на вероятност:

\[
\text{ИЛИ} = e^{\beta}
\]

– Ако \beta > 0 \), тогава \(e^{\beta} > 1 \): предикторът увеличава вероятността за събитието.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Оставете коментар