Lojistik Regresyon Formülü
Lojistik regresyon, istatistik ve veri biliminde, özellikle ikili (örneğin, evet/hayır, başarı/başarısızlık, hasta/sağlıklı) kategorik bağımlı değişkenler olmak üzere, bir dizi bağımsız değişken (tahmin edici) ile aralarındaki ilişkiyi modellemek için en popüler yöntemlerden biridir. Sürekli değerler üreten doğrusal regresyonun aksine, lojistik regresyon bir olayın olasılığını tahmin etmek için tasarlanmıştır, bu nedenle nihai sonuç 0 ile 1 aralığındadır. Bu makalede, lojistik regresyon formülünü, her bir bileşenin anlamını ve nasıl yorumlanacağını ele alacağız.
Lojistik regresyona neden ihtiyaç duyulur?
Olasılıkları tahmin etmek için doğrusal regresyon kullanırsak, model 0'ın altında veya 1'in üzerinde değerler üretebilir ki bu olasılık için açıkça mantıksızdır. Lojistik regresyon, hesaplanan sonucu (herhangi bir değer olabilir) 0 ile 1 arasında bir olasılık değerine eşleyen doğrusal olmayan bir fonksiyon kullanarak bu sorunu ele alır. En yaygın kullanılan fonksiyon lojistik veya sigmoid fonksiyondur.
Örneğin, bir müşterinin yaşına, abonelik süresine ve kullanım sıklığına bağlı olarak aboneliğini iptal edip etmeyeceğini tahmin etmek istediğimizi varsayalım. Tahmin edilen sonuç yalnızca iki olasılığa sahiptir: aboneliği iptal etme (1) veya aboneliği iptal etmeme (0). Lojistik regresyon bu tür durumlar için oldukça uygundur.
Lojistik Regresyonun Temel Formülü
Lojistik regresyonun özü, tahmin değişkeni \( X \)'in değeri verildiğinde, \( Y = 1 \) (olayın gerçekleşmesi) olasılığını \( p \) modellemektir.
Lojistik regresyon modelleri genellikle iki önemli biçimde yazılır:
1) Olasılık Formu (Sigmoid)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Açıklamalar:
– \( p \) olayın olasılığıdır (örneğin: müşteri kaybı = 1).
– \( e \) Euler sayısıdır (yaklaşık 2,71828).
– \( z \) tahmin edicilerin doğrusal bir kombinasyonudur.
– \( \beta_0 \) kesişim noktasıdır (sabit).
– \( \beta_1, \beta_2, \ldots, \beta_k \) regresyon katsayılarıdır.
– \( X_1, X_2, \ldots, X_k \) bağımsız değişkenlerdir.
Sigmoid fonksiyonu, z'nin değeri ne olursa olsun, p'nin değerinin 0 ile 1 arasında kalmasını sağlar.
2) Logit Formu (Log Oranları)
Bir diğer çok önemli form ise, olasılıkların logaritması olan logit formudur:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Açıklamalar:
– \( \frac{p}{1-p} \) olasılık (göreceli şans) olarak adlandırılır.
– \( \ln \) doğal logaritmadır.
Logit formu, lojistik regresyonun aslında log olasılıklarını tahmin edicilerin doğrusal bir fonksiyonu olarak modellediğini açıklar. Bu, özellikle olasılık oranları bağlamında katsayıların yorumlanmasını daha net hale getirir.
Olasılıkları ve Olasılık Oranlarını Anlamak
Lojistik regresyon formülünü gerçekten anlamak için olasılık ve oranlar arasındaki farkı ayırt etmemiz gerekiyor.
– Olasılık \( p \): Bir olayın gerçekleşme şansı (0 ile 1 arası).
– Olasılık: Bir şeyin olma olasılığının, olmama olasılığıyla karşılaştırılması:
\[
olasılıklar = π/1-π
\]
Örnek: eğer \( p = 0{,}8 \), o zaman:
\[
olasılıklar = 0,8 / 0,2 = 4
\]
Bu, olayın gerçekleşme olasılığının gerçekleşmeme olasılığından 4 kat daha yüksek olduğu anlamına gelir.
Lojistik regresyonda, β katsayısı genellikle olasılık oranı üzerinden yorumlanır:
\[
VEYA = e^{\beta}
\]
– Eğer \( \beta > 0 \) ise, o zaman \( e^{\beta} > 1 \): tahmin edici, olayın gerçekleşme olasılığını artırır.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.