د لوژستیکي ریګریشن فورمول
لوژستیک ریګریشن د احصایې او ډیټا ساینس کې یو له خورا مشهورو میتودونو څخه دی چې د یو شمیر خپلواک متغیرونو (وړاندوینې کونکو) او یو کټګوري پورې تړلي متغیر ترمنځ اړیکه ماډل کوي، په ځانګړي توګه د بائنری (د مثال په توګه، هو/نه، بریالیتوب/ناکامي، ناروغ/روغ). د خطي ریګریشن برعکس، کوم چې دوامداره ارزښتونه تولیدوي، لوژستیک ریګریشن د یوې پیښې احتمال اټکل کولو لپاره ډیزاین شوی، نو وروستۍ پایله یې د 0 څخه تر 1 پورې ده. پدې مقاله کې، موږ به د لوژستیک ریګریشن فورمول، د هرې برخې معنی، او د هغې د تفسیر کولو څرنګوالي په اړه بحث وکړو.
ولې لوژستیکي ریګریشن ته اړتیا ده؟
که موږ د احتمالاتو وړاندوینې لپاره خطي ریګریشن وکاروو، ماډل کولی شي د 0 څخه ښکته یا له 1 څخه پورته ارزښتونه تولید کړي، کوم چې په څرګنده توګه د احتمال لپاره غیر معقول دی. لوژستیک ریګریشن دا ستونزه د غیر خطي فنکشن په کارولو سره حل کوي چې محاسبه شوې پایله (کوم چې هر ارزښت کیدی شي) د 0 او 1 ترمنځ احتمالي ارزښت ته نقشه کوي. ترټولو عام کارول شوی فنکشن لوژستیک یا سیګموایډ فنکشن دی.
د مثال په توګه، فرض کړئ چې موږ غواړو وړاندوینه وکړو چې ایا یو پیرودونکی به د دوی د عمر، د ګډون موده، او د کارونې فریکونسۍ پراساس بدلون وکړي. وړاندوینه شوې پایله یوازې دوه امکانات لري: بدلون (1) یا هیڅ بدلون (0). د دې ډول وضعیت لپاره لوژستیکي ریګریشن ښه مناسب دی.
د لوژستیکي ریګریشن لپاره اساسي فورمول
د لوژستیکي ریګریشن جوهر دا دی چې د احتمال ماډل \( p \) چې \( Y = 1 \) (پیښه پیښیږي)، د وړاندوینې متغیر \( X \) ارزښت ته په پام سره.
د لوژستیکي ریګریشن ماډلونه معمولا په دوو مهمو بڼو لیکل کیږي:
۱) د احتمال فورمه (سیګمویډ)
\[
p = P(Y=1 \منځنی X) = \frac{1}{1 + e^{-z}}
\]
سره
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
معلومات:
– \( p \) د پیښې احتمال دی (د مثال په توګه: churn = 1).
– \( e \) د اولر شمېره ده (شاوخوا 2,71828).
– \( z \) د وړاندوینو یو خطي ترکیب دی.
– \( \beta_0 \) مداخله (ثابت) ده.
– \( \beta_1, \beta_2, \ldots, \beta_k \) د ریګریشن ضریبونه دي.
– \( X_1, X_2, \ldots, X_k \) خپلواک متغیرونه دي.
د سیګمویډ فعالیت ډاډ ورکوي چې د \( z \ ارزښت هر څه وي، د \( p \) ارزښت د 0 او 1 ترمنځ پاتې کیږي.
۲) د لوګ فورمه (د لاګ اوډز)
بله ډېره مهمه بڼه د لوګیټ فورمه ده، کوم چې د توپیرونو لوګاریتم دی:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
معلومات:
– \( \frac{p}{1-p} \) د احتمال (نسبي چانس) په نوم یادیږي.
– \( \ln \) طبیعي لوګاریتم دی.
د لوژستیک فورمه تشریح کوي چې لوژستیک ریګریشن په حقیقت کې د وړاندوینو د خطي فعالیت په توګه د لاګ اوډز ماډل کوي. دا د ضریبونو تفسیر روښانه کوي، په ځانګړې توګه د اوډز تناسب په شرایطو کې.
د توپیرونو او توپیرونو تناسب پوهیدل
د لوژستیکي ریګریشن فورمول په ریښتیا سره د پوهیدو لپاره، موږ باید د احتمال او توپیر ترمنځ توپیر وکړو.
– احتمال \( p \): د یوې پیښې د رامنځته کیدو چانس (0 څخه تر 1 پورې).
- ناندرۍ: د یو څه د پیښیدو او نه پیښیدو احتمال پرتله کول:
\[
\متن{مشکلات} = \frac{p}{1-p}
\]
مثال: که \( p = 0{,}8 \)، نو:
\[
\متن{مشکلات} = \frac{0{,}8}{0{,}2} = 4
\]
دا پدې مانا ده چې د پیښې د نه پیښیدو په پرتله څلور ځله ډیر احتمال لري.
په لوژستیکي ریګریشن کې، ضریب \( \beta \) ډیری وختونه د توپیر تناسب له لارې تشریح کیږي:
\[
\متن{OR} = e^{\بیټا}
\]
– که \( \beta > 0 \) وي، نو \( e^{\beta} > 1 \): وړاندوینه کوونکی د پیښې احتمال زیاتوي.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.