Formula regresi logistik

Formula Regresi Logistik

Regresi logistik merupakan salah satu kaedah paling popular dalam statistik dan sains data untuk memodelkan hubungan antara beberapa pembolehubah bebas (peramal) dan pembolehubah bersandar kategori, terutamanya binari (contohnya, ya/tidak, kejayaan/kegagalan, sakit/sihat). Tidak seperti regresi linear, yang menghasilkan nilai berterusan, regresi logistik direka bentuk untuk menganggarkan kebarangkalian sesuatu peristiwa, jadi hasil akhir adalah dalam julat 0 hingga 1. Dalam artikel ini, kita akan membincangkan formula regresi logistik, maksud setiap komponen, dan cara mentafsirkannya.

Mengapakah Regresi Logistik Diperlukan?

Jika kita menggunakan regresi linear untuk meramalkan kebarangkalian, model tersebut boleh menghasilkan nilai di bawah 0 atau di atas 1, yang jelas tidak munasabah untuk kebarangkalian. Regresi logistik menangani masalah ini dengan menggunakan fungsi tak linear yang memetakan hasil yang dikira (yang boleh menjadi sebarang nilai) kepada nilai kebarangkalian antara 0 dan 1. Fungsi yang paling biasa digunakan ialah fungsi logistik atau sigmoid.

Contohnya, katakan kita ingin meramalkan sama ada pelanggan akan berhenti menggunakan perkhidmatan berdasarkan umur, tempoh langganan dan kekerapan penggunaan mereka. Hasil yang diramalkan hanya mempunyai dua kemungkinan: berhenti menggunakan perkhidmatan (1) atau tiada berhenti menggunakan perkhidmatan (0). Regresi logistik sangat sesuai untuk situasi seperti ini.

Formula Asas untuk Regresi Logistik

Intipati regresi logistik adalah untuk memodelkan kebarangkalian \( p \) bahawa \( Y = 1 \) (peristiwa itu berlaku), memandangkan nilai pembolehubah peramal \( X \).

Model regresi logistik biasanya ditulis dalam dua bentuk penting:

1) Bentuk Kebarangkalian (Sigmoid)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

DENGAN

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Maklumat:
– \( p \) ialah kebarangkalian peristiwa tersebut (cth.: churn = 1).
– \( e \) ialah nombor Euler (lebih kurang 2,71828).
– \( z \) ialah gabungan linear peramal.
– \( \beta_0 \) ialah pintasan (pemalar).
– \( \beta_1, \beta_2, \ldots, \beta_k \) ialah pekali regresi.
– \( X_1, X_2, \ldots, X_k \) ialah pembolehubah bebas.

Fungsi sigmoid memastikan bahawa walau apa pun nilai \( z \), nilai \( p \) kekal antara 0 dan 1.

2) Borang Logit (Odds Log)

Satu lagi bentuk yang sangat penting ialah bentuk logit, iaitu logaritma bagi kemungkinan:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Maklumat:
– \( \frac{p}{1-p} \) dipanggil kemungkinan (peluang relatif).
– \( \ln \) ialah logaritma asli.

Bentuk logit menjelaskan bahawa regresi logistik sebenarnya memodelkan kemungkinan log sebagai fungsi linear peramal. Ini menjadikan tafsiran pekali lebih jelas, terutamanya dalam konteks nisbah kemungkinan.

Memahami Odds dan Nisbah Odds

Untuk benar-benar memahami formula regresi logistik, kita perlu membezakan antara kebarangkalian dan kemungkinan.

– Kebarangkalian \( p \): kemungkinan sesuatu peristiwa berlaku (0 hingga 1).
– Kemungkinan: perbandingan kebarangkalian sesuatu berlaku dengan tidak berlaku:

\[
\text{kemungkinan} = \frac{p}{1-p}
\]

Contoh: jika \( p = 0{,}8 \), maka:

\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]

Ini bermakna peristiwa itu adalah 4 kali lebih berkemungkinan berlaku daripada tidak.

Dalam regresi logistik, pekali \( \beta \) sering ditafsirkan melalui nisbah kemungkinan:

\[
\text{OR} = e^{\beta}
\]

– Jika \( \beta > 0 \), maka \( e^{\beta} > 1 \): peramal meningkatkan kemungkinan peristiwa tersebut.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Tinggalkan komen