Логистик регрессийн томъёо

Логистик регрессийн томъёо

Логистик регресс нь хэд хэдэн бие даасан хувьсагч (урьдчилан таамаглагч) болон ангиллын хамааралтай хувьсагч, ялангуяа хоёртын (жишээ нь, тийм/үгүй, амжилт/бүтэлгүйтэл, өвчтэй/эрүүл) хоорондын хамаарлыг загварчлах статистик болон өгөгдлийн шинжлэх ухаанд хамгийн түгээмэл аргуудын нэг юм. Тасралтгүй утгыг үүсгэдэг шугаман регрессээс ялгаатай нь логистик регресс нь үйл явдлын магадлалыг тооцоолоход зориулагдсан тул эцсийн үр дүн нь 0-ээс 1 хүртэлх хүрээнд байна. Энэ нийтлэлд бид логистик регрессийн томъёо, бүрэлдэхүүн хэсэг бүрийн утга, түүнийг хэрхэн тайлбарлах талаар авч үзэх болно.

Логистик регресс яагаад хэрэгтэй вэ?

Хэрэв бид магадлалыг урьдчилан таамаглахын тулд шугаман регрессийг ашиглавал загвар нь 0-ээс доош эсвэл 1-ээс дээш утгыг гаргаж авах боломжтой бөгөөд энэ нь магадлалын хувьд илт үндэслэлгүй юм. Логистик регресс нь тооцоолсон үр дүнг (ямар ч утга байж болно) 0-ээс 1-ийн хоорондох магадлалын утгатай холбодог шугаман бус функцийг ашиглан энэ асуудлыг шийддэг. Хамгийн түгээмэл хэрэглэгддэг функц бол логистик эсвэл сигмоид функц юм.

Жишээлбэл, бид хэрэглэгчийн нас, захиалгын хугацаа, хэрэглээний давтамж дээр үндэслэн хэрэглэгчийн захиалга өөрчлөгдөх эсэхийг урьдчилан таамаглахыг хүсэж байна гэж бодъё. Урьдчилан таамагласан үр дүн нь зөвхөн хоёр боломжит хувилбартай: захиалга өөрчлөгдөх (1) эсвэл захиалга өөрчлөгдөхгүй (0). Логистик регресс нь энэ төрлийн нөхцөл байдалд тохиромжтой.

Логистик регрессийн үндсэн томъёо

Логистик регрессийн мөн чанар нь таамаглагч хувьсагчийн утга өгөгдсөн \(X\)-д \(Y = 1\) (үйл явдал тохиолдох) магадлалыг \(p\) загварчлах явдал юм.

Логистик регрессийн загваруудыг ихэвчлэн хоёр чухал хэлбэрээр бичдэг:

1) Магадлалын хэлбэр (Сигмоид)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

хамт

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Мэдээлэл:
– \( p \) нь үйл явдлын магадлал юм (жишээ нь: эргэлт = 1).
– \( e \) нь Эйлерийн тоо (ойролцоогоор 2,71828) юм.
– \( z \) нь таамаглагчдын шугаман хослол юм.
– \( \beta_0 \) нь огтлолцол (тогтмол) юм.
– \( \beta_1, \beta_2, \ldots, \beta_k \) нь регрессийн коэффициентууд юм.
– \( X_1, X_2, \ldots, X_k \) нь хамааралгүй хувьсагчууд юм.

Сигмоид функц нь \(z\)-ийн утга ямар ч байсан \(p\)-ийн утга 0 ба 1-ийн хооронд хэвээр байхыг баталгаажуулдаг.

2) Логит маягт (Логик магадлал)

Өөр нэг маш чухал хэлбэр бол логит хэлбэр бөгөөд энэ нь магадлалын логарифм юм:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Мэдээлэл:
– \( \frac{p}{1-p} \)-г магадлал (харьцангуй боломж) гэж нэрлэдэг.
– \( \ln \) нь натурал логарифм юм.

Логит хэлбэр нь логистик регресс нь логик магадлалыг үнэндээ таамаглагчдын шугаман функц болгон загварчилдаг болохыг тайлбарладаг. Энэ нь коэффициентуудыг, ялангуяа магадлалын харьцааны хүрээнд тайлбарлахад илүү тодорхой болгодог.

Магадлал ба магадлалын харьцааг ойлгох нь

Логистик регрессийн томъёог үнэхээр ойлгохын тулд бид магадлал ба магадлалыг ялгаж салгах хэрэгтэй.

– Магадлал \( p \): үйл явдал тохиолдох магадлал (0-ээс 1 хүртэл).
– Магадлал: ямар нэгэн зүйл тохиолдох магадлалыг тохиолдохгүй байх магадлалтай харьцуулсан харьцаа:

\[
\text{магадлал} = \frac{p}{1-p}
\]

Жишээ: хэрэв \( p = 0{,}8 \) бол:

\[
\text{магадлал} = \frac{0{,}8}{0{,}2} = 4
\]

Энэ нь уг үйл явдал тохиолдох магадлал нь тохиолдохгүй байснаас 4 дахин их гэсэн үг юм.

Логистик регрессийн үед \( \бета \) коэффициентийг ихэвчлэн магадлалын харьцаагаар тайлбарладаг:

\[
\text{OR} = e^{\beta}
\]

– Хэрэв \( \beta > 0 \) бол \( e^{\beta} > 1 \): таамаглагч нь үйл явдлын магадлалыг нэмэгдүүлдэг.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Сэтгэгдэл үлдээх