Formulo de loĝistika regreso

Formulo de loĝistika regreso

Loĝistika regreso estas unu el la plej popularaj metodoj en statistiko kaj datumscienco por modeligi la rilaton inter kelkaj sendependaj variabloj (prognoziloj) kaj kategoria dependa variablo, precipe duuma (ekz., jes/ne, sukceso/malsukceso, malsana/sanita). Male al lineara regreso, kiu produktas kontinuajn valorojn, loĝistika regreso estas desegnita por taksi la probablecon de evento, do la fina rezulto estas en la intervalo de 0 ĝis 1. En ĉi tiu artikolo, ni diskutos la formulon de loĝistika regreso, la signifon de ĉiu komponanto, kaj kiel interpreti ĝin.

Kial loĝistika regreso estas necesa?

Se ni uzas linearan regreson por antaŭdiri probablecojn, la modelo povas produkti valorojn sub 0 aŭ super 1, kio estas klare malsaĝa por probableco. Loĝistika regreso solvas ĉi tiun problemon per uzado de nelineara funkcio, kiu mapas la kalkulitan rezulton (kiu povas esti ajna valoro) al probableca valoro inter 0 kaj 1. La plej ofte uzata funkcio estas la loĝistika aŭ sigmoida funkcio.

Ekzemple, supozu, ke ni volas antaŭdiri ĉu kliento forlasos klientojn surbaze de ilia aĝo, daŭro de abono kaj ofteco de uzo. La antaŭdirita rezulto havas nur du eblecojn: forlaso (1) aŭ neniu forlaso (0). Loĝistika regreso bone taŭgas por ĉi tiu tipo de situacio.

Baza Formulo por Loĝistika Regreso

La esenco de loĝistika regreso estas modeli la probablecon ∫(p) ke ∫(Y = 1) (la evento okazas), donita la valoron de la prognoza variablo ∫(X).

Loĝistikaj regresmodeloj estas kutime skribitaj en du gravaj formoj:

1) Probabloformo (Sigmoida)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

dengan

\[
z = β₀ + β₁ X₁ + β₂ X₂ + β₁ + β₂k Xₚ
\]

Informoj:
– \(p \) estas la probableco de la evento (ekz.: klientŝanĝo = 1).
– \(e \) estas la nombro de Euler (proksimume 2,71828).
– \(z \) estas lineara kombinaĵo de prognoziloj.
– \( \beta_0 \) estas la intersekco (konstanto).
– \( \beta_1, \beta_2, \ldots, \beta_k \) estas la regresaj koeficientoj.
– \(X_1, X_2, ..., X_k \) estas sendependaj variabloj.

La sigmoida funkcio certigas, ke kia ajn estas la valoro de ∫(z)∫, la valoro de ∫(p)∫ restas inter 0 kaj 1.

2) Logit-Formularo (Log-Probablecoj)

Alia tre grava formo estas la logit-formo, kiu estas la logaritmo de la probableco:

\[
\tekst{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Informoj:
– \( \frac{p}{1-p} \) nomiĝas probableco (relativa ŝanco).
– \( \ln \) estas la natura logaritmo.

La logita formo klarigas, ke loĝistika regreso fakte modeligas la logaritmajn probablecojn kiel linearan funkcion de la prognoziloj. Tio pli klare interpretas la koeficientojn, precipe en la kunteksto de probablecproporcioj.

Kompreni Probablecojn kaj Probablecajn Proporciojn

Por vere kompreni la formulon de loĝistika regreso, ni devas distingi inter probablo kaj probableco.

– Probablo \(p \): la ŝanco ke okazaĵo okazos (0 ĝis 1).
– Probableco: komparo de la probableco, ke io okazos, kun la probableco, ke io ne okazos:

\[
\tekst{probableco} = \frac{p}{1-p}
\]

Ekzemplo: se \(p = 0{,}8 \), tiam:

\[
\tekst{probableco} = \frac{0{,}8}{0{,}2} = 4
\]

Tio signifas, ke la okazaĵo estas 4 fojojn pli verŝajne okazonta ol ne.

En loĝistika regreso, la koeficiento β ofte estas interpretata per la probablecproporcio:

\[
\tekst{AŬ} = e^{\beta}
\]

– Se β > 0, tiam β > 1: la prognozilo pliigas la probablecon de la evento.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Lasi komenton