Pormula ng logistic regression

Pormula ng Logistikong Regresyon

Ang logistic regression ay isa sa mga pinakasikat na pamamaraan sa estadistika at agham ng datos para sa pagmomodelo ng ugnayan sa pagitan ng ilang mga independent variable (mga predictor) at isang categorical dependent variable, lalo na ang binary (hal., oo/hindi, tagumpay/pagkabigo, may sakit/malusog). Hindi tulad ng linear regression, na nagbubunga ng mga continuous value, ang logistic regression ay idinisenyo upang tantyahin ang probabilidad ng isang kaganapan, kaya ang pangwakas na resulta ay nasa hanay na 0 hanggang 1. Sa artikulong ito, tatalakayin natin ang logistic regression formula, ang kahulugan ng bawat component, at kung paano ito bibigyang-kahulugan.

Bakit Kinakailangan ang Logistic Regression?

Kung gagamit tayo ng linear regression upang mahulaan ang mga probabilidad, ang modelo ay maaaring makagawa ng mga halagang mas mababa sa 0 o mas mataas sa 1, na malinaw na hindi makatwiran para sa probabilidad. Tinutugunan ng logistic regression ang problemang ito sa pamamagitan ng paggamit ng isang nonlinear function na nagmamapa sa kinakalkulang resulta (na maaaring maging anumang halaga) sa isang halaga ng probabilidad sa pagitan ng 0 at 1. Ang pinakakaraniwang ginagamit na function ay ang logistic o sigmoid function.

Halimbawa, ipagpalagay na gusto nating hulaan kung ang isang customer ay mag-churn batay sa kanilang edad, tagal ng subscription, at dalas ng paggamit. Ang hinulaang resulta ay may dalawang posibilidad lamang: churn (1) o walang churn (0). Ang logistic regression ay angkop para sa ganitong uri ng sitwasyon.

Pangunahing Pormula para sa Logistic Regression

Ang esensya ng logistic regression ay ang pagmomodelo ng probabilidad \( p \) na \( Y = 1 \) (maganap ang kaganapan), kung isasaalang-alang ang halaga ng predictor variable \( X \).

Ang mga modelo ng logistic regression ay karaniwang isinusulat sa dalawang mahahalagang anyo:

1) Porma ng Probabilidad (Sigmoid)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

dengan

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Impormasyon:
– Ang \( p \) ay ang probabilidad ng pangyayari (hal.: churn = 1).
– Ang \( e \) ay ang numero ni Euler (humigit-kumulang 2,71828).
– Ang \( z \) ay isang linear na kombinasyon ng mga predictor.
– Ang \( \beta_0 \) ay ang intercept (constant).
– Ang \( \beta_1, \beta_2, \ldots, \beta_k \) ay ang mga koepisyente ng regresyon.
– Ang \( X_1, X_2, \ldots, X_k \) ay mga malayang baryabol.

BASAHIN  Ang kahalagahan ng estadistika sa ugnayang internasyonal

Tinitiyak ng sigmoid function na anuman ang halaga ng \( z \), ang halaga ng \( p \) ay nananatili sa pagitan ng 0 at 1.

2) Logit Form (Log Odds)

Ang isa pang napakahalagang anyo ay ang anyong logit, na siyang logarithm ng mga logro:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Impormasyon:
– Ang \( \frac{p}{1-p} \) ay tinatawag na odds (relative chance).
– Ang \( \ln \) ay ang natural na logaritmo.

Ipinapaliwanag ng anyong logit na ang logistic regression ay aktwal na minomodelo ang log odds bilang isang linear function ng mga predictor. Ginagawa nitong mas malinaw ang interpretasyon ng mga coefficient, lalo na sa konteksto ng mga odds ratio.

Pag-unawa sa mga Logro at Ratio ng Logro

Upang tunay na maunawaan ang pormula ng logistic regression, kailangan nating makilala ang pagkakaiba ng probabilidad at odds.

– Probabilidad \( p \): ang pagkakataon na maganap ang isang pangyayari (0 hanggang 1).
– Mga Logro: paghahambing ng probabilidad ng isang bagay na mangyari sa hindi mangyayari:

\[
\text{odds} = \frac{p}{1-p}
\]

Halimbawa: kung \( p = 0{,}8 \), kung gayon:

\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]

Nangangahulugan ito na ang kaganapan ay 4 na beses na mas malamang na mangyari kaysa sa hindi.

Sa logistic regression, ang coefficient \( \beta \) ay kadalasang binibigyang-kahulugan sa pamamagitan ng odds ratio:

\[
\text{OR} = e^{\beta}
\]

– Kung \( \beta > 0 \), kung gayon \( e^{\beta} > 1 \): pinapataas ng predictor ang tsansa ng kaganapan.
– Kung \( \beta < 0 \), kung gayon \( e^{\beta} < 1 \): binabawasan ng predictor ang posibilidad ng kaganapan. - Kung \( \beta = 0 \), kung gayon \( e^{\beta} = 1 \): walang epekto sa mga posibilidad. Halimbawa, kung \( \beta_1 = 0{,}7 \), kung gayon: \[ e^{0{,}7} \approx 2{,}01 \] Nangangahulugan ito na ang bawat 1 unit na pagtaas sa \( X_1 \) ay magpaparami ng mga posibilidad ng kaganapan ng humigit-kumulang 2,01 beses (kung ipagpapalagay na ang iba pang mga baryabol ay mananatiling pare-pareho). Halimbawa ng isang Simple Logistic Regression Model Ipagpalagay na mayroon lamang tayong isang baryabol ng predictor \( X \), halimbawa ang bilang ng mga oras ng pag-aaral bawat linggo, upang mahulaan ang pagpasa sa isang pagsusulit (pumasa = 1, bumagsak = 0). Ang modelo:

BASAHIN  Ang t-test sa mga istatistikang inferential
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] Kung ang tinantyang resulta ay: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Kung gayon: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Kung \( X = 6 \) oras ng pag-aaral: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasyon: sa 6 na oras ng pag-aaral bawat linggo, ang probabilidad ay pumasa na may iskor na humigit-kumulang 69%. Pagtatantya ng Koepisyent: Bakit Hindi ang Paraang Least Squares? Sa linear regression, ang mga koepisyent ay kadalasang kinakalkula gamit ang paraan ng least squares. Gayunpaman, sa logistic regression, ang ugnayan sa pagitan ng mga predictor at probabilidad ay nonlinear, kaya ang pamamaraan ng least squares ay hindi perpekto. Karaniwang ginagamit ng logistic regression ang Maximum Likelihood Estimation (MLE) upang mahanap ang halaga ng koepisyent \( \beta \) na nagpapakinabang sa posibilidad ng naobserbahang datos. Sa buod, ang posibilidad para sa mga binary na obserbasyon \( y_i \in \{0,1\} \) at mga hula \( p_i \) ay: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Pagkatapos ay madalas itong kino-convert sa isang log-likelihood upang mas madaling kalkulahin: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Ang halaga ng \( \beta \) ay pinipili upang ma-maximize \( \ell(\beta) \). Ang mga numerical na pamamaraan tulad ng Newton-Raphson o gradient descent ay kadalasang ginagamit ng statistical software. Mga Bentahe at Limitasyon ng Logistic Regression Mga Bentahe 1. Ang mga resulta ay nasa anyo ng mga probabilidad kaya madali itong isalin sa mga desisyon. 2. Malinaw ang interpretasyon ng mga koepisyente sa pamamagitan ng odds ratio. 3. Angkop para sa mga problema sa binary classification at maaaring palawigin sa multinomial/ordinal. Mga Limitasyon 1. Ipinapalagay ang isang linear na relasyon sa pagitan ng mga predictor at log odds, hindi direkta sa mga probabilidad. 2. Maaaring maging problematiko kung mayroong multicollinearity o lubos na hindi balanseng data. 3. Para sa mga napakakumplikadong pattern ng relasyon, maaaring mas mahusay ang iba pang mga non-linear na pamamaraan (hal., random forest o neural network).
BASAHIN  Ano ang mga istatistikang multivariate?
Konklusyon Ang pormula ng logistic regression ay mahalagang pinagsasama ang isang linear na kumbinasyon ng mga predictor variable na may isang sigmoid function upang makabuo ng mga probabilidad. Ang pinakakaraniwang anyo ay: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] o sa anyong logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Sa pamamagitan ng pag-unawa sa dalawang anyong ito ng pormula, makakabuo tayo ng mga predictive model para sa iba't ibang problema sa binary classification habang binibigyang-kahulugan ang impluwensya ng mga variable sa pamamagitan ng odds ratio \( e^{\beta} \). Ang logistic regression ay nananatiling isang mahalagang pundasyon sa pagsusuri ng datos dahil ito ay simple, makapangyarihan, at interpretative—at kadalasan ay ang unang hakbang bago subukan ang mas kumplikadong mga modelo. Kung gusto mo, puwede akong magdagdag ng halimbawa ng kalkulasyon gamit ang maliliit na datos (talahanayan), o isang halimbawa ng implementasyon ng logistic regression sa Python/R kasama ang interpretasyon ng output.

Mag-iwan ng komento