Pormula ng Logistikong Regresyon
Ang logistic regression ay isa sa mga pinakasikat na pamamaraan sa estadistika at agham ng datos para sa pagmomodelo ng ugnayan sa pagitan ng ilang mga independent variable (mga predictor) at isang categorical dependent variable, lalo na ang binary (hal., oo/hindi, tagumpay/pagkabigo, may sakit/malusog). Hindi tulad ng linear regression, na nagbubunga ng mga continuous value, ang logistic regression ay idinisenyo upang tantyahin ang probabilidad ng isang kaganapan, kaya ang pangwakas na resulta ay nasa hanay na 0 hanggang 1. Sa artikulong ito, tatalakayin natin ang logistic regression formula, ang kahulugan ng bawat component, at kung paano ito bibigyang-kahulugan.
Bakit Kinakailangan ang Logistic Regression?
Kung gagamit tayo ng linear regression upang mahulaan ang mga probabilidad, ang modelo ay maaaring makagawa ng mga halagang mas mababa sa 0 o mas mataas sa 1, na malinaw na hindi makatwiran para sa probabilidad. Tinutugunan ng logistic regression ang problemang ito sa pamamagitan ng paggamit ng isang nonlinear function na nagmamapa sa kinakalkulang resulta (na maaaring maging anumang halaga) sa isang halaga ng probabilidad sa pagitan ng 0 at 1. Ang pinakakaraniwang ginagamit na function ay ang logistic o sigmoid function.
Halimbawa, ipagpalagay na gusto nating hulaan kung ang isang customer ay mag-churn batay sa kanilang edad, tagal ng subscription, at dalas ng paggamit. Ang hinulaang resulta ay may dalawang posibilidad lamang: churn (1) o walang churn (0). Ang logistic regression ay angkop para sa ganitong uri ng sitwasyon.
Pangunahing Pormula para sa Logistic Regression
Ang esensya ng logistic regression ay ang pagmomodelo ng probabilidad \( p \) na \( Y = 1 \) (maganap ang kaganapan), kung isasaalang-alang ang halaga ng predictor variable \( X \).
Ang mga modelo ng logistic regression ay karaniwang isinusulat sa dalawang mahahalagang anyo:
1) Porma ng Probabilidad (Sigmoid)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Impormasyon:
– Ang \( p \) ay ang probabilidad ng pangyayari (hal.: churn = 1).
– Ang \( e \) ay ang numero ni Euler (humigit-kumulang 2,71828).
– Ang \( z \) ay isang linear na kombinasyon ng mga predictor.
– Ang \( \beta_0 \) ay ang intercept (constant).
– Ang \( \beta_1, \beta_2, \ldots, \beta_k \) ay ang mga koepisyente ng regresyon.
– Ang \( X_1, X_2, \ldots, X_k \) ay mga malayang baryabol.
Tinitiyak ng sigmoid function na anuman ang halaga ng \( z \), ang halaga ng \( p \) ay nananatili sa pagitan ng 0 at 1.
2) Logit Form (Log Odds)
Ang isa pang napakahalagang anyo ay ang anyong logit, na siyang logarithm ng mga logro:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Impormasyon:
– Ang \( \frac{p}{1-p} \) ay tinatawag na odds (relative chance).
– Ang \( \ln \) ay ang natural na logaritmo.
Ipinapaliwanag ng anyong logit na ang logistic regression ay aktwal na minomodelo ang log odds bilang isang linear function ng mga predictor. Ginagawa nitong mas malinaw ang interpretasyon ng mga coefficient, lalo na sa konteksto ng mga odds ratio.
Pag-unawa sa mga Logro at Ratio ng Logro
Upang tunay na maunawaan ang pormula ng logistic regression, kailangan nating makilala ang pagkakaiba ng probabilidad at odds.
– Probabilidad \( p \): ang pagkakataon na maganap ang isang pangyayari (0 hanggang 1).
– Mga Logro: paghahambing ng probabilidad ng isang bagay na mangyari sa hindi mangyayari:
\[
\text{odds} = \frac{p}{1-p}
\]
Halimbawa: kung \( p = 0{,}8 \), kung gayon:
\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]
Nangangahulugan ito na ang kaganapan ay 4 na beses na mas malamang na mangyari kaysa sa hindi.
Sa logistic regression, ang coefficient \( \beta \) ay kadalasang binibigyang-kahulugan sa pamamagitan ng odds ratio:
\[
\text{OR} = e^{\beta}
\]
– Kung \( \beta > 0 \), kung gayon \( e^{\beta} > 1 \): pinapataas ng predictor ang tsansa ng kaganapan.
– Kung \( \beta < 0 \), kung gayon \( e^{\beta} < 1 \): binabawasan ng predictor ang posibilidad ng kaganapan. - Kung \( \beta = 0 \), kung gayon \( e^{\beta} = 1 \): walang epekto sa mga posibilidad. Halimbawa, kung \( \beta_1 = 0{,}7 \), kung gayon: \[ e^{0{,}7} \approx 2{,}01 \] Nangangahulugan ito na ang bawat 1 unit na pagtaas sa \( X_1 \) ay magpaparami ng mga posibilidad ng kaganapan ng humigit-kumulang 2,01 beses (kung ipagpapalagay na ang iba pang mga baryabol ay mananatiling pare-pareho). Halimbawa ng isang Simple Logistic Regression Model Ipagpalagay na mayroon lamang tayong isang baryabol ng predictor \( X \), halimbawa ang bilang ng mga oras ng pag-aaral bawat linggo, upang mahulaan ang pagpasa sa isang pagsusulit (pumasa = 1, bumagsak = 0). Ang modelo: