Raikipohy regression lojika

Raikipohy momba ny regression logistika

Ny regression logistique dia iray amin'ireo fomba malaza indrindra amin'ny statistika sy ny siansa momba ny angon-drakitra ho an'ny modely ny fifandraisana misy eo amin'ny variables tsy miankina maromaro (predictors) sy ny variable dependent categorical, indrindra ny binary (ohatra, eny/tsia, fahombiazana/tsy fahombiazana, marary/salama). Tsy toy ny regression linear, izay mamokatra sanda mitohy, ny regression logistique dia natao hanombanana ny mety hisian'ny zava-mitranga iray, ka ny vokatra farany dia eo anelanelan'ny 0 sy 1. Ato amin'ity lahatsoratra ity, dia hiresaka momba ny raikipohy regression logistique, ny dikan'ny singa tsirairay, ary ny fomba fandikana azy isika.

Nahoana no ilaina ny Regression Logistika?

Raha mampiasa regression linear isika mba haminavina ny mety ho vokany, dia afaka mamokatra sanda latsaky ny 0 na mihoatra ny 1 ny modely, izay mazava ho azy fa tsy mitombina amin'ny mety ho vokany. Ny regression logistique dia mamaha ity olana ity amin'ny alàlan'ny fampiasana function nonlinear izay mampifandray ny valiny voakajy (izay mety ho sanda rehetra) amin'ny sanda mety ho vokany eo anelanelan'ny 0 sy 1. Ny function ampiasaina matetika indrindra dia ny function logistique na sigmoid.

Ohatra, aoka hatao hoe te-haminavina isika raha hiala amin'ny asany ny mpanjifa iray mifototra amin'ny taonany, ny faharetan'ny famandrihana ary ny fahamaroan'ny fampiasana azy. Ny vokatra vinavinaina dia manana safidy roa ihany: ny fialana amin'ny asa (1) na ny tsy fialana amin'ny asa (0). Ny regression logistique dia mety tsara amin'ity karazana toe-javatra ity.

Raikipohy fototra ho an'ny regression logistique

Ny votoatin'ny regression logistique dia ny famolavolana ny mety hitranga \( p \) fa \( Y = 1 \) (mihetsiketsika ny zava-mitranga), raha jerena ny sandan'ny variable predictor \( X \).

Matetika ny modely regression logistique dia soratana amin'ny endrika roa manan-danja:

1) Endriky ny mety hitranga (Sigmoid)

\[
p = P(Y=1 X) = 1 + e^{-z}}
\]

dengan

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Fampahafantarana:
– \( p \) dia ny mety hisian'ny tranga (oh: churn = 1).
– Ny \( e \) dia ny laharan'i Euler (eo amin'ny 2,71828 eo ho eo).
– Fitambaran'ny mpaminavina mitongilana ny \( z \).
– \( \beta_0 \) no intercept (tsy miova).
– Ny \( \beta_1, \beta_2, \ldots, \beta_k \) dia ireo koefisien'ny regression.
– \( X_1, X_2, \ldots, X_k \) dia fiovaovana tsy miankina.

HAMAKY  Ny maha-zava-dehibe ny antontan'isa eo amin'ny fifandraisana iraisam-pirenena

Ny fiasa sigmoid dia miantoka fa na inona na inona sandan'ny \( z \), ny sandan'ny \( p \) dia mijanona eo anelanelan'ny 0 sy 1.

2) Endrika Logit (Log Odds)

Endrika iray tena manan-danja koa ny endrika logit, izay logaritma-n'ny vintana:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Fampahafantarana:
– \( \frac{p}{1-p} \) dia antsoina hoe vintana (kisendrasendra mifandraika).
– \( \ln \) no logaritma voajanahary.

Ny endrika logit dia manazava fa ny regression logistic dia tena mamolavola ny log odds ho toy ny fiasa linear an'ny predictors. Izany dia mahatonga ny fandikana ny coefficients ho mazava kokoa, indrindra ao anatin'ny sehatry ny odds ratios.

Fahatakarana ny vintana sy ny tahan'ny vintana

Mba hahatakarana marina ny raikipohy regression logistique, mila manavaka ny mety ho azo sy ny vintana isika.

– Ny mety hitrangan'ny zava-mitranga (p): ny mety hisian'ny zava-mitranga iray (0 amin'ny 1).
– Vintana: fampitahana ny mety hisian'ny zavatra iray sy ny tsy hitrangany:

\[
\text{odds} = \frac{p}{1-p}
\]

Ohatra: raha \( p = 0{,}8 \), dia:

\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]

Midika izany fa in-4 heny noho ny tsy fisian'ny mety hitrangan'ilay tranga ilay izy.

Ao amin'ny regression logistique, ny coefficient \( \beta \) dia matetika adika amin'ny alalan'ny odds ratio:

\[
\text{OR} = e^{\beta}
\]

– Raha \( \beta > 0 \), dia \( e^{\beta} > 1 \): mampitombo ny mety hisian'ny tranga ny mpaminavina.
– Raha \( \beta < 0 \), dia \( e^{\beta} < 1 \): mampihena ny mety hitrangan'ny zava-mitranga ny mpamantatra. - Raha \( \beta = 0 \), dia \( e^{\beta} = 1 \): tsy misy fiantraikany amin'ny mety hitranga. Ohatra, raha \( \beta_1 = 0{,}7 \), dia: \[ e^{0{,}7} \approx 2{,}01 \] Midika izany fa ny fitomboana 1 singa amin'ny \( X_1 \) dia hampitombo ny mety hitrangan'ny zava-mitranga amin'ny in-2,01 eo ho eo (raha heverina fa mijanona ho tsy miova ny fiovaovan'ny hafa). Ohatra amin'ny Modely Regression Logistika Tsotra Aoka hatao hoe manana fiovaovan'ny mpamantatra iray ihany isika \( X \), ohatra ny isan'ny ora fianarana isan-kerinandro, mba haminavina ny fahombiazana amin'ny fanadinana (fahombiazana = 1, tsy fahombiazana = 0). Ny modely:

HAMAKY  Ny fitsapana-t amin'ny statistika inferensialy
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] Raha toa ka: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Dia: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Raha toa ka 6 ora fianarana \( X = 6 \) ora: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Fandikana: miaraka amin'ny 6 ora fianarana isan-kerinandro, ny mety ho fahombiazana dia manodidina ny 69%. Tombantomban'ny Koeffisialy: Nahoana no tsy ny fomba "Least Squares"? Amin'ny regression linear, ny koeffisialy dia matetika kajy amin'ny alàlan'ny fomba "Least Squares". Na izany aza, amin'ny regression logistic, ny fifandraisana misy eo amin'ny predictors sy ny probabilities dia tsy lineary, ka tsy mety ny fomba fiasa "Least Squares". Amin'ny ankapobeny, ny regression logistic dia mampiasa Maximum Likelihood Estimation (MLE) mba hahitana ny sandan'ny koeffisialy \( \beta \) izay mampitombo ny mety ho vitan'ny angon-drakitra voamarika. Raha fintinina, ny mety ho azo atao amin'ny fandinihana binary \( y_i \in \{0,1\} \) sy ny vinavina \( p_i \) dia: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Avy eo dia matetika avadika ho log-likelihood mba hanamorana ny kajy: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Ny sandan'ny \( \beta \) dia nofidiana mba hampitomboana \( \ell(\beta) \). Ny fomba kajy toy ny Newton-Raphson na ny gradient descent dia matetika ampiasain'ny rindrambaiko statistika. Tombony sy Famerana ny Regression Logistic Tombony 1. Ny valiny dia amin'ny endrika mety ka mora adika ho fanapahan-kevitra. 2. Mazava ny fandikana ny coefficients amin'ny alalan'ny odds ratio. 3. Azo ampiasaina amin'ny olana fanasokajiana binary ary azo itarina amin'ny multinomial/ordinal. Famerana 1. Mihevitra fifandraisana lineary eo amin'ny predictors sy ny log odds, fa tsy mivantana amin'ny probabilities. 2. Mety ho olana raha misy multicollinearity na data tsy mifandanja be. 3. Ho an'ny lamina fifandraisana tena sarotra, ny fomba tsy lineary hafa (ohatra, random forest na neural network) dia mety ho tsara kokoa.
HAMAKY  Inona no atao hoe statistika multivariate?
Fehiny Ny raikipohy regression logistique dia mampifangaro fitambarana lineary amin'ny variables predictor miaraka amin'ny function sigmoid mba hamokarana probabilities. Ny endrika mahazatra indrindra dia: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] na amin'ny endrika logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Amin'ny fahatakarana ireo endrika roa amin'ny raikipohy ireo, dia afaka manorina modely predictive ho an'ny olana fanasokajiana binary isan-karazany isika sady mandika ny fiantraikan'ny variables amin'ny alàlan'ny odds ratio \( e^{\beta} \). Ny regression logistique dia mbola fototra manan-danja amin'ny famakafakana data satria tsotra, mahery vaika ary mandika - ary matetika no dingana voalohany alohan'ny hanandramana modely sarotra kokoa. Raha tianao, afaka manampy ohatra kajy misy angon-drakitra kely (tabilao) aho, na ohatra fampiharana ny regression logistic amin'ny Python/R miaraka amin'ny fandikana ny vokatra.

Mametraha hevitra