Logistilise regressiooni valem

Logistilise regressiooni valem

Logistiline regressioon on statistikas ja andmeteaduses üks populaarsemaid meetodeid mitmete sõltumatute muutujate (ennustajate) ja kategoorilise sõltuva muutuja, eriti binaarsete (nt jah/ei, edu/ebaõnnestumine, haigus/tervis) vahelise seose modelleerimiseks. Erinevalt lineaarsest regressioonist, mis annab pidevaid väärtusi, on logistiline regressioon loodud sündmuse tõenäosuse hindamiseks, nii et lõpptulemus on vahemikus 0 kuni 1. Selles artiklis käsitleme logistilise regressiooni valemit, iga komponendi tähendust ja selle tõlgendamist.

Miks on logistilist regressiooni vaja?

Kui kasutame tõenäosuste ennustamiseks lineaarset regressiooni, võib mudel anda väärtusi alla 0 või üle 1, mis on tõenäosuse jaoks selgelt ebamõistlik. Logistiline regressioon lahendab selle probleemi mittelineaarse funktsiooni abil, mis kaardistab arvutatud tulemuse (mis võib olla mis tahes väärtus) tõenäosusväärtuseks vahemikus 0 kuni 1. Kõige sagedamini kasutatav funktsioon on logistiline ehk sigmoidfunktsioon.

Näiteks oletame, et tahame ennustada kliendi lahkumist tema vanuse, tellimuse kestuse ja kasutussageduse põhjal. Ennustatud tulemusel on ainult kaks võimalust: lahkumine (1) või lahkumise puudumine (0). Logistiline regressioon sobib seda tüüpi olukordade jaoks hästi.

Logistilise regressiooni põhivalem

Logistilise regressiooni olemus seisneb ennustava muutuja X väärtuse korral sündmuse toimumise tõenäosuse (p) modelleerimises (Y = 1).

Logistilise regressiooni mudelid on tavaliselt kirjutatud kahel olulisel kujul:

1) Tõenäosusvorm (sigmoidne)

\[
p = P(Y=1 ∫X) = ∫(1 + e^{-z})
\]

dengan

\[
z = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k
\]

Teave:
– \(p \) on sündmuse tõenäosus (nt: klientide voolavus = 1).
– \(e \) on Euleri arv (ligikaudu 2,71828).
– \(z \) on ennustajate lineaarne kombinatsioon.
– \( \beta_0 \) on lõikepunkt (konstant).
– \( \beta_1, \beta_2, \ldots, \beta_k \) on regressioonikordajad.
– \(X_1, X_2, \ldots, X_k \) on sõltumatud muutujad.

LUGEGE  Statistika tähtsus rahvusvahelistes suhetes

Sigmoidfunktsioon tagab, et olenemata \(z \) väärtusest jääb \(p \) väärtus vahemikku 0 ja 1.

2) Logit-vorm (logaritmilised koefitsiendid)

Teine väga oluline vorm on logitvorm, mis on koefitsientide logaritm:

\[
logit(p) = ∫ln₀(p1-p) = β0 + β1X_1 + β2X_2 + cdots + βkX_k
\]

Teave:
– \( \frac{p}{1-p} \) nimetatakse koefitsiendiks (suhteliseks juhuseks).
– \( \ln \) on naturaallogaritm.

Logitvorm selgitab, et logistiline regressioon modelleerib logaritmilisi koefitsiente tegelikult ennustajate lineaarse funktsioonina. See muudab koefitsientide tõlgendamise selgemaks, eriti koefitsientide suhtarvude kontekstis.

Koefitsientide ja koefitsientide suhtarvude mõistmine

Logistilise regressiooni valemi tõeliseks mõistmiseks peame eristama tõenäosust ja koefitsiente.

– Tõenäosus \(p \): sündmuse toimumise tõenäosus (0 kuni 1).
– Tõenäosus: millegi toimumise tõenäosuse ja mittejuhtumise tõenäosuse võrdlus:

\[
\text{odds} = \frac{p}{1-p}
\]

Näide: kui \(p = 0{,}8 \), siis:

\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]

See tähendab, et sündmuse toimumise tõenäosus on neli korda suurem kui mittetoimumise tõenäosus.

Logistilises regressioonis tõlgendatakse koefitsienti \( \beta \) sageli koefitsiendi kaudu:

\[
\text{OR} = e^{\beta}
\]

– Kui \( \beta > 0 \), siis \( e^{\beta} > 1 \): ennustaja suurendab sündmuse tõenäosust.
– Kui \( \beta < 0 \), siis \(e^{\beta} < 1 \): ennustaja vähendab sündmuse tõenäosust. - Kui \( \beta = 0 \), siis \(e^{\beta} = 1 \): tõenäosusele mõju ei ole. Näiteks, kui \( \beta_1 = 0{,}7 \), siis: \[ e^{0{,}7} \approx 2{,}01 \] See tähendab, et iga 1 ühiku suurenemine \(X_1 \)-s korrutab sündmuse tõenäosust ligikaudu 2,01 korda (eeldades, et muud muutujad jäävad konstantseks). Näide lihtsast logistilise regressiooni mudelist Oletame, et meil on ainult üks ennustaja muutuja \( X \), näiteks õppetundide arv nädalas, eksami sooritamise ennustamiseks (läbitud = 1, mitteläbitud = 0). Mudel:

LUGEGE  T-test järeldavas statistikas
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] Kui hinnanguline tulemus on: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Siis: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Kui \( X = 6 \) õppetundi: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \umb. 0{,}69 \] Tõlgendus: 6 õppetunni korral nädalas oli tõenäosus läbitud umbes 69% tulemusega. Koefitsiendi hindamine: miks mitte vähimruutude meetod? Lineaarses regressioonis arvutatakse koefitsiente sageli vähimruutude meetodil. Logistilises regressioonis on ennustajate ja tõenäosuste vaheline seos aga mittelineaarne, seega pole vähimruutude meetod ideaalne. Logistiline regressioon kasutab üldiselt maksimaalse tõenäosuse hindamist (MLE), et leida koefitsiendi väärtus \( \beta \), mis maksimeerib vaadeldavate andmete tõenäosust. Kokkuvõttes on binaarsete vaatluste \(y_i \in \{0,1\} \) ja ennustuste \(p_i \) tõenäosus: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Seejärel teisendatakse see sageli log-tõenäosuseks, et seda oleks lihtsam arvutada: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] \( \beta \) väärtus valitakse \( \ell(\beta \) \) maksimeerimiseks. Statistikatarkvara kasutab sageli numbrilisi meetodeid, nagu Newton-Raphsoni meetod või gradiendi laskumine. Logistilise regressiooni eelised ja piirangud Eelised 1. Tulemused on tõenäosuste kujul, seega on neid lihtne otsusteks teisendada. 2. Koefitsientide tõlgendamine on koefitsientide suhte kaudu selge. 3. Sobib binaarsete klassifitseerimisprobleemide jaoks ja seda saab laiendada multinomiaalsetele/ordinaalsetele. Piirangud 1. Eeldab lineaarset seost ennustajate ja logaritmiliste koefitsientide vahel, mitte otseselt tõenäosuste vahel. 2. Võib olla problemaatiline, kui esineb multikollineaarsus või väga tasakaalustamata andmed. 3. Väga keerukate seosemustrite puhul võivad muud mittelineaarsed meetodid (nt juhuslik mets või närvivõrk) olla paremad.
LUGEGE  Mis on mitmemõõtmeline statistika?
Kokkuvõte Logistilise regressiooni valem ühendab sisuliselt ennustavate muutujate lineaarse kombinatsiooni sigmoidfunktsiooniga, et saada tõenäosusi. Kõige levinum vorm on: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] või logit-kujul: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \]. Nende kahe valemi vormi mõistmise abil saame luua ennustavaid mudeleid erinevate binaarsete klassifitseerimisprobleemide jaoks, tõlgendades samal ajal muutujate mõju koefitsiendi \(e^{\beta} \) kaudu. Logistiline regressioon on andmeanalüüsi oluline alus, kuna see on lihtne, võimas ja tõlgendav – ning on sageli esimene samm enne keerukamate mudelite proovimist. Soovi korral võin lisada näidisarvutuse väikeste andmetega (tabel) või logistilise regressiooni näidisrakenduse Pythonis/R-is koos väljundi tõlgendamisega.

Jäta kommentaar