Logistik regressiya formulasi

Logistik regressiya formulasi

Logistik regressiya statistika va ma'lumotlar fanida bir qator mustaqil o'zgaruvchilar (bashorat qiluvchilar) va kategorik bog'liq o'zgaruvchi, ayniqsa ikkilik (masalan, ha/yo'q, muvaffaqiyat/muvaffaqiyatsizlik, kasal/sog'lom) o'rtasidagi munosabatni modellashtirishning eng mashhur usullaridan biridir. Uzluksiz qiymatlarni hosil qiluvchi chiziqli regressiyadan farqli o'laroq, logistik regressiya hodisa ehtimolini baholash uchun mo'ljallangan, shuning uchun yakuniy natija 0 dan 1 gacha bo'lgan diapazonda bo'ladi. Ushbu maqolada biz logistik regressiya formulasini, har bir komponentning ma'nosini va uni qanday talqin qilishni muhokama qilamiz.

Nima uchun logistik regressiya kerak?

Agar ehtimolliklarni bashorat qilish uchun chiziqli regressiyadan foydalansak, model 0 dan past yoki 1 dan yuqori qiymatlarni hosil qilishi mumkin, bu esa ehtimollik uchun aniq asossizdir. Logistik regressiya bu muammoni hisoblangan natijani (har qanday qiymat bo'lishi mumkin) 0 va 1 orasidagi ehtimollik qiymatiga moslashtiradigan chiziqli bo'lmagan funksiya yordamida hal qiladi. Eng ko'p ishlatiladigan funksiya logistik yoki sigmasimon funksiyadir.

Masalan, biz mijozning yoshi, obuna muddati va foydalanish chastotasiga qarab, mijozning mijozdan voz kechishini taxmin qilmoqchimiz deylik. Bashorat qilingan natija faqat ikkita imkoniyatga ega: mijozning voz kechishi (1) yoki mijozning voz kechmasligi (0). Logistik regressiya bu turdagi vaziyat uchun juda mos keladi.

Logistik regressiya uchun asosiy formula

Logistik regressiyaning mohiyati bashorat qiluvchi o'zgaruvchining qiymati berilgan holda, (X) Y = 1 (hodisa sodir bo'lishi) ehtimolini (p) modellashtirishdan iborat.

Logistik regressiya modellari odatda ikkita muhim shaklda yoziladi:

1) Ehtimollik shakli (Sigmasimon)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

bilan

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Ma `lumot:
– \( p \) hodisaning ehtimolligi (masalan: o'zgarish = 1).
– \( e \) Eyler soni (taxminan 2,71828).
– \( z \) bashorat qiluvchilarning chiziqli kombinatsiyasi.
– \( \beta_0 \) kesishma nuqta (doimiy).
– \( \beta_1, \beta_2, \ldots, \beta_k \) regressiya koeffitsientlari.
– \( X_1, X_2, \ldots, X_k \) mustaqil o'zgaruvchilardir.

READ  Xalqaro munosabatlarda statistikaning ahamiyati

Sigmasimon funksiya \(z\) qiymati qanday bo'lishidan qat'i nazar, \(p\) qiymati 0 va 1 orasida qolishini ta'minlaydi.

2) Logit shakli (Log koeffitsientlari)

Yana bir juda muhim shakl - bu logit shakli, ya'ni koeffitsientlarning logarifmi:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Ma `lumot:
– \( \frac{p}{1-p} \) koeffitsient (nisbiy imkoniyat) deb ataladi.
– \( \ln \) natural logarifmdir.

Logit shakli logistik regressiya aslida log koeffitsientlarini bashorat qiluvchilarning chiziqli funktsiyasi sifatida modellashtirishini tushuntiradi. Bu koeffitsientlarni, ayniqsa koeffitsientlar nisbati kontekstida, talqin qilishni aniqroq qiladi.

Koeffitsientlar va koeffitsient nisbatlarini tushunish

Logistik regressiya formulasini chinakam tushunish uchun ehtimollik va koeffitsientlarni farqlashimiz kerak.

– Ehtimollik \( p \): hodisaning sodir bo'lish ehtimoli (0 dan 1 gacha).
– Koeffitsientlar: biror narsaning sodir bo'lish ehtimolini sodir bo'lmaslik ehtimoli bilan taqqoslash:

\[
\text{koeffitsientlar} = \frac{p}{1-p}
\]

Misol: agar \(p = 0{,}8 \) bo'lsa, unda:

\[
\text{koeffitsientlar} = \frac{0{,}8}{0{,}2} = 4
\]

Bu shuni anglatadiki, voqea sodir bo'lish ehtimoli sodir bo'lmaganidan 4 baravar yuqori.

Logistik regressiyada \(\beta \) koeffitsienti ko'pincha imkoniyatlar nisbati orqali talqin qilinadi:

\[
\text{OR} = e^{\beta}
\]

– Agar \( \beta > 0 \) bo'lsa, u holda \( e^{\beta} > 1 \): bashoratchi hodisaning ehtimolini oshiradi.
– Agar \(\beta < 0 \) bo'lsa, u holda \(e^{\beta} < 1 \): bashoratchi hodisa ehtimolini kamaytiradi. - Agar \(\beta = 0 \) bo'lsa, u holda \(e^{\beta} = 1 \): ehtimollikka hech qanday ta'sir ko'rsatmaydi. Masalan, agar \(\beta_1 = 0{,}7 \) bo'lsa, u holda: \[e^{0{,}7} \approx 2{,}01 \] Bu shuni anglatadiki, \(X_1 \) ning har 1 birlik oshishi hodisa ehtimolini taxminan 2,01 martaga ko'paytiradi (boshqa o'zgaruvchilar doimiy bo'lib qolsa). Oddiy logistik regressiya modeliga misol. Imtihondan o'tishni taxmin qilish uchun bizda faqat bitta bashoratchi o'zgaruvchi \(X \) bor, masalan, haftasiga o'qish soatlari soni (o'tish = 1, o'tolmaslik = 0). Model:

READ  Inferensial statistikada t-test
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] Agar taxminiy natija: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) bo'lsa, unda: \[z = -4 + 0{,}8X \] \[p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Agar \( X = 6 \) o'qish soati bo'lsa: \[z = -4 + 0{,}8(6) = 0{,}8 \] \[p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Talqin: haftasiga 6 soat o'qish bilan ehtimollik taxminan 69% ball bilan o'tdi. Koeffitsientni baholash: Nima uchun eng kichik kvadratlar usuli emas? Chiziqli regressiyada koeffitsientlar ko'pincha eng kichik kvadratlar usuli yordamida hisoblanadi. Biroq, logistik regressiyada bashorat qiluvchilar va ehtimolliklar o'rtasidagi bog'liqlik chiziqli emas, shuning uchun eng kichik kvadratlar yondashuvi ideal emas. Logistik regressiya odatda kuzatilgan ma'lumotlarning ehtimolligini maksimal darajada oshiradigan koeffitsient qiymatini topish uchun Maksimal Ehtimollik Baholashidan (MLE) foydalanadi. Xulosa qilib aytganda, ikkilik kuzatuvlar \(y_i \in \{0,1\} \) va bashoratlar \(p_i \) uchun ehtimollik quyidagicha: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Keyin hisoblashni osonlashtirish uchun ko'pincha log-ehtimollikka aylantiriladi: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] \( \beta \) qiymati \( \ell(\beta) \ ni maksimal darajada oshirish uchun tanlanadi. Nyuton-Raphson yoki gradient tushishi kabi sonli usullar ko'pincha statistik dasturlar tomonidan qo'llaniladi. Logistik regressiyaning afzalliklari va cheklovlari Afzalliklari 1. Natijalar ehtimolliklar shaklida bo'ladi, shuning uchun ularni qarorlarga aylantirish oson. 2. Koeffitsientlarning talqini ehtimollik nisbati orqali aniq ko'rinadi. 3. Ikkilik tasniflash muammolari uchun mos keladi va ko'p nomli/tartibli masalalarga ham kengaytirilishi mumkin. Cheklovlar 1. Ehtimolliklarga bevosita emas, balki bashorat qiluvchilar va log koeffitsientlari o'rtasida chiziqli bog'liqlikni taxmin qiladi. 2. Agar multikollinearlik yoki yuqori darajada nomutanosib ma'lumotlar mavjud bo'lsa, muammoli bo'lishi mumkin. 3. Juda murakkab munosabatlar naqshlari uchun boshqa chiziqli bo'lmagan usullar (masalan, tasodifiy o'rmon yoki neyron tarmog'i) ustun bo'lishi mumkin.
READ  Ko'p o'zgaruvchili statistika nima?
Xulosa Logistik regressiya formulasi asosan ehtimolliklarni hosil qilish uchun bashorat qiluvchi o'zgaruvchilarning chiziqli kombinatsiyasini sigmasimon funksiya bilan birlashtiradi. Eng keng tarqalgan shakl: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] yoki logit shaklida: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Formulaning ushbu ikki shaklini tushunish orqali biz turli xil ikkilik tasniflash muammolari uchun bashoratli modellarni yaratishimiz mumkin, shu bilan birga o'zgaruvchilarning ta'sirini ehtimollik nisbati \( e^{\beta} \) orqali sharhlashimiz mumkin. Logistik regressiya ma'lumotlarni tahlil qilishda muhim asos bo'lib qolmoqda, chunki u oddiy, kuchli va talqin qilinadi - va ko'pincha murakkabroq modellarni sinab ko'rishdan oldin birinchi qadamdir. Agar xohlasangiz, men kichik ma'lumotlar (jadval) bilan hisoblash misolini yoki Python/R da logistik regressiyaning namunaviy amalga oshirilishini va natijani sharhlashni qo'shishim mumkin.

Fikr qoldiring