లాజిస్టిక్ రిగ్రెషన్ ఫార్ములా

లాజిస్టిక్ రిగ్రెషన్ ఫార్ములా

గణాంకాలు మరియు డేటా సైన్స్‌లో, అనేక స్వతంత్ర చరరాశులు (అంచనాదారులు) మరియు ఒక వర్గీకృత ఆధారిత చరరాశి, ముఖ్యంగా బైనరీ (ఉదా., అవును/కాదు, విజయం/వైఫల్యం, అనారోగ్యం/ఆరోగ్యం) మధ్య సంబంధాన్ని నమూనా చేయడానికి లాజిస్టిక్ రిగ్రెషన్ అత్యంత ప్రజాదరణ పొందిన పద్ధతులలో ఒకటి. నిరంతర విలువలను ఉత్పత్తి చేసే లీనియర్ రిగ్రెషన్‌కు భిన్నంగా, లాజిస్టిక్ రిగ్రెషన్ ఒక సంఘటన యొక్క సంభావ్యతను అంచనా వేయడానికి రూపొందించబడింది, కాబట్టి తుది ఫలితం 0 నుండి 1 పరిధిలో ఉంటుంది. ఈ వ్యాసంలో, మనం లాజిస్టిక్ రిగ్రెషన్ సూత్రం, దానిలోని ప్రతి భాగం యొక్క అర్థం మరియు దానిని ఎలా అన్వయించుకోవాలో చర్చిస్తాము.

లాజిస్టిక్ రిగ్రెషన్ ఎందుకు అవసరం?

సంభావ్యతలను అంచనా వేయడానికి మనం లీనియర్ రిగ్రెషన్‌ను ఉపయోగిస్తే, ఆ మోడల్ 0 కంటే తక్కువ లేదా 1 కంటే ఎక్కువ విలువలను ఉత్పత్తి చేయగలదు, ఇది సంభావ్యతకు స్పష్టంగా అసమంజసమైనది. లాజిస్టిక్ రిగ్రెషన్ ఈ సమస్యను ఒక నాన్‌లీనియర్ ఫంక్షన్‌ను ఉపయోగించడం ద్వారా పరిష్కరిస్తుంది, ఇది లెక్కించిన ఫలితాన్ని (అది ఏ విలువ అయినా కావచ్చు) 0 మరియు 1 మధ్య సంభావ్యత విలువకు మ్యాప్ చేస్తుంది. సర్వసాధారణంగా ఉపయోగించే ఫంక్షన్ లాజిస్టిక్ లేదా సిగ్మాయిడ్ ఫంక్షన్.

ఉదాహరణకు, ఒక కస్టమర్ వయస్సు, సబ్‌స్క్రిప్షన్ వ్యవధి మరియు వినియోగ తరచుదనం ఆధారంగా వారు చర్న్ అవుతారా లేదా అని మనం అంచనా వేయాలనుకుందాం. అంచనా వేయబడిన ఫలితానికి కేవలం రెండు అవకాశాలు మాత్రమే ఉంటాయి: చర్న్ (1) లేదా చర్న్ అవ్వకపోవడం (0). ఇటువంటి పరిస్థితికి లాజిస్టిక్ రిగ్రెషన్ చాలా అనుకూలంగా ఉంటుంది.

లాజిస్టిక్ రిగ్రెషన్ కోసం ప్రాథమిక సూత్రం

లాజిస్టిక్ రిగ్రెషన్ యొక్క సారాంశం ఏమిటంటే, ప్రిడిక్టర్ వేరియబుల్ \(X \) విలువ ఇవ్వబడినప్పుడు, \(Y = 1 \) (సంఘటన సంభవిస్తుంది) అనే సంభావ్యత \(p \) ను నమూనా చేయడం.

లాజిస్టిక్ రిగ్రెషన్ మోడల్‌లు సాధారణంగా రెండు ముఖ్యమైన రూపాల్లో వ్రాయబడతాయి:

1) సంభావ్యత రూపం (సిగ్మాయిడ్)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

కలిసి

\[
z = β₀ + β₁ X₁ + β₂ X₂ + ... + βk Xk
\]

Keterangan:
– \( p \) అనునది సంఘటన సంభావ్యత (ఉదా: మార్పు = 1).
– \( e \) అనేది యూలర్ సంఖ్య (సుమారు 2,71828).
– \( z \) అనేది అంచనాదారుల యొక్క రేఖీయ కలయిక.
– \( \beta_0 \) అనేది అంతరఖండం (స్థిరాంకం).
– \( \beta_1, \beta_2, \ldots, \beta_k \) లు రిగ్రెషన్ గుణకాలు.
– (X_1, X_2, ..., X_k) అనేవి స్వతంత్ర చరరాశులు.

చదవండి  పరిశోధన నీతిలో గణాంకాలు

సిగ్మాయిడ్ ఫంక్షన్, \(z\) విలువ ఏది అయినప్పటికీ, \(p\) విలువ 0 మరియు 1 మధ్య ఉండేలా నిర్ధారిస్తుంది.

2) లాజిట్ ఫారం (లాగ్ ఆడ్స్)

మరొక చాలా ముఖ్యమైన రూపం లాజిట్ రూపం, ఇది ఆడ్స్ యొక్క లాగరిథమ్:

\[
లాజిట్(p) = ln(p/1-p) = β₀ + β₁ X₁ + β₂ X₂ + ... + βk Xₖ
\]

Keterangan:
– \( \frac{p}{1-p} \) ను ఆడ్స్ (సాపేక్ష అవకాశం) అంటారు.
– \( \ln \) అనుదినం సహజ సంవర్గమానం.

లాజిట్ రూపం వివరించేదేమిటంటే, లాజిస్టిక్ రిగ్రెషన్ వాస్తవానికి లాగ్ ఆడ్స్‌ను ప్రిడిక్టర్ల యొక్క లీనియర్ ఫంక్షన్‌గా మోడల్ చేస్తుంది. ఇది కోఎఫిషియంట్‌లను అర్థం చేసుకోవడాన్ని మరింత స్పష్టం చేస్తుంది, ముఖ్యంగా ఆడ్స్ రేషియోల సందర్భంలో.

ఆడ్స్ మరియు ఆడ్స్ నిష్పత్తులను అర్థం చేసుకోవడం

లాజిస్టిక్ రిగ్రెషన్ సూత్రాన్ని నిజంగా అర్థం చేసుకోవాలంటే, మనం సంభావ్యత మరియు ఆడ్స్ మధ్య తేడాను గుర్తించాలి.

– సంభావ్యత (p): ఒక సంఘటన జరగడానికి గల అవకాశం (0 నుండి 1).
– సంభావ్యత: ఏదైనా జరగడానికి మరియు జరగకపోవడానికి మధ్య గల సంభావ్యతల పోలిక:

\[
బేసి సంఖ్యలు = p/1-p
\]

ఉదాహరణ: \( p = 0{,}8 \) అయితే:

\[
బేసి సంఖ్యలు = 0, 8 / 0, 2 = 4
\]

దీని అర్థం ఏమిటంటే, ఆ సంఘటన జరగడానికి అవకాశం జరగకపోవడం కంటే 4 రెట్లు ఎక్కువగా ఉంది.

లాజిస్టిక్ రిగ్రెషన్‌లో, గుణకం \( \beta \) ను తరచుగా ఆడ్స్ నిష్పత్తి ద్వారా వివరిస్తారు:

\[
OR = e^{\beta}
\]

– ఒకవేళ \( \beta > 0 \) అయితే, అప్పుడు \( e^{\beta} > 1 \): ప్రిడిక్టర్ ఈవెంట్ యొక్క ఆడ్స్‌ను పెంచుతుంది.
– ఒకవేళ \( \beta < 0 \) అయితే, అప్పుడు \( e^{\beta} < 1 \): ప్రిడిక్టర్ ఈవెంట్ యొక్క ఆడ్స్‌ను తగ్గిస్తుంది. - ఒకవేళ \( \beta = 0 \) అయితే, అప్పుడు \( e^{\beta} = 1 \): ఆడ్స్‌పై ఎటువంటి ప్రభావం ఉండదు. ఉదాహరణకు, ఒకవేళ \( \beta_1 = 0{,}7 \) అయితే, అప్పుడు: \[ e^{0{,}7} \approx 2{,}01 \] దీని అర్థం ఏమిటంటే, \( X_1 \) లో ప్రతి 1 యూనిట్ పెరుగుదల ఈవెంట్ యొక్క ఆడ్స్‌ను సుమారుగా 2,01 రెట్లు గుణిస్తుంది (ఇతర వేరియబుల్స్ స్థిరంగా ఉన్నాయని భావిస్తే). ఒక సాధారణ లాజిస్టిక్ రిగ్రెషన్ మోడల్ యొక్క ఉదాహరణ ఒక పరీక్షలో ఉత్తీర్ణతను (పాస్ = 1, ఫెయిల్ = 0) అంచనా వేయడానికి, మనకు వారానికి చదివే గంటల సంఖ్య వంటి ఒకే ఒక ప్రిడిక్టర్ వేరియబుల్ \( X \) ఉందని అనుకుందాం. మోడల్:

చదవండి  డేటా విశ్లేషణ కోసం గణాంకాలు
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] అంచనా వేసిన ఫలితం: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) అయితే: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] ఒకవేళ \( X = 6 \) గంటల అధ్యయనం అయితే: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] వివరణ: వారానికి 6 గంటల అధ్యయనంతో, సుమారు 69% స్కోరుతో ఉత్తీర్ణులయ్యే సంభావ్యత. గుణాంక అంచనా: కనిష్ట వర్గాల పద్ధతి ఎందుకు కాదు? లీనియర్ రిగ్రెషన్‌లో, గుణకాలను తరచుగా లీస్ట్ స్క్వేర్స్ పద్ధతిని ఉపయోగించి లెక్కిస్తారు. అయితే, లాజిస్టిక్ రిగ్రెషన్‌లో, ప్రిడిక్టర్లు మరియు సంభావ్యతల మధ్య సంబంధం నాన్-లీనియర్‌గా ఉంటుంది, కాబట్టి లీస్ట్ స్క్వేర్స్ విధానం ఆదర్శవంతమైనది కాదు. లాజిస్టిక్ రిగ్రెషన్ సాధారణంగా పరిశీలించిన డేటా యొక్క లైక్లిహుడ్‌ను గరిష్ఠం చేసే గుణకం విలువ \( \beta \)ను కనుగొనడానికి మాక్సిమం లైక్లిహుడ్ ఎస్టిమేషన్ (MLE)ను ఉపయోగిస్తుంది. సారాంశంలో, బైనరీ పరిశీలనలు \( y_i \in \{0,1\} \) మరియు అంచనాలు \( p_i \) కొరకు సంభావ్యత ఈ విధంగా ఉంటుంది: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] దీనిని లెక్కించడం సులభతరం చేయడానికి తరచుగా లాగ్-లైక్లిహుడ్‌గా మార్చబడుతుంది: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] \( \ell(\beta) \) ను గరిష్ఠం చేయడానికి \( \beta \) విలువ ఎంపిక చేయబడుతుంది. స్టాటిస్టికల్ సాఫ్ట్‌వేర్ తరచుగా న్యూటన్-రాఫ్సన్ లేదా గ్రేడియంట్ డిసెంట్ వంటి సంఖ్యా పద్ధతులను ఉపయోగిస్తుంది. లాజిస్టిక్ రిగ్రెషన్ యొక్క ప్రయోజనాలు మరియు పరిమితులు ప్రయోజనాలు 1. ఫలితాలు సంభావ్యతల రూపంలో ఉంటాయి కాబట్టి వాటిని నిర్ణయాలుగా మార్చడం సులభం. 2. ఆడ్స్ నిష్పత్తి ద్వారా గుణకాల వివరణ స్పష్టంగా ఉంటుంది. 3. బైనరీ వర్గీకరణ సమస్యలకు అనుకూలం మరియు మల్టీనోమియల్/ఆర్డినల్‌కు విస్తరించవచ్చు. పరిమితులు 1. ప్రిడిక్టర్లు మరియు లాగ్ ఆడ్స్ మధ్య సరళ సంబంధాన్ని ఊహిస్తుంది, కానీ నేరుగా సంభావ్యతలకు కాదు. 2. మల్టీకోలినారిటీ లేదా అత్యంత అసమతుల్య డేటా ఉన్నట్లయితే సమస్యాత్మకంగా ఉండవచ్చు. 3. చాలా సంక్లిష్టమైన సంబంధ నమూనాల కోసం, ఇతర నాన్-లీనియర్ పద్ధతులు (ఉదా., రాండమ్ ఫారెస్ట్ లేదా న్యూరల్ నెట్‌వర్క్) ఉన్నతంగా ఉండవచ్చు.
చదవండి  గణాంకాలలో విచక్షణ విశ్లేషణ
ముగింపు: లాజిస్టిక్ రిగ్రెషన్ ఫార్ములా ప్రాథమికంగా సంభావ్యతలను ఉత్పత్తి చేయడానికి ప్రిడిక్టర్ వేరియబుల్స్ యొక్క లీనియర్ కాంబినేషన్‌ను సిగ్మాయిడ్ ఫంక్షన్‌తో మిళితం చేస్తుంది. అత్యంత సాధారణ రూపం: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] లేదా లాజిట్ రూపంలో: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] ఈ ఫార్ములా యొక్క ఈ రెండు రూపాలను అర్థం చేసుకోవడం ద్వారా, మనం ఆడ్స్ రేషియో \( e^{\beta} \) ద్వారా వేరియబుల్స్ ప్రభావాన్ని విశ్లేషిస్తూ, వివిధ బైనరీ వర్గీకరణ సమస్యల కోసం ప్రిడిక్టివ్ మోడల్స్‌ను నిర్మించవచ్చు. లాజిస్టిక్ రిగ్రెషన్ డేటా విశ్లేషణలో ఒక ముఖ్యమైన పునాదిగా మిగిలిపోయింది, ఎందుకంటే ఇది సరళమైనది, శక్తివంతమైనది మరియు వివరణాత్మకమైనది—మరియు తరచుగా మరింత సంక్లిష్టమైన మోడల్స్‌ను ప్రయత్నించే ముందు ఇది మొదటి అడుగు. మీకు కావాలంటే, నేను చిన్న డేటాతో (పట్టిక) ఒక ఉదాహరణ గణనను, లేదా అవుట్‌పుట్ యొక్క వివరణతో పాటు పైథాన్/Rలో లాజిస్టిక్ రిగ్రెషన్ యొక్క ఉదాహరణ అమలును జోడించగలను.

వ్యాఖ్యానించండి