נוסחת רגרסיה לוגיסטית
רגרסיה לוגיסטית היא אחת השיטות הפופולריות ביותר בסטטיסטיקה ובמדעי הנתונים למידול הקשר בין מספר משתנים בלתי תלויים (מנבאים) לבין משתנה תלוי קטגורי, במיוחד בינארי (למשל, כן/לא, הצלחה/כישלון, חולה/בריא). בניגוד לרגרסיה לינארית, המייצרת ערכים רציפים, רגרסיה לוגיסטית נועדה להעריך את ההסתברות לאירוע, כך שהתוצאה הסופית היא בטווח של 0 עד 1. במאמר זה נדון בנוסחת הרגרסיה הלוגיסטית, במשמעות של כל רכיב וכיצד לפרש אותו.
מדוע נדרשת רגרסיה לוגיסטית?
אם נשתמש ברגרסיה לינארית כדי לחזות הסתברויות, המודל יכול לייצר ערכים מתחת ל-0 או מעל ל-1, דבר שאינו סביר באופן ברור עבור הסתברות. רגרסיה לוגיסטית מטפלת בבעיה זו באמצעות פונקציה לא לינארית הממפה את התוצאה המחושבת (שיכולה להיות כל ערך) לערך הסתברות בין 0 ל-1. הפונקציה הנפוצה ביותר היא הפונקציה הלוגיסטית או הפונקציה הסיגמואידית.
לדוגמה, נניח שאנחנו רוצים לחזות האם לקוח ייעדר על סמך גילו, משך המנוי ותדירות השימוש שלו. לתוצאה הצפויה יש רק שתי אפשרויות: נטישה (1) או אי נטישה (0). רגרסיה לוגיסטית מתאימה היטב לסוג זה של מצב.
נוסחה בסיסית לרגרסיה לוגיסטית
מהות הרגרסיה הלוגיסטית היא לדמות את ההסתברות \(p \) ש \(Y = 1 \) (האירוע מתרחש), בהינתן ערך משתנה החיזוי \(X \).
מודלים של רגרסיה לוגיסטית נכתבים בדרך כלל בשתי צורות עיקריות:
1) צורת הסתברות (סיגמואיד)
\[
p = P(Y=1\mid X) = \frac{1}{1 + e^{-z}}
\]
עם
\[
z = β₀ + β₀ X₁ + β₂ X₂ + β₀ + β₀ X₀
\]
מֵידָע:
– \(p \) היא ההסתברות לאירוע (לדוגמה: churn = 1).
– \(e \) הוא מספר אוילר (בערך 2,71828).
– \(z \) הוא שילוב ליניארי של מנבאים.
– \( \β_0 \) הוא נקודת החיתוך (קבועה).
– \(β1, β2, ..., βk \) הם מקדמי הרגרסיה.
– \(X_1, X_2, \ldots, X_k \) הם משתנים בלתי תלויים.
פונקציית הסיגמואיד מבטיחה שבלי קשר לערך של \(z \), הערך של \(p \) נשאר בין 0 ל-1.
2) טופס לוגיט (סיכויים לוגריתמיים)
צורה חשובה נוספת היא צורת הלוגיט, שהיא הלוגריתם של הסיכויים:
\[
{logit}(p) = \ln\left(\frac{p}{1-p}\right) = β₀ + β₁ X₁ + β₂ X₂ + β₀ + β₇ X₁
\]
מֵידָע:
– \( \frac{p}{1-p} \) נקרא הסיכויים (סיכוי יחסי).
– \( \ln \) הוא הלוגריתם הטבעי.
צורת הלוגיט מסבירה שרגרסיה לוגיסטית למעשה מדמה את הסיכויים הלוגריים כפונקציה לינארית של המנבאים. זה הופך את פירוש המקדמים לברור יותר, במיוחד בהקשר של יחסי סיכויים.
הבנת הסיכויים ויחסי הסיכויים
כדי להבין באמת את נוסחת הרגרסיה הלוגיסטית, עלינו להבחין בין הסתברות לסיכויים.
– הסתברות \(p \): הסיכוי להתרחשות אירוע (0 עד 1).
סיכויים: השוואה בין ההסתברות שמשהו יקרה לבין ההסתברות שלא יקרה:
\[
הסיכויים = \frac{p}{1-p}
\]
דוגמה: אם \( p = 0{,}8 \), אז:
\[
הסיכויים = \frac{0,8}{0,2} = 4
\]
משמעות הדבר היא שהסיכוי שהאירוע יקרה פי 4 מאשר שלא.
ברגרסיה לוגיסטית, המקדם β מתפרש לעתים קרובות באמצעות יחס הסיכויים:
\[
OR = e^{\beta}
\]
– אם \( \β > 0 \), אז \( e^{\β} > 1 \): המנבא מגדיל את הסיכויים לאירוע.
– אם (β < 0), אז (e^{β} < 1): המנבא מקטין את הסיכויים לאירוע. - אם (β = 0), אז (e^{β} = 1): אין השפעה על הסיכויים. לדוגמה, אם (β1 = 0,7), אז: [e^{0,7} = 2,01] משמעות הדבר היא שכל עלייה של יחידה אחת ב- (X_1) תכפיל את הסיכויים לאירוע פי 2.01 בקירוב (בהנחה שמשתנים אחרים נשארים קבועים). דוגמה למודל רגרסיה לוגיסטית פשוט נניח שיש לנו רק משתנה מנבא אחד (X), לדוגמה מספר שעות הלימוד בשבוע, כדי לחזות מעבר מבחן (עובר = 1, נכשל = 0). המודל: