Wzór regresji logistycznej
Regresja logistyczna to jedna z najpopularniejszych metod w statystyce i nauce o danych, służąca do modelowania relacji między wieloma zmiennymi niezależnymi (predyktorami) a kategoryczną zmienną zależną, zwłaszcza binarną (np. tak/nie, sukces/porażka, chory/zdrowy). W przeciwieństwie do regresji liniowej, która generuje wartości ciągłe, regresja logistyczna ma na celu oszacowanie prawdopodobieństwa zdarzenia, więc wynik końcowy mieści się w zakresie od 0 do 1. W tym artykule omówimy wzór regresji logistycznej, znaczenie każdego składnika oraz sposób jego interpretacji.
Dlaczego regresja logistyczna jest potrzebna?
Jeśli użyjemy regresji liniowej do przewidywania prawdopodobieństw, model może generować wartości poniżej 0 lub powyżej 1, co jest ewidentnie nieracjonalne z punktu widzenia prawdopodobieństwa. Regresja logistyczna rozwiązuje ten problem, wykorzystując funkcję nieliniową, która odwzorowuje obliczony wynik (który może być dowolną wartością) na wartość prawdopodobieństwa z zakresu od 0 do 1. Najczęściej stosowaną funkcją jest funkcja logistyczna lub sigmoidalna.
Załóżmy na przykład, że chcemy przewidzieć, czy klient zrezygnuje z usługi na podstawie jego wieku, długości subskrypcji i częstotliwości korzystania. Przewidywany wynik ma tylko dwie możliwości: rezygnacja (1) lub brak rezygnacji (0). Regresja logistyczna doskonale sprawdza się w tego typu sytuacjach.
Podstawowy wzór regresji logistycznej
Istotą regresji logistycznej jest modelowanie prawdopodobieństwa \( p \) tego, że \( Y = 1 \) (zdarzenie nastąpi), przy danej wartości zmiennej predykcyjnej \( X \).
Modele regresji logistycznej są zazwyczaj zapisywane w dwóch ważnych formach:
1) Forma prawdopodobieństwa (sigmoidalna)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
z
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Informacja:
– \( p \) jest prawdopodobieństwem zdarzenia (np.: odejście = 1).
– \( e \) jest liczbą Eulera (w przybliżeniu 2,71828).
– \( z \) jest liniową kombinacją predyktorów.
– \( \beta_0 \) jest przecięciem (stałą).
– \( \beta_1, \beta_2, \ldots, \beta_k \) są współczynnikami regresji.
– \( X_1, X_2, \ldots, X_k \) są zmiennymi niezależnymi.
Funkcja sigmoidalna zapewnia, że bez względu na wartość \( z \), wartość \( p \) pozostaje pomiędzy 0 i 1.
2) Formularz Logit (Log kursów)
Inną bardzo ważną formą jest forma logitowa, która jest logarytmem szans:
\[
\text{logit}(p) = \ln\lewy(\frac{p}{1-p}\prawy) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
Informacja:
– \( \frac{p}{1-p} \) nazywa się szansą (względną szansą).
– \( \ln \) jest logarytmem naturalnym.
Postać logitowa wyjaśnia, że regresja logistyczna w rzeczywistości modeluje logarytm szans jako funkcję liniową predyktorów. To ułatwia interpretację współczynników, szczególnie w kontekście ilorazów szans.
Zrozumienie szans i współczynników szans
Aby w pełni zrozumieć wzór regresji logistycznej, musimy odróżnić prawdopodobieństwo od szansy.
– Prawdopodobieństwo \( p \): szansa zajścia zdarzenia (od 0 do 1).
– Szanse: porównanie prawdopodobieństwa zajścia czegoś i niezajścia czegoś:
\[
\text{kurs} = \frac{p}{1-p}
\]
Przykład: jeśli \( p = 0{,}8 \), wtedy:
\[
Kurs = 0,8,2 = 4
\]
Oznacza to, że prawdopodobieństwo wystąpienia zdarzenia jest czterokrotnie większe niż jego nieistnienia.
W regresji logistycznej współczynnik \( \beta \) jest często interpretowany poprzez iloraz szans:
\[
\text{LUB} = e^{\beta}
\]
– Jeśli \( \beta > 0 \), to \( e^{\beta} > 1 \): predyktor zwiększa prawdopodobieństwo zdarzenia.
– Jeśli \( \beta < 0 \), wtedy \( e^{\beta} < 1 \): predyktor zmniejsza szanse zdarzenia. - Jeśli \( \beta = 0 \), wtedy \( e^{\beta} = 1 \): nie ma wpływu na szanse. Na przykład, jeśli \( \beta_1 = 0{,}7 \), wtedy: \[ e^{0{,}7} \ approx 2{,}01 \] Oznacza to, że każdy wzrost o 1 jednostkę w \( X_1 \) pomnoży szanse zdarzenia około 2,01 razy (zakładając, że inne zmienne pozostają stałe). Przykład prostego modelu regresji logistycznej Załóżmy, że mamy tylko jedną zmienną predykcyjną \( X \), na przykład liczbę godzin nauki tygodniowo, aby przewidzieć zdanie egzaminu (zdany = 1, niezaliczony = 0). Model: