Wzór regresji logistycznej

Wzór regresji logistycznej

Regresja logistyczna to jedna z najpopularniejszych metod w statystyce i nauce o danych, służąca do modelowania relacji między wieloma zmiennymi niezależnymi (predyktorami) a kategoryczną zmienną zależną, zwłaszcza binarną (np. tak/nie, sukces/porażka, chory/zdrowy). W przeciwieństwie do regresji liniowej, która generuje wartości ciągłe, regresja logistyczna ma na celu oszacowanie prawdopodobieństwa zdarzenia, więc wynik końcowy mieści się w zakresie od 0 do 1. W tym artykule omówimy wzór regresji logistycznej, znaczenie każdego składnika oraz sposób jego interpretacji.

Dlaczego regresja logistyczna jest potrzebna?

Jeśli użyjemy regresji liniowej do przewidywania prawdopodobieństw, model może generować wartości poniżej 0 lub powyżej 1, co jest ewidentnie nieracjonalne z punktu widzenia prawdopodobieństwa. Regresja logistyczna rozwiązuje ten problem, wykorzystując funkcję nieliniową, która odwzorowuje obliczony wynik (który może być dowolną wartością) na wartość prawdopodobieństwa z zakresu od 0 do 1. Najczęściej stosowaną funkcją jest funkcja logistyczna lub sigmoidalna.

Załóżmy na przykład, że chcemy przewidzieć, czy klient zrezygnuje z usługi na podstawie jego wieku, długości subskrypcji i częstotliwości korzystania. Przewidywany wynik ma tylko dwie możliwości: rezygnacja (1) lub brak rezygnacji (0). Regresja logistyczna doskonale sprawdza się w tego typu sytuacjach.

Podstawowy wzór regresji logistycznej

Istotą regresji logistycznej jest modelowanie prawdopodobieństwa \( p \) tego, że \( Y = 1 \) (zdarzenie nastąpi), przy danej wartości zmiennej predykcyjnej \( X \).

Modele regresji logistycznej są zazwyczaj zapisywane w dwóch ważnych formach:

1) Forma prawdopodobieństwa (sigmoidalna)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

z

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Informacja:
– \( p \) jest prawdopodobieństwem zdarzenia (np.: odejście = 1).
– \( e \) jest liczbą Eulera (w przybliżeniu 2,71828).
– \( z \) jest liniową kombinacją predyktorów.
– \( \beta_0 \) jest przecięciem (stałą).
– \( \beta_1, \beta_2, \ldots, \beta_k \) są współczynnikami regresji.
– \( X_1, X_2, \ldots, X_k \) są zmiennymi niezależnymi.

CZYTAĆ  Znaczenie statystyki w stosunkach międzynarodowych

Funkcja sigmoidalna zapewnia, że ​​bez względu na wartość \( z \), wartość \( p \) pozostaje pomiędzy 0 i 1.

2) Formularz Logit (Log kursów)

Inną bardzo ważną formą jest forma logitowa, która jest logarytmem szans:

\[
\text{logit}(p) = \ln\lewy(\frac{p}{1-p}\prawy) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Informacja:
– \( \frac{p}{1-p} \) nazywa się szansą (względną szansą).
– \( \ln \) jest logarytmem naturalnym.

Postać logitowa wyjaśnia, że ​​regresja logistyczna w rzeczywistości modeluje logarytm szans jako funkcję liniową predyktorów. To ułatwia interpretację współczynników, szczególnie w kontekście ilorazów szans.

Zrozumienie szans i współczynników szans

Aby w pełni zrozumieć wzór regresji logistycznej, musimy odróżnić prawdopodobieństwo od szansy.

– Prawdopodobieństwo \( p \): szansa zajścia zdarzenia (od 0 do 1).
– Szanse: porównanie prawdopodobieństwa zajścia czegoś i niezajścia czegoś:

\[
\text{kurs} = \frac{p}{1-p}
\]

Przykład: jeśli \( p = 0{,}8 \), wtedy:

\[
Kurs = 0,8,2 = 4
\]

Oznacza to, że prawdopodobieństwo wystąpienia zdarzenia jest czterokrotnie większe niż jego nieistnienia.

W regresji logistycznej współczynnik \( \beta \) jest często interpretowany poprzez iloraz szans:

\[
\text{LUB} = e^{\beta}
\]

– Jeśli \( \beta > 0 \), to \( e^{\beta} > 1 \): predyktor zwiększa prawdopodobieństwo zdarzenia.
– Jeśli \( \beta < 0 \), wtedy \( e^{\beta} < 1 \): predyktor zmniejsza szanse zdarzenia. - Jeśli \( \beta = 0 \), wtedy \( e^{\beta} = 1 \): nie ma wpływu na szanse. Na przykład, jeśli \( \beta_1 = 0{,}7 \), wtedy: \[ e^{0{,}7} \ approx 2{,}01 \] Oznacza to, że każdy wzrost o 1 jednostkę w \( X_1 \) pomnoży szanse zdarzenia około 2,01 razy (zakładając, że inne zmienne pozostają stałe). Przykład prostego modelu regresji logistycznej Załóżmy, że mamy tylko jedną zmienną predykcyjną \( X \), na przykład liczbę godzin nauki tygodniowo, aby przewidzieć zdanie egzaminu (zdany = 1, niezaliczony = 0). Model:

CZYTAĆ  Test t w statystyce wnioskowania
\[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jeżeli szacowany wynik wynosi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Wówczas: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jeżeli \( X = 6 \) godzin nauki: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \ approx 0{,}69 \] Interpretacja: przy 6 godzinach nauki tygodniowo prawdopodobieństwo zdania egzaminu wyniosło około 69%. Estymacja współczynników: Dlaczego nie metoda najmniejszych kwadratów? W regresji liniowej współczynniki są często obliczane metodą najmniejszych kwadratów. Jednak w regresji logistycznej zależność między predyktorami a prawdopodobieństwami jest nieliniowa, więc metoda najmniejszych kwadratów nie jest idealna. Regresja logistyczna zazwyczaj wykorzystuje estymację metodą największej wiarygodności (MLE) do znalezienia wartości współczynnika \( \beta \), która maksymalizuje prawdopodobieństwo obserwowanych danych. Podsumowując, prawdopodobieństwo obserwacji binarnych \( y_i \in \{0,1\} \) i przewidywań \( p_i \) wynosi: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Następnie często przekształca się je na logarytm prawdopodobieństwa, aby ułatwić obliczenia: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Wartość \( \beta \) jest wybierana w celu maksymalizacji \( \ell(\beta) \). W oprogramowaniu statystycznym często stosuje się metody numeryczne, takie jak metoda Newtona-Raphsona lub metoda gradientu prostego. Zalety i ograniczenia regresji logistycznej Zalety 1. Wyniki mają formę prawdopodobieństw, dzięki czemu łatwo je przełożyć na decyzje. 2. Interpretacja współczynników jest jasna dzięki ilorazowi szans. 3. Nadaje się do problemów klasyfikacji binarnej i może być rozszerzona na wielomianowe/porządkowe. Ograniczenia 1. Zakłada liniową zależność między predyktorami a logarytmami szans, a nie bezpośrednio do prawdopodobieństw. 2. Może być problematyczna, jeśli występuje multikolinearność lub wysoce niezrównoważone dane. 3. W przypadku bardzo złożonych wzorców zależności lepsze mogą być inne metody nieliniowe (np. las losowy lub sieć neuronowa).
CZYTAĆ  Czym jest statystyka wielowymiarowa?
Wnioski Wzór regresji logistycznej zasadniczo łączy liniową kombinację zmiennych predykcyjnych z funkcją sigmoidalną w celu wygenerowania prawdopodobieństw. Najczęstsza forma to: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] lub w formie logitowej: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Rozumiejąc te dwie formy wzoru, możemy budować modele predykcyjne dla różnych problemów klasyfikacji binarnej, interpretując jednocześnie wpływ zmiennych za pomocą ilorazu szans \( e^{\beta} \). Regresja logistyczna pozostaje ważnym fundamentem w analizie danych, ponieważ jest prosta, wydajna i interpretacyjna — i często stanowi pierwszy krok przed próbą bardziej złożonych modeli. Jeśli chcesz, mogę dodać przykładowe obliczenia z wykorzystaniem małej ilości danych (tabela) lub przykładową implementację regresji logistycznej w Pythonie/R wraz z interpretacją wyników.

Zostaw komentarz