로지스틱 회귀 공식
로지스틱 회귀는 통계 및 데이터 과학에서 여러 독립 변수(예측 변수)와 범주형 종속 변수, 특히 이진 변수(예: 예/아니오, 성공/실패, 질병/건강) 간의 관계를 모델링하는 데 가장 널리 사용되는 방법 중 하나입니다. 연속적인 값을 생성하는 선형 회귀와 달리, 로지스틱 회귀는 사건 발생 확률을 추정하도록 설계되었으므로 최종 결과는 0에서 1 사이의 값을 갖습니다. 이 글에서는 로지스틱 회귀 공식, 각 구성 요소의 의미, 그리고 해석 방법에 대해 살펴보겠습니다.
로지스틱 회귀 분석이 필요한 이유는 무엇일까요?
선형 회귀를 사용하여 확률을 예측할 경우, 모델이 0보다 작거나 1보다 큰 값을 생성할 수 있는데, 이는 확률 예측에 있어 명백히 부적절한 결과입니다. 로지스틱 회귀는 계산된 결과(임의의 값일 수 있음)를 0과 1 사이의 확률 값으로 매핑하는 비선형 함수를 사용하여 이러한 문제를 해결합니다. 가장 일반적으로 사용되는 함수는 로지스틱 함수 또는 시그모이드 함수입니다.
예를 들어, 고객의 나이, 구독 기간 및 사용 빈도를 기반으로 고객이 이탈할지 여부를 예측한다고 가정해 보겠습니다. 예측 결과는 이탈(1) 또는 이탈하지 않음(0)의 두 가지 가능성만 있습니다. 로지스틱 회귀는 이러한 유형의 상황에 적합합니다.
로지스틱 회귀 분석의 기본 공식
로지스틱 회귀 분석의 핵심은 예측 변수 \(X\)의 값이 주어졌을 때 \(Y=1\) (사건이 발생할 확률\(p\))을 모델링하는 것입니다.
로지스틱 회귀 모델은 일반적으로 두 가지 중요한 형태로 작성됩니다.
1) 확률 형태 (시그모이드)
\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]
dengan
\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
설명 :
– \( p \)는 사건의 확률입니다(예: 이탈 = 1).
– \( e \)는 오일러 상수(약 2,71828)입니다.
– \( z \)는 예측 변수의 선형 조합입니다.
– \( \beta_0 \)는 절편(상수)입니다.
– \( \beta_1, \beta_2, \ldots, \beta_k \)는 회귀 계수입니다.
– \( X_1, X_2, \ldots, X_k \)는 독립 변수입니다.
시그모이드 함수는 \( z \) 값이 무엇이든 \( p \) 값이 0과 1 사이에 유지되도록 합니다.
2) 로짓 형식(로그 오즈)
또 다른 매우 중요한 형태는 로짓 형태인데, 이는 확률의 로그값입니다.
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]
설명 :
– \( \frac{p}{1-p} \)는 확률(상대적 가능성)이라고 합니다.
– \( \ln \)은 자연로그입니다.
로짓 형식은 로지스틱 회귀 분석이 실제로 로그 오즈를 예측 변수의 선형 함수로 모델링한다는 것을 설명합니다. 이는 특히 오즈비의 맥락에서 계수를 해석하는 것을 더 명확하게 해줍니다.
확률과 확률비 이해하기
로지스틱 회귀 공식을 제대로 이해하려면 확률과 오즈를 구분해야 합니다.
– 확률(p): 사건이 발생할 가능성(0~1).
– 확률: 어떤 일이 일어날 확률과 일어나지 않을 확률의 비교:
\[
\text{배당률} = \frac{p}{1-p}
\]
예시: 만약 \( p = 0{,}8 \)이면 다음과 같습니다.
\[
확률 = \frac{0,}8}{0,}2} = 4
\]
이는 해당 사건이 발생할 확률이 발생하지 않을 확률보다 4배 더 높다는 것을 의미합니다.
로지스틱 회귀 분석에서 계수 \( \beta \)는 종종 오즈비로 해석됩니다.
\[
또는 = e^{\beta}
\]
– 만약 \( \beta > 0 \), 이면 \( e^{\beta} > 1 \): 예측 변수는 사건 발생 확률을 높입니다.
– 만약 \( \beta < 0 \)이면 \( e^{\beta} < 1 \): 예측 변수가 사건 발생 확률을 감소시킵니다. – 만약 \( \beta = 0 \)이면 \( e^{\beta} = 1 \): 확률에 아무런 영향을 미치지 않습니다. 예를 들어, \( \beta_1 = 0{,}7 \)이면 다음과 같습니다. \[ e^{0{,}7} \approx 2{,}01 \] 이는 \( X_1 \)이 1단위 증가할 때마다 사건 발생 확률이 약 2,01배 증가한다는 것을 의미합니다(다른 변수들이 일정하다고 가정할 때). 단순 로지스틱 회귀 모델의 예: 시험 합격 여부를 예측하기 위해 예측 변수 \( X \)가 하나만 있다고 가정해 보겠습니다. 예를 들어, 주당 공부 시간(합격 = 1, 불합격 = 0)을 사용합니다. 모델은 다음과 같습니다.