로지스틱 회귀 공식

로지스틱 회귀 공식

로지스틱 회귀는 통계 및 데이터 과학에서 여러 독립 변수(예측 변수)와 범주형 종속 변수, 특히 이진 변수(예: 예/아니오, 성공/실패, 질병/건강) 간의 관계를 모델링하는 데 가장 널리 사용되는 방법 중 하나입니다. 연속적인 값을 생성하는 선형 회귀와 달리, 로지스틱 회귀는 사건 발생 확률을 추정하도록 설계되었으므로 최종 결과는 0에서 1 사이의 값을 갖습니다. 이 글에서는 로지스틱 회귀 공식, 각 구성 요소의 의미, 그리고 해석 방법에 대해 살펴보겠습니다.

로지스틱 회귀 분석이 필요한 이유는 무엇일까요?

선형 회귀를 사용하여 확률을 예측할 경우, 모델이 0보다 작거나 1보다 큰 값을 생성할 수 있는데, 이는 확률 예측에 있어 명백히 부적절한 결과입니다. 로지스틱 회귀는 계산된 결과(임의의 값일 수 있음)를 0과 1 사이의 확률 값으로 매핑하는 비선형 함수를 사용하여 이러한 문제를 해결합니다. 가장 일반적으로 사용되는 함수는 로지스틱 함수 또는 시그모이드 함수입니다.

예를 들어, 고객의 나이, 구독 기간 및 사용 빈도를 기반으로 고객이 이탈할지 여부를 예측한다고 가정해 보겠습니다. 예측 결과는 이탈(1) 또는 이탈하지 않음(0)의 두 가지 가능성만 있습니다. 로지스틱 회귀는 이러한 유형의 상황에 적합합니다.

로지스틱 회귀 분석의 기본 공식

로지스틱 회귀 분석의 핵심은 예측 변수 \(X\)의 값이 주어졌을 때 \(Y=1\) (사건이 발생할 확률\(p\))을 모델링하는 것입니다.

로지스틱 회귀 모델은 일반적으로 두 가지 중요한 형태로 작성됩니다.

1) 확률 형태 (시그모이드)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

dengan

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

설명 :
– \( p \)는 사건의 확률입니다(예: 이탈 = 1).
– \( e \)는 오일러 상수(약 2,71828)입니다.
– \( z \)는 예측 변수의 선형 조합입니다.
– \( \beta_0 \)는 절편(상수)입니다.
– \( \beta_1, \beta_2, \ldots, \beta_k \)는 회귀 계수입니다.
– \( X_1, X_2, \ldots, X_k \)는 독립 변수입니다.

시그모이드 함수는 \( z \) 값이 무엇이든 \( p \) 값이 0과 1 사이에 유지되도록 합니다.

2) 로짓 형식(로그 오즈)

또 다른 매우 중요한 형태는 로짓 형태인데, 이는 확률의 로그값입니다.

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

설명 :
– \( \frac{p}{1-p} \)는 확률(상대적 가능성)이라고 합니다.
– \( \ln \)은 자연로그입니다.

로짓 형식은 로지스틱 회귀 분석이 실제로 로그 오즈를 예측 변수의 선형 함수로 모델링한다는 것을 설명합니다. 이는 특히 오즈비의 맥락에서 계수를 해석하는 것을 더 명확하게 해줍니다.

확률과 확률비 이해하기

로지스틱 회귀 공식을 제대로 이해하려면 확률과 오즈를 구분해야 합니다.

– 확률(p): 사건이 발생할 가능성(0~1).
– 확률: 어떤 일이 일어날 확률과 일어나지 않을 확률의 비교:

\[
\text{배당률} = \frac{p}{1-p}
\]

예시: 만약 \( p = 0{,}8 \)이면 다음과 같습니다.

\[
확률 = \frac{0,}8}{0,}2} = 4
\]

이는 해당 사건이 발생할 확률이 발생하지 않을 확률보다 4배 더 높다는 것을 의미합니다.

로지스틱 회귀 분석에서 계수 \( \beta \)는 종종 오즈비로 해석됩니다.

\[
또는 = e^{\beta}
\]

– 만약 \( \beta > 0 \), 이면 \( e^{\beta} > 1 \): 예측 변수는 사건 발생 확률을 높입니다.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

댓글을 남겨주세요