Công thức hồi quy logistic

Công thức hồi quy logistic

Hồi quy logistic là một trong những phương pháp phổ biến nhất trong thống kê và khoa học dữ liệu để mô hình hóa mối quan hệ giữa một số biến độc lập (biến dự báo) và một biến phụ thuộc phân loại, đặc biệt là biến nhị phân (ví dụ: có/không, thành công/thất bại, ốm/khỏe). Không giống như hồi quy tuyến tính tạo ra các giá trị liên tục, hồi quy logistic được thiết kế để ước tính xác suất của một sự kiện, do đó kết quả cuối cùng nằm trong khoảng từ 0 đến 1. Trong bài viết này, chúng ta sẽ thảo luận về công thức hồi quy logistic, ý nghĩa của từng thành phần và cách diễn giải nó.

Tại sao cần sử dụng hồi quy logistic?

Nếu sử dụng hồi quy tuyến tính để dự đoán xác suất, mô hình có thể tạo ra các giá trị nhỏ hơn 0 hoặc lớn hơn 1, điều này rõ ràng là không hợp lý đối với xác suất. Hồi quy logistic giải quyết vấn đề này bằng cách sử dụng một hàm phi tuyến tính ánh xạ kết quả tính toán (có thể là bất kỳ giá trị nào) đến một giá trị xác suất nằm giữa 0 và 1. Hàm được sử dụng phổ biến nhất là hàm logistic hoặc hàm sigmoid.

Ví dụ, giả sử chúng ta muốn dự đoán liệu một khách hàng có rời bỏ dịch vụ hay không dựa trên tuổi tác, thời gian đăng ký và tần suất sử dụng của họ. Kết quả dự đoán chỉ có hai khả năng: rời bỏ dịch vụ (1) hoặc không rời bỏ dịch vụ (0). Hồi quy logistic rất phù hợp với loại tình huống này.

Công thức cơ bản cho hồi quy logistic

Bản chất của hồi quy logistic là mô hình hóa xác suất \( p \) rằng \( Y = 1 \) (sự kiện xảy ra), dựa trên giá trị của biến dự báo \( X \).

Các mô hình hồi quy logistic thường được viết dưới hai dạng quan trọng:

1) Dạng xác suất (Sigmoid)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

với

\[
z = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Thông tin:
– \( p \) là xác suất của sự kiện (ví dụ: tỷ lệ khách hàng rời bỏ = 1).
– \( e \) là số Euler (khoảng 2,71828).
– \( z \) là tổ hợp tuyến tính của các biến dự báo.
– \( \beta_0 \) là hệ số chặn (hằng số).
– \( \beta_1, \beta_2, \ldots, \beta_k \) là các hệ số hồi quy.
– \( X_1, X_2, \ldots, X_k \) là các biến độc lập.

Hàm sigmoid đảm bảo rằng bất kể giá trị của \( z \) là bao nhiêu, giá trị của \( p \) vẫn nằm giữa 0 và 1.

2) Dạng Logit (Logarit tỷ lệ cược)

Một dạng rất quan trọng khác là dạng logit, tức là logarit của tỷ lệ cược:

\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \cdots + \beta_k X_k
\]

Thông tin:
– \( \frac{p}{1-p} \) được gọi là xác suất (cơ hội tương đối).
– \( \ln \) là logarit tự nhiên.

Dạng logit giải thích rằng hồi quy logistic thực chất mô hình hóa logarit tỷ lệ cược như một hàm tuyến tính của các biến dự báo. Điều này giúp việc giải thích các hệ số trở nên rõ ràng hơn, đặc biệt là trong bối cảnh tỷ lệ chênh lệch.

Hiểu về Tỷ lệ cược và Tỷ số cược

Để thực sự hiểu công thức hồi quy logistic, chúng ta cần phân biệt giữa xác suất và tỷ lệ cược.

– Xác suất (p): khả năng xảy ra của một sự kiện (từ 0 đến 1).
– Tỷ lệ cược: so sánh xác suất xảy ra của một sự việc với xác suất không xảy ra của sự việc đó:

\[
\text{tỷ lệ cược} = \frac{p}{1-p}
\]

Ví dụ: nếu \( p = 0{,}8 \), thì:

\[
Tỷ lệ cược = 0,8/0,2 = 4
\]

Điều này có nghĩa là sự kiện đó có khả năng xảy ra cao gấp 4 lần so với khả năng không xảy ra.

Trong hồi quy logistic, hệ số \( \beta \) thường được diễn giải thông qua tỷ lệ chênh lệch (odds ratio):

\[
\text{HOẶC} = e^{\beta}
\]

– Nếu \( \beta > 0 \), thì \( e^{\beta} > 1 \): biến dự báo làm tăng xác suất xảy ra sự kiện.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Để lại bình luận