Formule de régression logistique

Formule de régression logistique

La régression logistique est l'une des méthodes les plus utilisées en statistique et en science des données pour modéliser la relation entre plusieurs variables indépendantes (prédicteurs) et une variable dépendante catégorielle, notamment binaire (par exemple, oui/non, succès/échec, malade/en bonne santé). Contrairement à la régression linéaire, qui produit des valeurs continues, la régression logistique vise à estimer la probabilité d'un événement ; le résultat final se situe donc entre 0 et 1. Dans cet article, nous aborderons la formule de la régression logistique, la signification de chaque composante et son interprétation.

Pourquoi la régression logistique est-elle nécessaire ?

Si l'on utilise la régression linéaire pour prédire des probabilités, le modèle peut produire des valeurs inférieures à 0 ou supérieures à 1, ce qui est manifestement aberrant pour des probabilités. La régression logistique remédie à ce problème en utilisant une fonction non linéaire qui associe au résultat calculé (qui peut prendre n'importe quelle valeur) une probabilité comprise entre 0 et 1. La fonction la plus couramment utilisée est la fonction logistique ou sigmoïde.

Par exemple, supposons que nous souhaitions prédire si un client va se désabonner en fonction de son âge, de la durée de son abonnement et de sa fréquence d'utilisation. Le résultat prédit ne comporte que deux possibilités : désabonnement (1) ou non-désabonnement (0). La régression logistique est parfaitement adaptée à ce type de situation.

Formule de base de la régression logistique

L'essence de la régression logistique est de modéliser la probabilité \( p \) que \( Y = 1 \) (l'événement se produit), étant donné la valeur de la variable prédictive \( X \).

Les modèles de régression logistique sont généralement écrits sous deux formes importantes :

1) Forme de probabilité (sigmoïde)

\[
p = P(Y=1 \mid X) = \frac{1}{1 + e^{-z}}
\]

roue complète

\[
z = β₀ + β₁X₁ + β₂X₂ + … + βₖXₖ
\]

Description:
– \( p \) est la probabilité de l'événement (par exemple : churn = 1).
– \( e \) est le nombre d'Euler (environ 2,71828).
– \( z \) est une combinaison linéaire de prédicteurs.
– \( \beta_0 \) est l'ordonnée à l'origine (constante).
– \( \beta_1, \beta_2, \ldots, \beta_k \) sont les coefficients de régression.
– \( X_1, X_2, \ldots, X_k \) sont des variables indépendantes.

La fonction sigmoïde garantit que quelle que soit la valeur de \( z \), la valeur de \( p \) reste entre 0 et 1.

2) Forme Logit (Log Odds)

Une autre forme très importante est la forme logit, qui est le logarithme des cotes :

\[
logit(p) = ln(p/(1-p)) = β₀ + β₁X₁ + β₂X₂ + … + βₖXₖ
\]

Description:
– \( \frac{p}{1-p} \) est appelé la cote (chance relative).
– \( \ln \) est le logarithme naturel.

La forme logit explique que la régression logistique modélise en réalité le logarithme des cotes comme une fonction linéaire des prédicteurs. Cela facilite l'interprétation des coefficients, notamment dans le contexte des rapports de cotes.

Comprendre les cotes et les rapports de cotes

Pour bien comprendre la formule de la régression logistique, il faut faire la distinction entre probabilité et cote.

– Probabilité \( p \): la chance qu'un événement se produise (0 à 1).
– Cotes : comparaison de la probabilité qu'un événement se produise à celle qu'il ne se produise pas :

\[
\text{cotes} = \frac{p}{1-p}
\]

Exemple : si \( p = 0{,}8 \), alors :

\[
cotes = \frac{0,8}{0,2} = 4
\]

Cela signifie que l'événement a 4 fois plus de chances de se produire que de ne pas se produire.

En régression logistique, le coefficient \( \beta \) est souvent interprété à travers le rapport de cotes :

\[
\text{OR} = e^{\beta}
\]

– Si \( \beta > 0 \), alors \( e^{\beta} > 1 \) : le prédicteur augmente les chances de l'événement.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian. - Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds. Misalnya, jika \( \beta_1 = 0{,}7 \), maka: \[ e^{0{,}7} \approx 2{,}01 \] Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap). Contoh Model Regresi Logistik Sederhana Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya: \[ \text{logit}(p) = \beta_0 + \beta_1 X \] Jika hasil estimasi: - \( \beta_0 = -4 \) - \( \beta_1 = 0{,}8 \) Maka: \[ z = -4 + 0{,}8X \] \[ p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}} \] Jika \( X = 6 \) jam belajar: \[ z = -4 + 0{,}8(6) = 0{,}8 \] \[ p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69 \] Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%. Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil? Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati. Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah: \[ L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)} \] Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung: \[ \ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right] \] Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik. Kelebihan dan Keterbatasan Regresi Logistik Kelebihan 1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan. 2. Interpretasi koefisien jelas melalui odds ratio. 3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal. Keterbatasan 1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas. 2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance). 3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul. Penutup Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah: \[ p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}} \] atau dalam bentuk logit: \[ \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k \] Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks. Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.

Laissez un commentaire