Logistinen regressiokaava
Logistinen regressio on yksi tilastotieteen ja datatieteen suosituimmista menetelmistä mallintaa useiden riippumattomien muuttujien (ennustajien) ja kategorisen riippuvan muuttujan, erityisesti binäärisen (esim. kyllä/ei, onnistuminen/epäonnistuminen, sairas/terve), välistä suhdetta. Toisin kuin lineaarinen regressio, joka tuottaa jatkuvia arvoja, logistinen regressio on suunniteltu arvioimaan tapahtuman todennäköisyyttä, joten lopputulos on välillä 0-1. Tässä artikkelissa käsittelemme logistisen regression kaavaa, kunkin komponentin merkitystä ja tulkintaa.
Miksi logistista regressiota tarvitaan?
Jos todennäköisyyksien ennustamiseen käytetään lineaarista regressiota, malli voi tuottaa arvoja, jotka ovat alle 0:n tai yli 1:n, mikä on selvästi kohtuutonta todennäköisyyden kannalta. Logistinen regressio ratkaisee tämän ongelman käyttämällä epälineaarista funktiota, joka kuvaa lasketun tuloksen (joka voi olla mikä tahansa arvo) todennäköisyysarvoon välillä 0 ja 1. Yleisimmin käytetty funktio on logistinen eli sigmoidifunktio.
Oletetaan esimerkiksi, että haluamme ennustaa asiakkaan vaihtuvuutta iän, tilausajan pituuden ja käyttötiheyden perusteella. Ennustetulla tuloksella on vain kaksi vaihtoehtoa: vaihtuvuus (1) tai ei vaihtuvuutta (0). Logistinen regressio sopii hyvin tällaiseen tilanteeseen.
Logistisen regression peruskaava
Logistisen regression ydin on mallintaa todennäköisyyttä \( p \), että \( Y = 1 \) (tapahtuma tapahtuu), annettuna ennustava muuttujan \( X \) arvo.
Logistiset regressiomallit kirjoitetaan yleensä kahdessa tärkeässä muodossa:
1) Todennäköisyysmuoto (sigmoidinen)
\[
p = P(Y=1 ∫X) = ∫(1 + e^{-z)}
\]
kanssa
\[
z = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k
\]
Tiedot:
– \(p \) on tapahtuman todennäköisyys (esim.: asiakasvaihtuvuus = 1).
– \(e \) on Eulerin luku (noin 2,71828).
– \(z \) on ennustajien lineaarinen yhdistelmä.
– \( \beta_0 \) on leikkauspiste (vakio).
– \( \beta_1, \beta_2, \ldots, \beta_k \) ovat regressiokertoimet.
– \(X_1, X_2, \ldots, X_k \) ovat riippumattomia muuttujia.
Sigmoidifunktio varmistaa, että \(z \):n arvosta riippumatta \(p \) pysyy välillä 0 ja 1.
2) Logit-lomake (logaritmikertoimet)
Toinen erittäin tärkeä muoto on logit-muoto, joka on kertoimien logaritmi:
\[
\text{logit}(p) = \ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k
\]
Tiedot:
– \( \frac{p}{1-p} \) kutsutaan todennäköisyydeksi (suhteelliseksi sattumaksi).
– \( \ln \) on luonnollinen logaritmi.
Logit-muoto selittää, että logistinen regressio mallintaa log-kertoimia ennustavien tekijöiden lineaarisena funktiona. Tämä selkeyttää kertoimien tulkintaa, erityisesti kerroinsuhteiden yhteydessä.
Kertoimien ja kertoimien suhteiden ymmärtäminen
Jotta logistisen regression kaavaa todella ymmärtäisimme, meidän on erotettava toisistaan todennäköisyys ja kertoimet.
– Todennäköisyys \(p \): tapahtuman todennäköisyys (0–1).
– Todennäköisyydet: jonkin tapahtuman todennäköisyyden ja tapahtumattomuuden vertailu:
\[
\text{odds} = \frac{p}{1-p}
\]
Esimerkki: jos \(p = 0{,}8 \), niin:
\[
\text{odds} = \frac{0{,}8}{0{,}2} = 4
\]
Tämä tarkoittaa, että tapahtuman todennäköisyys on neljä kertaa suurempi kuin sen toteutumatta jättäminen.
Logistisessa regressiossa kerroin \( \beta \) tulkitaan usein ristitulosuhteen kautta:
\[
\text{TAI} = e^{\beta}
\]
– Jos \( \beta > 0 \), niin \( e^{\beta} > 1 \): ennustaja lisää tapahtuman todennäköisyyttä.
– Jika \( \beta < 0 \), maka \( e^{\beta} < 1 \): prediktor menurunkan odds kejadian.
- Jika \( \beta = 0 \), maka \( e^{\beta} = 1 \): tidak ada pengaruh terhadap odds.
Misalnya, jika \( \beta_1 = 0{,}7 \), maka:
\[
e^{0{,}7} \approx 2{,}01
\]
Artinya, setiap kenaikan 1 satuan \( X_1 \) akan mengalikan odds kejadian sekitar 2,01 kali (dengan asumsi variabel lain tetap).
Contoh Model Regresi Logistik Sederhana
Misalkan kita hanya punya satu variabel prediktor \( X \), misalnya jumlah jam belajar per minggu, untuk memprediksi kelulusan ujian (lulus = 1, tidak lulus = 0). Modelnya:
\[
\text{logit}(p) = \beta_0 + \beta_1 X
\]
Jika hasil estimasi:
- \( \beta_0 = -4 \)
- \( \beta_1 = 0{,}8 \)
Maka:
\[
z = -4 + 0{,}8X
\]
\[
p = \frac{1}{1 + e^{-(-4 + 0{,}8X)}} = \frac{1}{1 + e^{4 - 0{,}8X}}
\]
Jika \( X = 6 \) jam belajar:
\[
z = -4 + 0{,}8(6) = 0{,}8
\]
\[
p = \frac{1}{1 + e^{-0{,}8}} \approx 0{,}69
\]
Interpretasi: dengan 6 jam belajar per minggu, probabilitas lulus sekitar 69%.
Estimasi Koefisien: Mengapa Bukan Metode Kuadrat Terkecil?
Pada regresi linear, koefisien sering dihitung dengan metode kuadrat terkecil (least squares). Namun pada regresi logistik, hubungan antara prediktor dan probabilitas bersifat non-linear, sehingga pendekatan kuadrat terkecil tidak ideal. Regresi logistik umumnya menggunakan Maximum Likelihood Estimation (MLE) untuk mencari nilai koefisien \( \beta \) yang memaksimalkan kemungkinan data yang diamati.
Secara ringkas, likelihood untuk pengamatan biner \( y_i \in \{0,1\} \) dan prediksi \( p_i \) adalah:
\[
L(\beta) = \prod_{i=1}^{n} p_i^{y_i}(1-p_i)^{(1-y_i)}
\]
Kemudian sering diubah menjadi log-likelihood agar lebih mudah dihitung:
\[
\ell(\beta) = \sum_{i=1}^{n} \left[ y_i \ln(p_i) + (1-y_i)\ln(1-p_i) \right]
\]
Nilai \( \beta \) dipilih untuk memaksimalkan \( \ell(\beta) \). Metode numerik seperti Newton-Raphson atau gradient descent sering digunakan oleh perangkat lunak statistik.
Kelebihan dan Keterbatasan Regresi Logistik
Kelebihan
1. Hasil berupa probabilitas sehingga mudah diterjemahkan menjadi keputusan.
2. Interpretasi koefisien jelas melalui odds ratio.
3. Cocok untuk masalah klasifikasi biner dan dapat diperluas ke multinomial/ordinal.
Keterbatasan
1. Mengasumsikan hubungan linear antara prediktor dan log odds , bukan langsung ke probabilitas.
2. Bisa bermasalah jika ada multikolinearitas atau data sangat tidak seimbang (imbalance).
3. Untuk pola hubungan yang sangat kompleks, metode non-linear lain (misalnya random forest atau neural network) bisa lebih unggul.
Penutup
Rumus regresi logistik pada dasarnya memadukan kombinasi linear dari variabel prediktor dengan fungsi sigmoid untuk menghasilkan probabilitas. Bentuk yang paling umum adalah:
\[
p = \frac{1}{1 + e^{-(\beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k)}}
\]
atau dalam bentuk logit:
\[
\ln\left(\frac{p}{1-p}\right) = \beta_0 + \beta_1 X_1 + \cdots + \beta_k X_k
\]
Dengan memahami kedua bentuk rumus ini, kita dapat membangun model prediksi untuk berbagai masalah klasifikasi biner sekaligus menafsirkan pengaruh variabel melalui odds ratio \( e^{\beta} \). Regresi logistik tetap menjadi fondasi penting dalam analisis data karena sederhana, kuat, dan interpretatif—serta sering menjadi langkah awal sebelum mencoba model yang lebih kompleks.
Jika Anda ingin, saya bisa menambahkan contoh perhitungan dengan data kecil (tabel), atau contoh implementasi regresi logistik di Python/R beserta interpretasi outputnya.