Lineaarisen regression esimerkkikysymykset ja keskustelu
Lineaarinen regressio on tilastollinen menetelmä, jota käytetään kahden tai useamman muuttujan välisen suhteen määrittämiseen. Tätä menetelmää käytetään laajalti useilla aloilla, kuten taloustieteessä, liike-elämässä, yhteiskuntatieteissä ja luonnontieteissä. Tässä artikkelissa käsittelemme lineaarista regressiota ja sen laskemista sekä annamme useita esimerkkiongelmia selityksineen, jotka auttavat lukijoita ymmärtämään tätä käsitettä syvällisesti.
Lineaarisen regression ymmärtäminen
Lineaarinen regressio on analyyttinen menetelmä, jota käytetään mallintamaan yhden tai useamman riippumattoman muuttujan (ennustaja) ja riippuvan muuttujan (vasteen) välistä suhdetta. Yksinkertainen lineaarinen regressio sisältää yhden riippumattoman muuttujan ja yhden riippuvan muuttujan, kun taas monimutkainen lineaarinen regressio sisältää useamman kuin yhden riippumattoman muuttujan.
Yksinkertaisen lineaarisen regressiosuoran yhtälö on:
\[ Y = a + bX \]
Di mana:
– \(Y \) on riippuva muuttuja.
– \(X \) on riippumaton muuttuja.
– \(a \) on leikkauspiste, joka on Y:n arvo, kun X = 0.
– \(b \) on regressiokerroin eli kuinka paljon Y muuttuu, jos X muuttuu yhdellä yksiköllä.
Lineaarisen regression vaiheet
1. Datan kerääminen: Kerää ensin analysoitava data.
2. Piirrä data: Luo sirontakaavio nähdäksesi, onko muuttujien välillä lineaarinen suhde.
3. Laske regressiokerroin: Käytä pienimmän neliösumman menetelmää parhaan suoran määrittämiseen.
4. Mallin testaaminen: Testaa regressiokertoimien merkitsevyyttä t-testillä ja määritä R-neliöarvo nähdäksesi, kuinka hyvin malli sopii dataan.
Katso myös Soal ja Pembahasan
Esimerkkikysymys 1: Yksinkertainen lineaarinen regressio
Kysymys:
Tutkija haluaa selvittää opiskelutuntien määrän (X) ja opiskelijoiden koepisteiden (Y) välisen suhteen. Saadut tiedot ovat seuraavat:
| Opiskelutunnit (X) | Tenttipisteet (Y) |
|———————–|———————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
Tee näistä tiedoista lineaarinen regressioyhtälö!
Keskustelu:
1. Keskiarvon laskeminen:
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. Regressiokertoimen \(b \) laskeminen:
\[
b = \frac{\summa (X_i – ∫bar{X})(Y_i – ∫bar{Y})}{\summa (X_i – ∫bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum(X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = ∫frac{80}{26} ∫noin 3.08
\]
3. Leikkauspisteen \(a \) laskeminen:
\[
a = ∫bar{Y} – b ∫bar{X}
\]
\[
a = 80 – 3.08 kertaa 5 = 80 – 15.4 = 64.6
\]
4. Regressioyhtälö:
\[
Y = 64.6 + 3.08X
\]
Datan lineaarinen regressioyhtälö on siis \(Y = 64.6 + 3.08X \). Tämä tarkoittaa, että jokaisen lisäopiskelutunnin odotetaan nostavan testipisteitä 3.08 pisteellä.
Esimerkkikysymys 2: Mallitestaus ja tulkinta
Kysymys:
Jatkaen samoilla tiedoilla, laske R-neliö (R²) -arvo mitataksesi, kuinka hyvin malli sopii tietoihin. Testaa myös regressiokertoimen \(b \) merkitsevyys.
Keskustelu:
1. Laske neliöiden kokonaissumma (SST), regressioneliöiden summa (SSR) ja neliöiden virhesumma (SSE):
\[
SST = ∫(Y_i – ∫bar{Y})^2
\]
\[
SST = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = ∫(\hat{Y}_i – ∫bar{Y})^2
\]
Missä \( \hat{Y}_i \) on regressioyhtälön ennustettu arvo:
\[
∫\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
\bar{Y} = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
2. SSE:n laskeminen:
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
3. R-neliön laskeminen:
\[
R^2 = ∫\frac{SSR}{SST} = ∫\frac{149.8}{250} noin 0.6
\]
R-neliöarvo 0.6 osoittaa, että tämä malli selittää noin 60 % datan vaihtelusta. Tämä osoittaa, että regressiosuora sopii dataan melko hyvin.
4. Kertoimen \(b \) merkitsevyyden t-testi:
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = ∫qrt{\frac{SSE}{n-2}} / ∫qrt{\summa(X_i – ∫bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = ∫qrt{33.4} / ∫qrt{26} noin 1.13
\]
\[
t = ∫\frac{3.08}{1.13} ∫\noin 2.73
\]
Jos t-tilaston arvo on noin 2.73 ja käytämme yleistä merkitsevyyskynnystä (α = 0.05), vertaamme sitä t-taulukkoon. Esimerkiksi, jos df = 3, kriittinen t on noin 2.353. Tällöin t-havaittu > t-kriittinen, mikä osoittaa, että kerroin on merkitsevä.
Johtopäätös
Tässä artikkelissa olemme käsitelleet lineaarisen regression perusteet, regressiokertoimen ja leikkauspisteen laskemisen sekä tulosten tulkinnan esimerkkiongelmien avulla. Säännöllinen harjoittelu erilaisten tietojoukkojen kanssa on välttämätöntä, jotta menetelmän käyttö on sujuvaa. Lineaarinen regressio on arvokas työkalu data-analyysissä ja voi tarjota syvällistä tietoa muuttujien välisistä suhteista.