Vähimruutude meetodi näide aruteluküsimustes
Väikseimate ruutude meetod (LEM) on statistiline meetod, mida kasutatakse andmete ennustamiseks kõige sobivama sirge leidmiseks. Seda meetodit kasutatakse sageli lineaarses regressioonianalüüsis sõltumatute ja sõltuvate muutujate vahelise seose tuvastamiseks. See artikkel käsitleb vähimruutude meetodi põhimõisteid koos näidete ja samm-sammult selgitustega, et paremini mõista selle meetodi toimimist.
Väikseimate ruutude meetodi põhimõisted
Väikseimate ruutude meetodi eesmärk on minimeerida vaadeldud väärtuste ja regressioonimudeli abil ennustatud väärtuste erinevuste ruutude summat. Lihtsa lineaarse regressioonisirge võrrandi saab kirjutada järgmiselt:
[y = a + bx]
Kus:
– y on sõltuv muutuja,
– η on sõltumatu muutuja,
– \(a \) on lõikepunkt (\(y \) väärtus, kui \(x = 0 \)),
– \(b \) on joone tõus (tõus ehk regressioonikordaja).
Väikseimate ruutude meetod hindab parameetreid \(a \) ja \(b \), mis minimeerivad järgmise funktsiooni:
\[ \text{SSE} = \sum_{i=1}^{n} (y_i – \hat{y_i})^2 \]
Kus SSE on ruutvigade summa, \(y_i \) on tegelik väärtus ja \(\hat{y_i} = a + bx_i \) on ennustatud väärtus.
Vähimruutude meetodi sammud
Mõiste selgitamiseks lahendame näidisülesande, mis hõlmab vähimruutude meetodi kasutamist.
Probleemide näide
Arvestades järgmisi andmeid:
| x (õppetunnid) | y (eksami tulemus) |
|———————–|———————–|
| 2 | 81 |
| 4 | 93 |
| 6 | 91 |
| 8 | 97 |
| 10 | 103 |
Määrake lineaarne regressioonijoon, mis sobib andmetega kõige paremini.
Arutelu
1. \( \bar{x} \) ja \( \bar{y} \) keskmise arvutamine
\[
\bar{x} = \frac{\sum x_i}{n} = \frac{2 + 4 + 6 + 8 + 10}{5} = 6
\]
\[
\bar{y} = \frac{\sum y_i}{n} = \frac{81 + 93 + 91 + 97 + 103}{5} = 93
\]
2. Parameetri \(b \) arvutamine (kalle)
Parameeter \(b \) arvutatakse järgmiselt:
\[
b = \frac{\summa (x_i – \bar{x})(y_i – \bar{y})}{\summa (x_i – \bar{x})^2}
\]
Iga komponendi arvutamine:
\[
\sum (x_i – \bar{x})(y_i – \bar{y}) = (2-6)(81-93) + (4-6)(93-93) + (6-6)(91-93) + (8-6)(97-93) + (10-6)(103-93)
\]
\[
= (-4)(-12) + (-2)(0) + (0)(-2) + (2)(4) + (4)(10)
\]
\[
= 48 + 0 + 0 + 8 + 40 = 96
\]
\[
\sum(x_i – \bar{x})^2 = (2-6)^2 + (4-6)^2 + (6-6)^2 + (8-6)^2 + (10-6)^2
\]
\[
= (-4)^2 + (-2)^2 + 0^2 + 2^2 + 4^2
\]
\[
= 16 + 4 + 0 + 4 + 16 = 40
\]
Seega:
\[
b = ∫frac{96}{40} = 2.4
\]
3. Parameetri \(a \) arvutamine (lõikepunkt)
Kasutades \( \bar{x} \) ja \( \bar{y} \) keskmist:
\[
a = ∫bar{y} – b∫bar{x} = 93 – 2.4 korda 6 = 93 – 14.4 = 78.6
\]
4. Regressioonisirge võrrandi kirjutamine
Leitud parameetrite abil saame kirjutada regressioonisirge võrrandi:
\[
y = 78.6 + 2.4x
\]
Tõlgendamine ja kontrollimine
Selle regressioonisirge sobivuse tagamiseks saame arvutada iga x jaoks algandmetes ennustatud y-väärtuse (\(\hat{y}\)) ja ruutvigade summa (SSE), et kinnitada ennustuse täpsust.
| x | y | \(\kübar{y}\) | \((y – \hat{y})^2\) |
|—|—-|————|———————–|
| 2 | 81 | 83.4 | (81-83.4)^2 = 5.76 |
| 4 | 93 | 88.2 | (93-88.2)^2 = 23.04|
| 6 | 91 | 93.0 | (91-93.0)^2 = 4.00 |
| 8 | 97 | 97.8 | (97-97.8)^2 = 0.64 |
|10 |103 |102.6 | (103-102.6)^2 = 0.16|
SSS:
\[
SSE = 5.76 + 23.04 + 4.00 + 0.64 + 0.16 = 33.6
\]
Suhteliselt väikese SSE korral võime järeldada, et vähimruutude meetodil saadud regressioonisirge sobib nende andmete jaoks hästi.
Järeldus
Väikseimate ruutude meetod on võimas statistilise analüüsi tööriist andmestiku parima sobivuse määramiseks, minimeerides hälvete ruudul põhinevat ennustusviga. Kasutades keskmise arvutamise, tõusu ja lõikepunkti hindamise ning regressioonisirge võrrandi kirjutamise ja kontrollimise samme, saame sõltumatute muutujate põhjal täpselt ennustada sõltuva muutuja väärtust.
Selle meetodi hea mõistmine on äärmiselt kasulik sellistes valdkondades nagu majandus, biostatistika, inseneriteadus ja sotsiaalteadused, kus regressioonanalüüsi sageli rakendatakse. See artikkel illustreerib konkreetsete näidetega selle metoodika olulisust ja kasulikkust andmeanalüüsis.