Exempel på en diskussionsfråga om determinationskoefficienten
Determinationskoefficienten (R²) är en viktig parameter i regressionsanalys och indikerar hur väl en regressionsmodell förklarar datas faktiska variabilitet. I den här artikeln kommer vi att förklara konceptet determinationskoefficient genom ett detaljerat exempel och en diskussion.
Grundläggande koncept för bestämningskoefficient
Determinationskoefficienten eller \(R^2 \) mäts på en skala från 0 till 1, där:
– \( R^2 = 0 \) indikerar att regressionsmodellen inte alls kan förklara datavariabiliteten.
– \( R^2 = 1 \) visar att regressionsmodellen kan förklara all variabilitet i data perfekt.
Grundformeln för att beräkna bestämningskoefficienten är:
\[ R^2 = 1 – \frac{SSR}{SST} \]
Din mana:
– SSR (Sum of Squared Residuals) är summan av kvadraterna av skillnaderna mellan de värden som förutspås av modellen och de faktiska värdena.
– SST (Total Sum of Squares) är summan av kvadratsumman av skillnaderna mellan det faktiska värdet och medelvärdet av de faktiska värdena.
Problem exempel
Låt oss diskutera ett exempelproblem för att förstå beräkningen av bestämningskoefficienten mer ingående.
Exempel på problem:
Antag att vi har data om antalet studietimmar (X) och provresultat (Y) för 10 studenter:
| Studenter | Studietimmar (X) | Examensresultat (Y) |
|——-|——————–|——————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |
Vi kommer att skapa en enkel linjär regressionsmodell där tentamensresultat (Y) förutsägs baserat på studietimmar (X).
Diskussion
1. Bygga en enkel linjär regressionsmodell
En enkel linjär regressionsmodell har formen:
[Y = a + bX]
Din mana:
– \(Y \) är det förutspådda testresultatet.
– \(X \) är antalet studietimmar.
– \(a \) är skärningspunkten (skärningspunkten på Y-axeln när X = 0).
– \(b \) är lutningen (regressionslinjens lutning).
För att beräkna parametrarna \(a \) och \(b \) använder vi följande formel:
[b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]
Där \(n \) är antalet data (i detta fall n = 10).
Från tabellen kan vi beräkna:
– \(\sum{X} = 36\)
– \(\sum{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\sum{Y^2} = 50428\)
– \(\sum{XY} = 2576\)
Låt oss beräkna b först:
[b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
[b = \frac{25760 – 25344}{1400 – 1296} \]
[b = \frac{416}{104} \]
\[b = 4 \]
Sedan beräknar vi:
[a = \frac{704 – 4(36)}{10} \]
[a = \frac{704 – 144}{10} \]
[a = 560/10]
\[ a = 56 \]
Så, den linjära regressionsmodellen vi får är:
\[Y = 56 + 4X \]
2. Beräkna det förutspådda värdet (Y')
Därefter beräknar vi det förutspådda värdet \(Y' \) för varje \(X \):
| Studenter | Studietimmar (X) | Examensresultat (Y) | Förväntat resultat (Y') |
|——-|——————–|——————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |
3. Beräkning av SSR och SST
Därefter beräknar vi SSR och SST för att få \( R^2 \).
SSR:
[SSR = \sum{(Y – Y')^2} \]
\[ SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
\[SSR = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
\[SSR = 454 \]
SST:
\[ SST = \sum{(Y – \bar{Y})^2} \]
Din mana:
[\bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]
\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
\[SST = 1107.44 \]
4. Beräkning av bestämningskoefficienten \( R^2 \):
\[ R^2 = 1 – \frac{SSR}{SST} \]
[R^2 = 1 – \frac{454}{1107.44} \]
\[ R^2 = 1 – 0.41 \]
\[ R^2 = 0.59 \]
slutsats
Från beräkningen ovan erhöll vi en determinationskoefficient (R2 = 0.59). Detta indikerar att den linjära regressionsmodellen vi skapade kan förklara ungefär 59 % av variationen i provresultat baserat på studietimmar. De återstående 41 % av variationen kan bero på andra faktorer som inte ingår i modellen.
Genom att förstå stegen och beräkningarna ovan kan vi se vikten av determinationskoefficienten för att bedöma hur väl regressionsmodellen vi bygger förklarar datas faktiska variabilitet. Det är ett mycket användbart verktyg vid statistisk analys och datamodellering.