Voorbeeldvragen en discussie over lineaire regressie
Lineaire regressie is een statistische methode die wordt gebruikt om de relatie tussen twee of meer variabelen te bepalen. Deze methode wordt veelvuldig gebruikt in diverse vakgebieden, waaronder economie, bedrijfskunde, sociale wetenschappen en natuurwetenschappen. In dit artikel bespreken we lineaire regressie, hoe deze te berekenen is, en geven we een aantal voorbeeldopgaven met uitleg om lezers te helpen dit concept beter te begrijpen.
Lineaire regressie begrijpen
Lineaire regressie is een analytische methode die wordt gebruikt om de relatie tussen een of meer onafhankelijke variabelen (voorspellers) en een afhankelijke variabele (respons) te modelleren. Eenvoudige lineaire regressie omvat één onafhankelijke variabele en één afhankelijke variabele, terwijl meervoudige lineaire regressie meer dan één onafhankelijke variabele omvat.
De vergelijking van een eenvoudige lineaire regressielijn is:
\[ Y = a + bX \]
Di mana:
– \( Y \) is de afhankelijke variabele.
– \( X \) is de onafhankelijke variabele.
– \( a \) is het snijpunt met de y-as, oftewel de waarde van Y wanneer X = 0.
– \( b \) is de regressiecoëfficiënt, dat wil zeggen, hoeveel Y verandert als X met één eenheid verandert.
Stappen van lineaire regressie
1. Gegevens verzamelen: Verzamel eerst de gegevens die geanalyseerd moeten worden.
2. Gegevens plotten: Maak een spreidingsdiagram om te zien of er een lineair verband is tussen de variabelen.
3. Bereken de regressiecoëfficiënt: Gebruik de kleinste-kwadratenmethode om de beste lijn te bepalen.
4. Het model toetsen: Test de significantie van de regressiecoëfficiënten met een t-toets en bepaal de R-kwadraatwaarde om te zien hoe goed het model bij de gegevens past.
Voorbeeldvragen en discussie
Voorbeeldvraag 1: Eenvoudige lineaire regressie
Vraag:
Een onderzoeker wil de relatie weten tussen het aantal studie-uren (X) en de examenresultaten (Y) van studenten. De verkregen gegevens zijn als volgt:
| Studie-uren (X) | Examenresultaat (Y) |
|——————–|——————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
Maak een lineaire regressievergelijking op basis van deze gegevens!
Discussie:
1. Het gemiddelde berekenen:
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. Het berekenen van de regressiecoëfficiënt \( b \):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum (X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \approx 3.08
\]
3. Het snijpunt \( a \) berekenen:
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 × 5 = 80 – 15.4 = 64.6
\]
4. Regressievergelijking:
\[
Y = 64.6 + 3.08X
\]
De lineaire regressievergelijking voor de gegevens is dus \( Y = 64.6 + 3.08X \). Dit betekent dat voor elk extra uur studeren de toetsresultaten naar verwachting met 3.08 punten zullen stijgen.
Voorbeeldvraag 2: Modeltoets en interpretatie
Vraag:
Ga verder met dezelfde gegevens en bereken de R-kwadraatwaarde (R²) om te meten hoe goed het model bij de gegevens past. Test ook de significantie van de regressiecoëfficiënt \( b \).
Discussie:
1. Bereken de totale som van de kwadraten (SST), de regressiesom van de kwadraten (SSR) en de foutensom van de kwadraten (SSE):
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
SST = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \sum (\hat{Y}_i – \bar{Y})^2
\]
Waarbij \( \hat{Y}_i \) de voorspelde waarde van de regressievergelijking is:
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
\bar{Y} = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)² + (-9.16)² + (-4.0)² + 2.16² + 5.24² = 149.8
\]
2. Berekening van SSE:
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
3. Het berekenen van de R-kwadraatwaarde:
\[
R^2 = \frac{SSR}{SST} = \frac{149.8}{250} \approx 0.6
\]
Een R-kwadraatwaarde van 0.6 geeft aan dat dit model ongeveer 60% van de variatie in de gegevens verklaart. Dit betekent dat de regressielijn redelijk goed bij de gegevens past.
4. t-toets voor de significantie van de coëfficiënt \( b \):
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = \sqrt{33.4} / \sqrt{26} \approx 1.13
\]
\[
t = \frac{3.08}{1.13} \approx 2.73
\]
Met een t-statistiek van ongeveer 2.73, en we gebruiken een gangbare drempelwaarde voor significantie (α = 0.05), vergelijken we deze met de t-tabel. Bijvoorbeeld, voor df = 3 is de kritische t-waarde ongeveer 2.353. Dan geldt t-waargenomen > t-kritisch, wat aangeeft dat de coëfficiënt significant is.
conclusie
In dit artikel hebben we de basisprincipes van lineaire regressie behandeld, hoe je de regressiecoëfficiënt en het snijpunt berekent, en hoe je de resultaten interpreteert aan de hand van voorbeeldopgaven. Regelmatig oefenen met verschillende datasets is essentieel om deze methode goed onder de knie te krijgen. Lineaire regressie is een waardevol hulpmiddel bij data-analyse en kan diepgaande inzichten verschaffen in de relaties tussen variabelen.