Eenvoudige lineaire regressieanalyse
Eenvoudige lineaire regressie is een statistische techniek die wordt gebruikt om de relatie tussen twee kwantitatieve variabelen te analyseren. De variabele die we proberen te voorspellen, wordt de afhankelijke of responsvariabele genoemd, terwijl de variabele die wordt gebruikt om de voorspelling te doen, de onafhankelijke of voorspellende variabele wordt genoemd. Bij eenvoudige lineaire regressie proberen we de beste rechte lijn te vinden die de relatie tussen deze twee variabelen beschrijft.
Basisbegrippen van eenvoudige lineaire regressie
Eenvoudige lineaire regressie is gebaseerd op de aanname dat er een lineair verband bestaat tussen de afhankelijke variabele \(Y\) en de onafhankelijke variabele \(X\). De algemene vorm van een eenvoudig lineair regressiemodel is:
\[ Y = \beta_0 + \beta_1 X + \epsilon \]
Di mana:
– \( Y \) is de afhankelijke variabele.
– \( X \) is de onafhankelijke variabele.
– \( \beta_0 \) is het snijpunt met de y-as, oftewel de waarde van \(Y\) wanneer \(X = 0\).
– \( \beta_1 \) is de helling of gradiënt, oftewel de gemiddelde verandering in \(Y\) voor elke eenheidsverandering in \(X\).
– \( \epsilon \) is de foutterm of restterm die de variabiliteit in \(Y\) vertegenwoordigt die niet door \(X\) kan worden verklaard.
Het doel van eenvoudige lineaire regressie is het schatten van de parameters \(\beta_0\) en \(\beta_1\), zodat het model gebruikt kan worden om de waarde van \(Y\) te voorspellen die hoort bij de waarde van \(X\).
Kleinste kwadratenmethode
Een van de meest gebruikte methoden voor het aanpassen van een eenvoudig lineair regressiemodel is de kleinste-kwadratenmethode. Deze methode heeft als doel de som van de kwadraten van de verticale afwijkingen tussen de werkelijke waarnemingen en de door het model voorspelde waarden te minimaliseren. Stel dat we n waarnemingen hebben, bestaande uit paren \((x_i, y_i)\) voor \(i = 1, 2, …, n\). De te minimaliseren functie is:
\[ S(\beta_0, \beta_1) = \sum_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]
Om de waarden van \(\beta_0\) en \(\beta_1\) te vinden die deze functie minimaliseren, nemen we de partiële afgeleiden van \(S(\beta_0, \beta_1)\) met betrekking tot elke parameter en stellen we deze afgeleiden gelijk aan nul. De wiskundige berekening kan als volgt worden vereenvoudigd:
\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]
\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]
Di mana:
– \(\bar{x}\) is het gemiddelde van \(X\)
– \(\bar{y}\) is het gemiddelde van \(Y\)
Nadat de parameters \(\beta_0\) en \(\beta_1\) zijn verkregen, kan een eenvoudig lineair regressiemodel worden gebruikt om de waarde van \(Y\) te voorspellen voor elke waarde van \(X\).
Aannames in eenvoudige lineaire regressie
Voor geldige en betrouwbare resultaten gaat eenvoudige lineaire regressie uit van een aantal aannames:
1. Lineariteit: De relatie tussen de afhankelijke variabele en de onafhankelijke variabele moet lineair zijn.
2. Onafhankelijkheid: De waarnemingen moeten onafhankelijk van elkaar zijn.
3. Homoscedasticiteit: De residuele variabiliteit moet constant zijn over het gehele bereik van waarden van de onafhankelijke variabele.
4. Normaliteit van de residuen: De residuen (fouten) moeten een normale verdeling volgen.
Als aan deze voorwaarden niet wordt voldaan, zullen de resultaten van een eenvoudig lineair regressiemodel onbetrouwbaar zijn en mogelijk geen nauwkeurige voorspellingen kunnen doen.
Beoordeling van het regressiemodel
Een manier om te beoordelen hoe goed een eenvoudig lineair regressiemodel heeft voorspeld, is door de determinatiecoëfficiënt (R²) te gebruiken. De determinatiecoëfficiënt geeft aan welk deel van de variabiliteit in de afhankelijke variabele kan worden verklaard door de variabiliteit in de onafhankelijke variabelen.
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
Di mana:
– \(\hat{y}_i\) is de voorspelde waarde van \(Y\).
– \(y_i\) is de werkelijke waarde van \(Y\).
– \(\bar{y}\) is het gemiddelde van de waarden van \(Y\).
De \(R^2\)-waarde varieert van 0 tot 1. Een \(R^2\)-waarde dicht bij 1 geeft aan dat het model het grootste deel van de variabiliteit in de afhankelijke variabele kan verklaren.
Implementatie in een programmeertaal
Om eenvoudige lineaire regressie te implementeren, kunnen we verschillende statistische softwareprogramma's of programmeertalen gebruiken. Hieronder volgt een voorbeeldimplementatie in Python met behulp van de `scikit-learn`-bibliotheek:
"`python'
numpy importeren als np
matplotlib.pyplot importeren als plt
van sklearn.linear_model import LinearRegression
van sklearn.metrics importeer mean_squared_error, r2_score
Data
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
Model
model = lineaire regressie ()
model.fit (X, y)
Voorspelling
y_pred = model.voorspelling (X)
Coëfficiënt
beta_0 = model.intercept_
beta_1 = model.coef_[0]
print(f'Intercept: {beta_0}')
print(f'Helling: {beta_1}')
print(f'Gemiddelde kwadratische fout: {mean_squared_error(y, y_pred)}')
print(f'Determinatiecoëfficiënt (R²): {r²_score(y, y_pred)}')
Gegevensgrafiek en regressielijn
plt.scatter(X, y, color='blue')
plt.plot(X, y_pred, color='red')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
''
In het bovenstaande voorbeeld importeren we eerst de benodigde bibliotheken, definiëren we de data \(X\) en \(Y\), en gebruiken we vervolgens het `LinearRegression`-object van `scikit-learn` om een model aan de data aan te passen. Zodra het model is aangepast, doen we voorspellingen en berekenen we de coëfficiënten, evenals de gemiddelde kwadratische fout en de determinatiecoëfficiënt. Ten slotte plotten we de data en de regressielijn.
conclusie
Eenvoudige lineaire regressie is een krachtig statistisch analyse-instrument dat gebruikt wordt om de relatie tussen twee kwantitatieve variabelen te verklaren. Met enkele basisaannames over lineariteit, onafhankelijkheid, homoscedasticiteit en normaliteit kunnen we de waarde van de afhankelijke variabele voorspellen op basis van de waarden van de onafhankelijke variabelen. De kleinste-kwadratenmethode biedt een effectieve manier om een regressielijn te schatten en optimale parameters te bepalen. Modelvalidatie aan de hand van de determinatiecoëfficiënt (R²) geeft inzicht in hoe goed ons model presteert.
Hoewel eenvoudige lineaire regressie beperkingen heeft, zoals het feit dat er slechts twee variabelen mee kunnen worden geanalyseerd en dat er aan bepaalde aannames moet worden voldaan, blijft deze techniek een belangrijke basis in de statistiek en data-analyse. Ze wordt vaak gebruikt als eerste stap om de relatie tussen variabelen te begrijpen voordat men overgaat op complexere methoden.