Voorbeeldvragen en discussie: Variantie en standaarddeviatie van individuele gegevens
Statistiek is een tak van de wiskunde die zich bezighoudt met het verzamelen, analyseren, interpreteren, presenteren en ordenen van gegevens. Twee belangrijke concepten in de statistiek zijn variantie en standaarddeviatie. In dit artikel wordt gedetailleerd besproken hoe de variantie en standaarddeviatie van een enkele dataset berekend kunnen worden aan de hand van verschillende voorbeelden.
Inzicht in variantie en standaarddeviatie
Variantie is een maat die kwantificeert hoe ver de getallen in een dataset van het gemiddelde afwijken. Variantie wordt uitgedrukt in kwadratische eenheden van de oorspronkelijke gegevens, waardoor de interpretatie ervan vaak lastig is.
De standaarddeviatie is de wortel van de variantie. Het geeft een meer intuïtieve maatstaf voor hoe ver de gegevens over het algemeen van het gemiddelde afwijken, omdat de eenheden ervan gelijk zijn aan de oorspronkelijke eenheden van de gegevens.
Algemene formule
Voor individuele gegevens is de formule voor de variantie \( \sigma^2 \) en de standaarddeviatie \( \sigma \) van de populatie als volgt:
1. Variantie (σ²):
\( \sigma^2 = \frac{1}{N} \sum_{i=1}^{N} (x_i – \mu)^2 \)
2. Standaardafwijking (σ):
\( \sigma = \sqrt{\frac{1}{N} \sum_{i=1}^{N} (x_i – \mu)^2} \)
Di mana:
– \( N \) is het aantal gegevens in de populatie.
– \( x_i \) is de i-de datawaarde.
– \( \mu \) is het gemiddelde van de gegevens.
Als we de variantie en de standaarddeviatie van de steekproef berekenen, wordt de bovenstaande formule enigszins aangepast:
1. Steekproefvariantie (s²):
\( s^2 = \frac{1}{n-1} \sum_{i=1}^{n} (x_i – \bar{x})^2 \)
2. Steekproefstandaarddeviatie (s):
\( s = \sqrt{\frac{1}{n-1} \sum_{i=1}^{n} (x_i – \bar{x})^2} \)
Di mana:
– \( n \) is het aantal gegevens in de steekproef.
– \( \bar{x} \) is het gemiddelde van de steekproef.
Voorbeeldvragen en discussie
Voorbeeldvraag 1:
Gegeven de volgende gegevens:
8, 10, 10, 10, 12, 14
Bereken de variantie en de standaardafwijking van de gegevens!
Oplossingsstappen:
1. Het gemiddelde berekenen \( \mu \):
\[
\mu = \frac{8 + 10 + 10 + 10 + 12 + 14}{6} = \frac{64}{6} = 10.67
\]
2. Bereken het verschil tussen de gegevens en het gemiddelde en kwadrateer dit vervolgens:
\[
(8 – 10.67)^2 = 7.1289
\]
\[
(10 – 10.67)^2 = 0.4489
\]
\[
(10 – 10.67)^2 = 0.4489
\]
\[
(10 – 10.67)^2 = 0.4489
\]
\[
(12 – 10.67)^2 = 1.7689
\]
\[
(14 – 10.67)^2 = 11.1089
\]
3. Alle kwadratische resultaten optellen:
\[
\som (x_i – \mu)^2 = 7.1289 + 0.4489 + 0.4489 + 0.4489 + 1.7689 + 11.1089 = 21.3534
\]
4. Het berekenen van de variantie (σ²) van populatiegegevens:
\[
\sigma^2 = \frac{21.3534}{6} = 3.559
\]
Opmerking: Aangezien deze gegevens bevolkingsgegevens betreffen, delen we door 6.
5. De standaardafwijking (σ) berekenen:
\[
\sigma = \sqrt{3.559} \approx 1.886
\]
De variantie van de gegevens is dus 3.559 en de standaardafwijking is 1.886.
Voorbeeldvraag 2:
Gegeven de volgende voorbeeldgegevens:
5, 6, 8, 9, 10, 11
Bereken de variantie en de standaardafwijking van de steekproef!
Oplossingsstappen:
1. Het gemiddelde berekenen \( \bar{x} \) :
\[
\bar{x} = \frac{5 + 6 + 8 + 9 + 10 + 11}{6} = \frac{49}{6} = 8.167
\]
2. Bereken het verschil tussen de gegevens en het gemiddelde en kwadrateer dit vervolgens:
\[
(5 – 8.167)^2 = 10.035
\]
\[
(6 – 8.167)^2 = 4.694
\]
\[
(8 – 8.167)^2 = 0.028
\]
\[
(9 – 8.167)^2 = 0.694
\]
\[
(10 – 8.167)^2 = 3.361
\]
\[
(11 – 8.167)^2 = 7.945
\]
3. Alle kwadratische resultaten optellen:
\[
\sum (x_i – \bar{x})^2 = 10.035 + 4.694 + 0.028 + 0.694 + 3.361 + 7.945 = 26.757
\]
4. Het berekenen van de steekproefvariantie (s²):
\[
s^2 = \frac{26.757}{5} = 5.351
\]
Opmerking: Omdat dit steekproefgegevens zijn, delen we door 5 (n-1).
5. Het berekenen van de standaarddeviatie (s):
\[
s = \sqrt{5.351} \approx 2.313
\]
De variantie van de steekproefgegevens is dus 5.351 en de standaardafwijking is 2.313.
conclusie
Het berekenen van de variantie en de standaarddeviatie is essentieel om te begrijpen hoe gespreid de gegevens binnen een bepaalde set zijn. De variantie geeft een theoretische maat voor de spreiding in kwadraten van de oorspronkelijke eenheden, terwijl de standaarddeviatie de spreiding interpreteert in termen van de oorspronkelijke eenheden van de gegevens, waardoor deze gemakkelijker te begrijpen is. In data-analyse worden deze twee maten vaak gebruikt om de variabiliteit van gegevens te beoordelen en statistische beslissingen te nemen.
Door de benodigde stappen en formules te begrijpen, kunnen we eenvoudig de variantie en standaarddeviatie berekenen voor diverse situaties die we tegenkomen bij het verzamelen en analyseren van gegevens. Hopelijk biedt dit artikel een dieper inzicht in de concepten van variantie en standaarddeviatie in afzonderlijke datasets.