Jak vypočítat směrodatnou odchylku
Směrodatná odchylka je jedním z nejčastěji používaných statistických ukazatelů k určení, jak se data „odchylují“ od svého průměru. V reálném životě nám směrodatná odchylka pomáhá pochopit stabilitu nebo variabilitu jevu: například variabilitu výsledků testů, kolísání prodejů, rozdíly ve výšce a dokonce i rizika ve finančních datech. Čím menší je směrodatná odchylka, tím blíže jsou data průměru. Naopak velká směrodatná odchylka naznačuje, že data jsou daleko od průměru a mají vysokou variabilitu.
Tento článek se bude zabývat významem směrodatné odchylky, použitým vzorcem a kroky k jejímu ručnímu výpočtu pomocí snadno srozumitelných příkladů.
1. Definice směrodatné odchylky
Směrodatná odchylka je druhá odmocnina rozptylu. Samotný rozptyl je průměr druhých mocnin rozdílů mezi jednotlivými datovými body a průměrem. Proč používat druhou mocninu? Protože rozdíly mezi datovými body a průměrem mohou být buď záporné, nebo kladné. Pokud se sečtou přímo, záporné a kladné rozdíly se mohou vzájemně vyrušit, což vede k zavádějícím výsledkům. Umocněním rozdílů se všechny hodnoty stanou kladnými, což umožňuje přesnější měření rozdělení dat.
Jednoduše:
– Rozptyl = míra rozptylu v „druhých“ jednotkách.
– Směrodatná odchylka = míra rozptylu, která se vrátila k původním datovým jednotkám.
Příklad: pokud jsou data ve formě testových skóre (bodových jednotek), bude rozptyl v bodech, zatímco směrodatná odchylka bude opět v bodech, což usnadní interpretaci.
2. Standardní odchylka populace vs. vzorku
Před výpočtem je důležité vědět, jaký typ dat máte k dispozici:
1. Počet obyvatel: data zahrnují všechny členy, kteří mají být zkoumáni.
Vzorec pro výpočet směrodatné odchylky populace používá dělitel N (počet dat).
2. Výběr: data představují pouze část populace, obvykle se používají k reprezentaci větší populace.
Vzorec pro výpočet směrodatné odchylky vzorku používá dělitel (n − 1) k opravě zkreslení odhadu. Tato korekce se nazývá Besselova korekce.
V každodenní praxi (např. výzkum, průzkumy, analýza tříd) se data často považují za vzorek, takže dělitel je (n − 1).
3. Vzorec pro směrodatnou odchylku
A. Vzorec pro směrodatnou odchylku populace
Předpokládejme, že data: \( x_1, x_2, \dots, x_N \)
Průměrná populace:
\[
\mu = \frac{\sum_{i=1}^{N} x_i}{N}
\]
Rozptyl populace:
\[
σ² = (suma i=1 N)(x_i – μ)² N
\]
Směrodatná odchylka populace:
\[
σ = σ²
\]
B. Vzorec pro výpočet směrodatné odchylky
Průměr vzorku:
\[
\bar{x} = \frac{\suma_{i=1}^{n} x_i}{n}
\]
Rozptyl vzorku:
\[
s^2 = \frac{\suma_{i=1}^{n}(x_i – \bar{x})^2}{n – 1}
\]
Směrodatná odchylka vzorku:
\[
s = \sqrt{s^2}
\]
4. Kroky k ručnímu výpočtu směrodatné odchylky
Pro snazší pochopení použijeme příklad s výsledky zkoušek od 5 studentů:
Data: 60, 70, 70, 80, 90
Předpokládejme, že tato data jsou vzorek (běžné v příkladech učení).
Krok 1: Vypočítejte průměr
\[
\bar{x} = \frac{60 + 70 + 70 + 80 + 90}{5} = \frac{370}{5} = 74
\]
Průměrné skóre je tedy 74.
Krok 2: Vypočítejte rozdíl mezi jednotlivými údaji a průměrem
Vytvořte sloupec rozdílu \( (x_i – \bar{x}) \):
– 60 − 74 = −14
– 70 − 74 = −4
– 70 − 74 = −4
– 80 − 74 = 6
– 90 − 74 = 16
Krok 3: Umocněte rozdíl
Vypočítejte \( (x_i – \bar{x})^2 \):
– (−14)² = 196
– (−4)² = 16
– (−4)² = 16
– 6² = 36
– 16² = 256
Krok 4: Sečtěte druhé mocniny rozdílů
\[
\sum (x_i – \bar{x})^2 = 196 + 16 + 16 + 36 + 256 = 520
\]
Krok 5: Vypočítejte rozptyl (pro vzorek vydělte n − 1)
Protože n = 5, pak n − 1 = 4:
\[
s^2 = \frac{520}{4} = 130
\]
Takže rozptyl vzorku je 130.
Krok 6: Druhá odmocnina rozptylu pro získání směrodatné odchylky
\[
s = \sqrt{130} \approx 11{,}40
\]
Směrodatná odchylka dat je tedy přibližně 11,40. To znamená, že skóre studentů se v průměru odchyluje od průměru 74 asi o 11 bodů.
5. Rychlý způsob: Alternativní vzorec (výpočet)
Kromě výše uvedené manuální metody existuje výpočetní vzorec, který se často používá k urychlení výpočtů, zejména pokud je k dispozici velké množství dat:
Rozptyl vzorku:
\[
s^2 = \frac{\suma x_i^2 – \frac{(suma x_i)^2}{n}}{n – 1}
\]
Tento vzorec se vyhýbá výpočtu rozdílů jeden po druhém, ale stále vyžaduje přesnost při výpočtu součtu druhých mocnin dat.
Pro koncepční porozumění je však obvykle snazší a bezpečnější metoda krok za krokem (rozdíl → druhá mocnina → součet).
6. Interpretace směrodatné odchylky
Směrodatná odchylka se neomezuje pouze na čísla, ale musí být interpretována:
– Malá směrodatná odchylka: data jsou shlukována blízko průměru, variabilita je nízká, výsledky jsou konzistentnější.
– Velká směrodatná odchylka: data jsou rozptýlena daleko od průměru, vysoká variabilita, výsledky jsou méně konzistentní.
Předpokládejme například, že dvě třídy mají stejné průměrné skóre, 74. Pokud má třída A směrodatnou odchylku 5 a třída B směrodatnou odchylku 15, pak jsou skóre ve třídě A vyrovnanější a stabilnější. Třída B má větší variabilitu: některá jsou velmi nízká a některá velmi vysoká.
7. Časté chyby
Některé běžné chyby při výpočtu směrodatné odchylky:
1. Zapomněl jsem rozlišovat mezi vzorkem a populací, takže dělitel je špatný (N vs n − 1).
2. Chybný výpočet průměru, který má za následek chybu všech následujících kroků.
3. Zapomenutí umocnit rozdíl nebo chyba při odmocňování na konci.
4. Aritmetické chyby při sčítání nebo výpočtu druhých mocnin čísel.
Chybám lze předcházet vytvořením výpočetní tabulky a dvojitou kontrolou výsledků.
Zavírání
Výpočet směrodatné odchylky ve skutečnosti není složitý, pokud správně postupujete podle následujících kroků: vypočítejte průměr, najděte rozdíl mezi jednotlivými datovými sadami, umocněte rozdíly, sečtěte je, vydělte (n nebo n − 1) a poté odmocněte. Pochopením směrodatné odchylky můžete posoudit, jak konzistentní jsou vaše data a kolik mezi nimi existuje odchylek.
Pokud chcete, mohu také vytvořit další příklady s více daty, příklady seskupených dat (frekvenční tabulky) nebo návod, jak vypočítat směrodatnou odchylku pomocí Excelu/Google Tabulek.