Kako izračunati varijansu
Varijanca je statistička mjera koja predstavlja stepen rasprostranjenosti u skupu podataka. Ona pokazuje koliko pojedinačne tačke podataka odstupaju od srednje (prosječne vrijednosti) skupa podataka. Razumijevanje varijanse je ključno za statističku analizu, jer može otkriti konzistentnost i pouzdanost skupa podataka. Bez obzira da li ste student, istraživač ili analitičar podataka, razumijevanje koncepta varijanse i znanje kako je izračunati je neophodno. Ovaj članak vas vodi kroz šta je varijanca, njen značaj i detaljan postupak za izračunavanje varijanse i za uzorak i za populaciju.
Razumijevanje varijanse
Za početak, definirajmo nekoliko bitnih pojmova povezanih s varijansom:
– Srednja vrijednost (μ ili x̄): Prosjek podataka.
– Devijacija: Razlika između svake podatkovne tačke i srednje vrijednosti.
– Kvadratno odstupanje: Kvadratno odstupanje svake podatkovne tačke, kako bi se eliminisale negativne vrijednosti.
– Varijanca (σ² ili s²): Prosjek ovih kvadratnih odstupanja.
Važnost varijanse
Varijanca služi nekoliko svrha u statistici:
1. Indikator disperzije: Dok srednja vrijednost pruža centralnu figuru, varijanca pokazuje koliko su brojevi raspršeni oko srednje vrijednosti.
2. Procjena rizika: U finansijama, veća varijansa često označava veći rizik jer su prinosi od imovine raspršeniji.
3. Kontrola kvaliteta: U proizvodnji se varijanca koristi kako bi se osiguralo da proizvodi ispunjavaju određene standarde kvaliteta praćenjem konzistentnosti.
4. Testiranje hipoteza: Varijanca je ključna komponenta u raznim statističkim testovima, kao što su t-testovi i ANOVA.
Izračunavanje varijanse za populaciju
Kada se radi o kompletnom skupu podataka, izračunavate varijansu populacije.
Koraci za izračunavanje varijanse populacije:
1. Pronađite srednju vrijednost: Sumirajte sve podatkovne tačke i podijelite s brojem podatkovnih tačaka.
2. Izračunajte odstupanja: Od svake podatkovne tačke oduzmite srednju vrijednost da biste dobili odstupanje.
3. Kvadrirajte odstupanja: Kvadrirajte svako odstupanje da biste sve vrijednosti učinili pozitivnim.
4. Sabirajte kvadratna odstupanja: Saberite sva kvadratna odstupanja.
5. Izračunajte varijansu: Podijelite ukupan broj s brojem podataka (N).
Formula:
\[ \sigma^2 = \frac{\suma (x_i – \mu)^2}{N} \]
Primjer:
Razmotrimo skup podataka [2, 4, 4, 4, 5, 5, 7, 9].
– Srednja (μ) = (2+4+4+4+5+5+7+9) / 8 = 5
– Odstupanja: [2-5, 4-5, 4-5, 4-5, 5-5, 5-5, 7-5, 9-5] = [-3, -1, -1, -1, 0, 0, 2, 4]
– Kvadratne devijacije: [9, 1, 1, 1, 0, 0, 4, 16]
– Zbir kvadratnih odstupanja: 9+1+1+1+0+0+4+16 = 32
– Varijanca (σ²) = 32 / 8 = 4
Izračunavanje varijanse za uzorak
Kada imate podskup podataka iz veće populacije, imate posla s varijansom uzorka. Formula se prilagođava reprezentaciji uzorka za cijelu populaciju korištenjem \( N-1 \) umjesto \( N \).
Koraci za izračunavanje varijanse uzorka:
1. Pronalaženje srednje vrijednosti uzorka: Sumiranje svih podataka uzorka i dijeljenje s brojem podataka uzorka.
2. Izračunajte odstupanja: Oduzmite srednju vrijednost uzorka od svake podatkovne tačke.
3. Kvadrirajte odstupanja: Kvadrirajte svako odstupanje.
4. Sumirajte kvadratna odstupanja: Sumirajte sva kvadratna odstupanja.
5. Izračunajte varijansu: Podijelite ukupan broj s brojem podataka minus jedan (N-1).
Formula:
\[s^2 = \frac{\suma (x_i – \bar{x})^2}{N-1} \]
Primjer:
Razmotrimo uzorak skupa podataka [3, 7, 7, 19].
– Prosjek uzorka (x̄) = (3+7+7+19) / 4 = 9
– Odstupanja: [3-9, 7-9, 7-9, 19-9] = [-6, -2, -2, 10]
– Kvadratne devijacije: [36, 4, 4, 100]
– Zbir kvadratnih odstupanja: 36 + 4 + 4 + 100 = 144
– Varijanca (s²) = 144 / (4-1) = 144 / 3 = 48
Interpretacija varijanse
Visoka varijanca ukazuje na to da su podatkovne tačke više udaljene od srednje vrijednosti, dok niska varijanca znači da su bliže srednjoj vrijednosti. Međutim, varijansu nije uvijek lako direktno interpretirati jer je u kvadratnim jedinicama. Da bismo se vratili na originalne jedinice podataka, često uzimamo kvadratni korijen varijanse, što nam daje standardnu devijaciju (σ ili s).
Standardna devijacija:
\[ \sigma = \sqrt{\sigma^2} \]
\[s = \sqrt{s^2} \]
U našem gornjem primjeru populacije, standardna devijacija bi bila:
\[ \sigma = \sqrt{4} = 2 \]
Uobičajene greške koje treba izbjegavati
1. Zbunjujuće formule za populaciju i uzorak: Zapamtite da varijansa populacije koristi \( N \), dok varijansa uzorka koristi \( N-1 \).
2. Zanemarivanje koraka kvadriranja: Kvadriranje odstupanja je ključno za uklanjanje negativnih vrijednosti.
3. Zaboravljanje primjene srednje vrijednosti: Odstupanja se uvijek izračunavaju od srednje vrijednosti.
Alati i softver
Iako je ručno izračunavanje varijanse odlično za razumijevanje koncepta, u praksi možete koristiti softver poput Microsoft Excela, Pythona, R-a ili specijalizirane statističke alate koji mogu brzo izračunati varijansu:
– Excel: Koristite `VAR.P()` za varijansu populacije i `VAR.S()` za varijansu uzorka.
– Python: Koristite `numpy.var()` za varijansu populacije i postavite parametar `ddof=1` za varijansu uzorka.
– R: Koristite `var()` za varijansu uzorka. Za varijansu populacije, rezultat pomnožite sa `(N-1)/N`.
zaključak
Razumijevanje i izračunavanje varijanse je fundamentalno za svakoga ko se bavi analizom podataka. To vam daje uvid u rasprostranjenost podataka i predstavlja odskočnu dasku za složenije statističke analize. Slijedeći navedene korake i izbjegavajući uobičajene greške, možete precizno izračunati i interpretirati varijansu, pružajući tako robusne statističke uvide.