Kako združiti podatke v intervale razredov
Združevanje podatkov v razredne intervale je ključni korak v opisni statistiki. Cilj je poenostaviti velike količine surovih podatkov, da jih je lažje brati, analizirati in predstaviti v tabelah frekvenčne porazdelitve ali histogramih. Ko so podatki preveč raznoliki in razpršeni, je pogosto težko razločiti vzorce. Razredni intervali organizirajo podatke v specifične vrednosti, kar nam omogoča jasnejše razumevanje porazdelitve podatkov, najpogosteje pojavljajočih se vrednosti in celo osrednje tendence.
Ta članek obravnava pomen razrednih intervalov, kdaj so potrebni, ter praktične korake za združevanje podatkov v razredne intervale s primeri uporabe.
1. Razumevanje intervalov razredov
Interval razreda je obseg vrednosti, ki se uporablja za združevanje podatkov v frekvenčni porazdelitvi. Vsak interval ima običajno spodnjo in zgornjo mejo. Na primer, interval 10–19 pomeni, da vsi podatki z vrednostmi med 10 in 19 spadajo v ta razred.
V tabeli porazdelitve frekvenc razredni intervali služijo kot "vsebniki" za podobne vrednosti. Zaradi tega so podatki bolj jedrnati kot pri naštevanju vseh vrednosti posebej. Razredni intervali so tudi osnova za ustvarjanje grafov, kot so histogrami in frekvenčni poligoni.
2. Kdaj je treba podatke združiti?
Ni treba, da so vsi podatki razdeljeni v intervale razredov. Združevanje je običajno potrebno, kadar:
1. Velika količina podatkov, na primer več kot 30 ali 50 opazovanj.
2. Razpon podatkov je širok, zato so vrednosti razpršene in težko berljive.
3. Želimo videti vzorec porazdelitve, na primer ugotoviti, ali so podatki nagnjeni k normalnim, poševnim ali imajo dvojne vrhove.
4. Podatki bodo predstavljeni v histogramu, ker histogram zahteva intervalne razrede.
Če je podatkov malo (npr. 10 vrednosti), pogosto zadostuje ena sama frekvenčna tabela brez intervalov.
3. Koraki za združevanje podatkov v intervale razredov
Sledijo najpogosteje uporabljeni koraki za oblikovanje intervalov med razredi.
1. korak: Določite minimalne in maksimalne podatke
Najprej določite najmanjšo (minimalno) in največjo (maksimalno) vrednost podatkov.
– Minimalna vrednost = \( x_{\min} \)
– Največja vrednost = \( x_{\max} \)
Ta vrednost bo uporabljena za izračun obsega podatkov.
2. korak: Izračunajte obseg
Razpon je razlika med največjo in najmanjšo vrednostjo:
\[
R = x_{max} – x_{min}
\]
Obseg daje predstavo o širini porazdelitve podatkov.
3. korak: Določite število razredov (k)
Število razredov je mogoče določiti na več načinov. Najbolj priljubljen način je uporaba Sturgesovega pravila:
\[
k = 1 + 3{,}3 log_{10}(n)
\]
kjer je \(n \) količina podatkov.
Rezultati izračuna so običajno zaokroženi na najbližje celo število (ali navzgor), tako da število razredov ni premajhno.
Poleg Sturgesa obstaja še ena običajna praksa: izberite velikost razreda med 5 in 12, odvisno od vaših potreb po vizualizaciji in velikosti vzorca. Vendar pa je Sturges precej dober za manjše nabore podatkov.
4. korak: Izračunajte širino razreda (i)
Širina razreda je dolžina vsakega intervala razreda. Formula je:
\[
i = \frac{R}{k}
\]
Ker morajo biti širine razredov enostavne za uporabo, se običajno zaokrožijo na »čisto« število (npr. 5, 10, 2 ali 0,5, odvisno od konteksta podatkov). To zaokroževanje je pomembno za zagotovitev enostavne branja intervalov in preprečevanje zmede.
Če rezultati zaokroževanja preprečujejo vključitev vseh podatkov, se lahko širina razreda nekoliko poveča.
5. korak: Določite omejitve razreda
Začnite z minimalno vrednostjo kot spodnjo mejo prvega razreda. Nato ustvarite zaporedne intervale, dokler ne zajamejo maksimalne vrednosti.
Na primer, če je minimalna vrednost 32 in je širina razreda 5, potem je mogoče razred ustvariti:
– 32–36
– 37–41
– 42–46
- itd.
Pomembno: Prepričajte se, da med razredi ni vrzeli ali prekrivanj. Vse podatkovne vrednosti morajo spadati v natanko en razred.
6. korak: (neobvezno) Ustvarite meje razreda
Če so podatki cela števila (npr. rezultati testov), se pogosto ustvarijo meje razredov, da je razred neprekinjen. To se doseže tako, da se zgornji meji doda 0,5, spodnji meji pa se odšteje 0,5.
Na primer, razred 32–36, rob razreda postane:
– 31,5–36,5
To je uporabno za histograme, saj se stolpci povezujejo brez vrzeli.
7. korak: Izračunajte pogostost vsakega razreda
Ko so intervali razredov določeni, preštejte, koliko podatkovnih točk spada v vsak interval. Rezultate zapišite v stolpec s frekvencami (f).
Za velike količine podatkov uporabite metodo štetja, da boste hitrejši in zmanjšate število napak.
8. korak: Izdelava tabele porazdelitve frekvenc
Tabela porazdelitve minimalnih frekvenc vsebuje:
– Interval med poukom
– Frekvenca (f)
Dodate lahko tudi druge stolpce, kot so:
– Srednja točka razreda (xi)
– Kumulativna frekvenca
– Relativna pogostost (v odstotkih)
4. Primer združevanja podatkov
Na primer, obstajajo podatki o rezultatih testov 40 študentov z minimalnim rezultatom 42 in maksimalnim rezultatom 94.
1. Najmanj = 42, največ = 94
2. Razpon:
\[
R = 94 – 42 = 52
\]
3. Število razredov (Sturges):
\[
k = 1 + 3{,}3 \log(40)
\približno 1 + 3{,}3(1{,}602)
približno 6{,}29
\]
Zaokroženo na 6 ali 7 razredov. Za več podrobnosti smo izbrali 7 razredov.
4. Širina razreda:
\[
i = \frac{52}{7} \približno 7{,}43
\]
Zaokroženo na 8.
5. Oblikujte intervale, začenši od 42 s širino 8:
– 42–49
– 50–57
– 58–65
– 66–73
– 74–81
– 82–89
– 90–97
Zadnji interval je dosegel 97, tako da je bila najvišja vrednost 94 še vedno upoštevana.
6. Nato na podlagi podatkov izračunajte pogostost vsakega intervala (na primer z uporabo črte). Končna tabela bo prikazala, koliko učencev se uvršča v določen razpon rezultatov, kar nam bo omogočilo hitro oceno uspešnosti.
5. Nasveti za učinkovitejše odmore med poukom
1. Za lažjo primerjavo tabel uporabite dosledne širine razredov.
2. Ne imejte preveč razredov, ker bo tabela postala dolga in težko berljiva.
3. Ne imejte premalo razredov, saj se lahko pomembne informacije »izgubijo« in porazdelitev je lahko videti pregroba.
4. Prilagodite zaokroževanje širine razreda kontekstu podatkov. Za temperature je lahko ustrezna vrednost 1 ali 0,5; za rezultate testov je običajno ustrezna vrednost 5 ali 10.
5. Dvakrat preverite meje razredov, da zagotovite, da so vneseni vsi podatki brez manjkajočih vrednosti.
Zaključek
Združevanje podatkov v razredne intervale je pomembna tehnika za poenostavitev podatkov in jasen prikaz porazdelitve. Koraki vključujejo določitev minimalnih in maksimalnih vrednosti, izračun obsega, določitev števila razredov (pogosto z uporabo Sturgesovega pravila), izračun širine razredov, konstruiranje intervalov in nato izračun frekvence vsakega razreda. S pravimi razrednimi intervali je mogoče kompleksne surove podatke pretvoriti v lahko razumljive informacije, bodisi v tabelah bodisi v grafih.
Če želite, lahko ustvarim tudi celoten primer s surovimi podatki (seznam vrednosti) in nato sestavim tabelo porazdelitve frekvenc s histogramom.