Kā grupēt datus klases intervālos

Kā grupēt datus klases intervālos

Datu grupēšana klašu intervālos ir izšķirošs solis aprakstošajā statistikā. Mērķis ir vienkāršot lielu neapstrādātu datu apjomu, lai tos būtu vieglāk lasīt, analizēt un attēlot frekvenču sadalījuma tabulās vai histogrammās. Ja dati ir pārāk daudzveidīgi un izkliedēti, bieži vien ir grūti saskatīt modeļus. Klašu intervāli sakārto datus noteiktās vērtību grupās, ļaujot mums skaidrāk izprast datu sadalījumu, visbiežāk sastopamās vērtības un pat centrālo tendenci.

Šajā rakstā ir aplūkota klašu intervālu nozīme, kad tie ir nepieciešami, kā arī praktiski soļi datu grupēšanai klašu intervālos, ieskaitot lietojumprogrammu piemērus.

1. Klases intervālu izpratne

Klases intervāls ir vērtību diapazons, ko izmanto, lai grupētu datus frekvenču sadalījumā. Katram intervālam parasti ir apakšējā un augšējā robeža. Piemēram, intervāls no 10 līdz 19 norāda, ka visi dati ar vērtībām no 10 līdz 19 ietilpst šajā klasē.

Frekvences sadalījuma tabulā klašu intervāli kalpo kā "konteineri" līdzīgām vērtībām. Tas padara datus kodolīgākus nekā visu vērtību uzskaitīšana atsevišķi. Klašu intervāli veido arī pamatu tādu grafiku kā histogrammu un frekvenču daudzstūru veidošanai.

2. Kad dati ir jāgrupē?

Nav nepieciešams sadalīt visus datus klašu intervālos. Grupēšana parasti ir nepieciešama, ja:

1. Liels datu apjoms, piemēram, vairāk nekā 30 vai 50 novērojumu.
2. Datu diapazons ir plašs, tāpēc vērtības ir izkliedētas un grūti lasāmas.
3. Mēs vēlamies redzēt sadalījuma modeli, piemēram, lai noskaidrotu, vai dati mēdz būt normāli, sašķiebti vai tiem ir dubulti pīķi.
4. Dati tiks attēloti histogrammā, jo histogrammai ir nepieciešamas intervālu klases.

Ja datu apjoms ir neliels (piemēram, 10 vērtības), bieži vien pietiek ar vienu frekvenču tabulu bez intervāliem.

3. Datu grupēšanas klašu intervālos darbības

Tālāk ir norādītas visbiežāk izmantotās darbības klases intervālu veidošanai.

1. darbība: minimālo un maksimālo datu noteikšana

Vispirms identificējiet datu mazākās (minimālās) un lielākās (maksimālās) vērtības.

– Minimālā vērtība = \(x_{\min} \)
– Maksimālā vērtība = \(x_{\max} \)

Šī vērtība tiks izmantota, lai aprēķinātu datu diapazonu.

2. darbība. Aprēķiniet diapazonu

Diapazons ir starpība starp maksimālo un minimālo vērtību:

\[
R = x_{\max} – x_{\min}
\]

Diapazons sniedz priekšstatu par datu sadalījuma platumu.

3. solis: nosakiet klašu skaitu (k)

Klašu skaitu var noteikt vairākos veidos. Vispopulārākais veids ir izmantot Sturges likumu:

\[
k = 1 + 3{,}3 \log_{10}(n)
\]

kur \(n \) ir datu apjoms.

Aprēķinu rezultāti parasti tiek noapaļoti līdz tuvākajam veselajam skaitlim (vai uz augšu), lai klašu skaits nebūtu pārāk mazs.

Papildus Sturges metodei pastāv arī izplatīta prakse: izvēlēties klases lielumu no 5 līdz 12 dalībniekiem atkarībā no attēlošanas vajadzībām un izlases lieluma. Tomēr Sturges metode ir diezgan laba mazākiem datu kopumiem.

4. solis: klases platuma (i) aprēķināšana

Klases platums ir katras klases intervāla garums. Formula ir šāda:

\[
i = ∫τητικ ...
\]

Tā kā klašu platumiem ir jābūt viegli lietojamiem, tie parasti tiek noapaļoti līdz “glītam” skaitlim (piemēram, 5, 10, 2 vai 0,5, atkarībā no datu konteksta). Šī noapaļošana ir svarīga, lai nodrošinātu, ka intervāli ir viegli lasāmi un nerastos neskaidrības.

Ja noapaļošanas rezultāti neļauj ievietot visus datus, klases platumu var nedaudz palielināt.

5. darbība: Nosakiet klases robežas

Sāciet ar minimālo vērtību kā pirmās klases apakšējo robežu. Pēc tam izveidojiet secīgus intervālus, līdz tie ietver maksimālo vērtību.

Piemēram, ja minimālā vērtība ir 32 un klases platums ir 5, tad klasi var izveidot:

– 32–36
– 37–41
– 42–46
- utt.

Svarīgi: Pārliecinieties, ka starp klasēm nav atstarpju vai pārklāšanās. Visām datu vērtībām jāietilpst tieši vienā klasē.

6. darbība. (pēc izvēles) Izveidojiet klases robežas

Ja dati ir veseli skaitļi (piemēram, testa rezultāti), klašu robežas bieži tiek veidotas, lai klase būtu nepārtraukta. To panāk, pieskaitot 0,5 augšējai robežai un atņemot 0,5 no apakšējās robežas.

Piemēram, 32.–36. klasē klases mala kļūst par:
– 31,5–36,5

Tas ir noderīgi histogrammām, lai joslas savienotos bez atstarpēm.

7. darbība: aprēķiniet katras klases biežumu

Kad klašu intervāli ir noteikti, saskaitiet, cik datu punktu ietilpst katrā intervālā. Rezultāti tiek ierakstīti frekvences kolonnā (f).

Lieliem datiem izmantojiet skaitīšanas metodi, lai strādātu ātrāk un samazinātu kļūdas.

8. darbība: izveidojiet frekvenču sadalījuma tabulu

Minimālā frekvences sadalījuma tabulā ir ietverts:

– Nodarbību intervāls
– Frekvence (f)

Varat pievienot citas kolonnas, piemēram:

– Klases viduspunkts (xi)
– Kumulatīvā frekvence
– Relatīvā frekvence (procentos)

4. Datu grupēšanas piemērs

Piemēram, ir pieejami 40 studentu testa rezultātu dati ar minimālo punktu skaitu 42 un maksimālo punktu skaitu 94.

1. Minimālais = 42 , maksimālais = 94
2. Diapazons:
\[
R = 94 – 42 = 52
\]
3. Klasu skaits (storges):
\[
k = 1 + 3{,}3 \log(40)
aptuveni 1 + 3{,}3(1{,}602)
aptuveni 6 29
\]
Noapaļots līdz 6 vai 7 klasēm. Mēs izvēlējāmies 7 klases, lai iegūtu detalizētāku informāciju.
4. Klases platums:
\[
i = ∫₀ (52°/7°) aptuveni 7,43
\]
Noapaļots līdz 8.
5. Veidojiet intervālus, sākot no 42, ar platumu 8:
– 42–49
– 50–57
– 58–65
– 66–73
– 74–81
– 82–89
– 90–97

Pēdējais intervāls sasniedza 97, tāpēc maksimālā vērtība 94 joprojām tika ņemta vērā.

6. Pēc tam, pamatojoties uz datiem (piemēram, izmantojot līniju), aprēķiniet katra intervāla biežumu. Galīgajā tabulā būs redzams, cik studentu ietilpst noteiktā rezultātu diapazonā, kas ļaus mums ātri novērtēt sniegumu.

5. Padomi, kā padarīt nodarbību intervālus efektīvākus

1. Izmantojiet vienādu klašu platumu, lai tabulas būtu viegli salīdzināt.
2. Neizveidojiet pārāk daudz klašu, jo tabula kļūs gara un grūti lasāma.
3. Nevajadzētu pārāk maz klašu, jo svarīga informācija var tikt “pazaudēta” un sadalījums var izskatīties pārāk aptuvens.
4. Pielāgojiet klases platuma noapaļošanu atbilstoši datu kontekstam. Temperatūrām varētu būt piemērots skaitlis 1 vai 0,5; testa rezultātiem parasti ir piemērots skaitlis 5 vai 10.
5. Vēlreiz pārbaudiet klases robežas, lai pārliecinātos, ka visi dati ir ievadīti bez trūkstošām vērtībām.

Secinājums

Datu grupēšana klašu intervālos ir svarīga metode datu vienkāršošanai un sadalījuma skaidrai attēlošanai. Šīs darbības ietver minimālo un maksimālo vērtību noteikšanu, diapazona aprēķināšanu, klašu skaita noteikšanu (bieži izmantojot Sterdža likumu), klašu platuma aprēķināšanu, intervālu veidošanu un pēc tam katras klases frekvences aprēķināšanu. Ar pareizajiem klašu intervāliem sarežģītus neapstrādātus datus var pārveidot viegli saprotamā informācijā, gan tabulās, gan grafikos.

Ja vēlaties, varu arī izveidot pilnīgu piemēru ar neapstrādātiem datiem (vērtību sarakstu) un pēc tam sastādīt biežuma sadalījuma tabulu ar histogrammu.

Atstājiet komentāru