Kirjeldava statistika mõistmine ja põhimõisted andmeanalüüsis
Kirjeldav statistika on andmeanalüüsi protsessi üks olulisemaid alustalasid. Enne kui keegi andmete põhjal järeldusi teeb, ennustusi teeb või otsuseid langetab, on esimene samm peaaegu alati andmete endi "mõistmine". Siin tulebki mängu kirjeldav statistika: see aitab andmeid kokku võtta, korraldada ja esitada nii, et nende mustrid, omadused ja trendid oleksid selgelt nähtavad. See artikkel käsitleb kirjeldava statistika definitsiooni ja selle põhimõisteid, mida andmeanalüüsis laialdaselt kasutatakse.
Kirjeldava statistika mõistmine
Üldiselt on kirjeldav statistika statistika haru, mis keskendub andmete kogumisele, kokkuvõtmisele, korraldamisele ja esitamisele, et anda selge pilt nende olukorrast. Selle peamine eesmärk ei ole hüpoteeside testimine ega üldistamine laiemale populatsioonile (see on järeldusliku statistika valdkond), vaid pigem selgitada, mis käideldavates andmetes toimub.
Näiteks kui kool kogub matemaatika testi tulemusi 200 õpilaselt, saab kirjeldavat statistikat kasutada sellistele küsimustele vastamiseks nagu: Milline on keskmine tulemus? Kui suur on tulemuste varieeruvus? Millised on kõrgeimad ja madalaimad tulemused? Kas enamik tulemusi jääb teatud vahemikku? Need küsimused on olulised hindamise alusena, ilma et peaks tegema järeldusi teiste koolide õpilaste kohta.
Kirjeldava statistika roll andmete analüüsis
Andmeanalüüsi praktikas on kirjeldav statistika tavaliselt esimene samm, mis määrab edasise analüüsi suuna. Selle rollid hõlmavad järgmist:
1. Esitage algandmed kokkuvõtlikumas ja arusaadavamas vormis.
2. Tuvastage mustreid, näiteks trende, domineerivaid andmerühmi või anomaaliaid.
3. Tuvastage andmevead, näiteks ebamõistlikud väärtused, puuduvad andmed või dubleerimine.
4. Esitage teavet kommunikatiivselt tabelite, graafikute ja statistiliste kokkuvõtete abil.
5. Toetab varajast otsuste langetamist, näiteks turundusstrateegiate määramist kliendiandmete kokkuvõtete põhjal.
Ilma kirjeldavate sammudeta võib edasine analüüs olla ebatäpne, kuna andmeid ei mõisteta täielikult.
Andmetüübid ja mõõteskaalad
Kirjeldava statistika põhikontseptsiooni ei saa lahutada andmetüüpide ja mõõteskaalade mõistmisest, sest mõlemad määravad sobiva kokkuvõtte meetodi.
1. Kvalitatiivsed ja kvantitatiivsed andmed
– Kvalitatiivsed andmed (kategooriad): andmed kategooriate või siltide kujul, näiteks sugu, töösuhte staatus, tootekategooria.
– Kvantitatiivsed (numbrilised) andmed: numbrilised andmed, mida saab loendada või mõõta, näiteks vanus, sissetulek, pikkus.
2. Mõõtmisskaala
– Nominaalne: eristab ainult kategooriaid (näide: veregrupp).
– Ordinaal: järjestus on olemas, kuid kategooriate vaheline kaugus on ebakindel (näide: rahulolu tase: madal–keskmine–kõrge).
– Intervall: väärtuste vaheline kaugus on sama, kuid sellel puudub absoluutne null (näide: Celsiuse temperatuur).
– Suhe: vahemaa on sama ja absoluutne null (näide: kehakaal, sissetulek).
Andmete skaala kindlaksmääramine on oluline keskse kalduvuse, hajuvuse ja visualiseeringute sobivate mõõdikute valimiseks.
Andmete esitamine: tabelid ja graafikud
Kirjeldavat statistikat seostatakse sageli andmete esitamisega nii, et neid oleks lihtne lugeda ja tõlgendada.
1. Sagedusjaotuse tabel
Sagedusjaotuse tabel näitab, kui sageli väärtus või kategooria esineb. See on kasulik suurte andmekogumite puhul, võimaldades kokkuvõtlikkust. Numbriliste andmete puhul on sagedused sageli järjestatud klassivahemike kaupa (nt 0–10, 11–20 jne).
2. Graafikud ja diagrammid
Mõned levinumad visualiseerimisviisid:
– Tulpdiagramm: sobib kategooriliste andmete jaoks.
– Sektordiagramm: näitab iga kategooria osakaalu (kuigi paljude kategooriate puhul on see tavaliselt vähem efektiivne).
– Histogramm: sarnane tulpdiagrammiga, aga grupeeritud arvandmete jaoks; aitab näha jaotuse kuju.
– Sageduspolügoon: joon, mis ühendab iga klassi sageduspunkte.
– Kastidiagramm (boxplot): kuvab mediaani, kvartiile, jaotust ja potentsiaalseid kõrvalekaldeid.
Visualiseerimine aitab näha andmetes trende või anomaaliaid, mis pole ainult numbrite põhjal selged.
Keskse kalduvuse mõõdud
Keskse kalduvuse mõõdud kirjeldavad „keskmist“ väärtust või väärtust, mis esindab andmekogumit kõige paremini.
1. Keskmine (keskmine)
Keskmine on kõigi väärtuste summa, mis on jagatud andmepunktide arvuga. Keskmine on populaarne, kuna seda on lihtne mõista, kuid see on tundlik kõrvalekallete suhtes. Näiteks sissetulekute andmetes võib üks väga jõukas inimene keskmist oluliselt moonutada.
2. Mediaan (keskmine väärtus)
Mediaan on keskmine väärtus pärast andmete sorteerimist. Kui andmepunktide arv on paarisarv, on mediaan kahe keskmise väärtuse keskmine. Mediaan on erandite suhtes vastupidavam, seega kasutatakse seda sageli asümmeetrilise jaotusega andmete puhul.
3. Režiim (kõige sagedamini esinev väärtus)
Režiim on kõige sagedamini esinev väärtus ja see on kasulik kategooriliste andmete puhul. Näiteks kõige sagedamini ostetud tootetüüpide režiim näitab peamist eelistust.
Dispersiooni mõõdud
Lisaks keskse väärtuse tundmisele on oluline teada ka seda, kui hajutatud andmed keskpunktist on.
1. Vahemik
Vahemik on maksimaalse ja minimaalse väärtuse vahe. See mõõt on lihtne, kuid seda mõjutavad tugevalt kõrvalekalded.
2. Dispersioon ja standardhälve
– Variatsioon mõõdab väärtuste keskmist ruuthälvet keskmisest.
– Standardhälve on dispersiooni ruutjuur, mida kasutatakse sageli seetõttu, et selle ühikud on samad, mis algandmetel.
Mida suurem on standardhälve, seda muutlikumad on andmed; mida väiksem see on, seda rohkem kipuvad andmed keskmise ümber koonduma.
3. Kvartiilid ja IQR (kvartiilidevaheline vahemik)
Kvartiilid jagavad andmed neljaks võrdseks osaks:
– Q1 (alumine kvartiil), Q2 (mediaan), Q3 (ülemine kvartiil).
IQR = Q3 − Q1 näitab andmete keskmise 50% jaotust ning on suhteliselt vastupidav kõrvalekalletele.
Jaotusvorm ja kõrvalekalded
Kirjeldav statistika pöörab tähelepanu ka andmete levitamise vormile:
– Sümmeetriline: andmed on keskmisest/mediaanist vasakule ja paremale ühtlaselt jaotunud.
– Paremale kaldu: palju väikeseid väärtusi, vähe suuri väärtusi.
– Vasakule kaldu: palju suuri väärtusi, vähe väikeseid väärtusi.
Samal ajal on kõrvalekalle väärtus, mis erineb oluliselt enamikust andmetest. Kõrvalväärtused võivad tekkida registreerimisvigade või oluliste reaalsete nähtuste (nt äärmiselt suurte tehingute) tõttu. Kõrvalväärtuste tuvastamine on oluline, kuna need võivad mõjutada keskmist, dispersiooni ja üldist tõlgendust.
Järeldus
Kirjeldav statistika on andmeanalüüsi oluline esimene samm, kuna see aitab muuta toorandmed sisukaks teabeks. Numbriliste kokkuvõtete (keskmine, mediaan, moodus), hajuvuse mõõdikute (vahemik, standardhälve, IQR) ja andmete esitamise tabelite ja graafikute abil saavad analüütikud kiiresti ja täpselt aru andmete omadustest. Andmetüübi ja mõõtmisskaala mõistmine määrab ka sobiva kirjeldava meetodi. Selle aluse abil saab järgnevat analüüsi – sealhulgas järelduslikku analüüsi ja otsuste tegemist – läbi viia sihipärasemalt ja vastutustundlikumalt.
Soovi korral võin seda artiklit akadeemilisemaks (viidetega) või blogisõbralikumaks kohandada või lisada lihtsaid arvutusnäiteid ja tabelite/graafikute illustratsioone.