Разумевање и основни концепти дескриптивне статистике у анализи података
Дескриптивна статистика је једна од најважнијих основа у процесу анализе података. Пре него што неко извуче закључке, направи предвиђања или донесе одлуке на основу података, први корак је скоро увек „разумевање самих података“. Ту долази до изражаја дескриптивна статистика: помаже у сумирању, организовању и представљању података тако да се њихови обрасци, карактеристике и трендови могу јасно видети. Овај чланак разматра дефиницију дескриптивне статистике и њене основне концепте који се широко користе у анализи података.
Разумевање дескриптивне статистике
Генерално, дескриптивна статистика је грана статистике која се фокусира на прикупљање, сумирање, организовање и презентовање података како би се пружила јасна слика њиховог стања. Њен примарни циљ није тестирање хипотеза или генерализација на ширу популацију (то је домен инференцијалне статистике), већ објашњење шта се дешава са подацима који су у расположивој популацији.
На пример, ако школа прикупља резултате тестова из математике од 200 ученика, дескриптивна статистика може се користити да би се одговорило на питања као што су: Колики је просечан резултат? Колика је варијација у резултатима? Који су највиши и најнижи резултати? Да ли је већина резултата груписана унутар одређеног распона? Ова питања су важна као основа за евалуацију, без потребе за извођењем закључака о ученицима у другим школама.
Улога дескриптивне статистике у анализи података
У пракси анализе података, дескриптивна статистика је обично почетни корак који одређује правац накнадне анализе. Њене улоге укључују:
1. Сумирајте сирове податке у сажетији и лакше разумљивији облик.
2. Идентификујте обрасце као што су трендови, доминантне групе података или аномалије.
3. Откријте грешке у подацима као што су неразумне вредности, недостајући подаци или дуплирање.
4. Комуникативно презентовати информације путем табела, графикона и статистичких резимеа.
5. Подржава рано доношење одлука, на пример одређивање маркетиншких стратегија на основу резимеа података о купцима.
Без дескриптивних корака, даља анализа може бити нетачна јер подаци нису у потпуности схваћени.
Типови података и скале мерења
Основни концепт дескриптивне статистике не може се одвојити од разумевања типова података и скала мерења, јер оба одређују одговарајући метод сумирања.
1. Квалитативни и квантитативни подаци
– Квалитативни подаци (категорије): подаци у облику категорија или ознака, на пример пол, радни статус, категорија производа.
– Квантитативни (нумерички) подаци: подаци у облику бројева који се могу избројати или измерити, на пример старост, приход, висина.
2. Скала мерења
– Номинално: разликује само категорије (пример: крвна група).
– Ординални: постоји низ, али је удаљеност између категорија неизвесна (пример: ниво задовољства: низак–средњи–висок).
– Интервал: растојање између вредности је исто, али нема апсолутну нулу (пример: температура у Целзијусима).
– Однос: растојање је исто и има апсолутну нулу (пример: телесна тежина, приход).
Одређивање размере података је важно за избор одговарајућих мера централне тенденције, мера дисперзије и визуелизација.
Презентација података: Табеле и графикони
Дескриптивна статистика се често повезује са представљањем података тако да их је лако читати и тумачити.
1. Табела расподеле фреквенција
Табела расподеле фреквенција показује колико често се вредност или категорија појављује. Ово је корисно за велике скупове података, јер омогућава сажетост. За нумеричке податке, фреквенције су често распоређене у интервалима класа (нпр. 0–10, 11–20 и тако даље).
2. Графикони и дијаграми
Неки уобичајени облици визуелизације:
– Стубичасти дијаграм: погодан за категоријалне податке.
– Кружни дијаграм: приказује удео сваке категорије (иако је за многе категорије обично мање ефикасан).
– Хистограм: сличан стубичастом дијаграму, али за груписане нумеричке податке; помаже да се види облик дистрибуције.
– Фреквентни полигон: линија која повезује фреквентне тачке сваке класе.
– Boxplot (кутијасти дијаграм): приказује медијану, квартиле, дистрибуцију и потенцијалне аутлајере.
Визуелизација помаже да се виде трендови или аномалије у подацима које понекад нису јасне ако се погледају само бројеви.
Мере централне тенденције
Мере централне тенденције описују „средњу“ вредност или вредност која најбоље представља скуп података.
1. Средња вредност (просек)
Просек је збир свих вредности подељен бројем података. Просек је популаран јер га је лако разумети, али је осетљив на изузетне вредности. На пример, код података о приходима, једна веома богата особа може значајно искривити просек.
2. Медијана (средња вредност)
Медијана је средња вредност након што су подаци сортирани. Ако је број тачака података паран, медијана је просек две средње вредности. Медијана је отпорнија на аномалије, па се често користи за податке са асиметричним расподелама.
3. Режим (најчешће појављивана вредност)
Мод је најчешће јављајућа вредност и користан је за категоријалне податке. На пример, мод најчешће купованих типова производа указује на примарну преференцију.
Мере дисперзије
Поред познавања централне вредности, важно је знати и колико су подаци удаљени од центра.
1. Домет
Распон је разлика између максималне и минималне вредности. Ова мера је једноставна, али је под великим утицајем аномалија.
2. Варијанса и стандардна девијација
– Варијанса мери просечно квадратно одступање вредности од средње вредности.
– Стандардна девијација је квадратни корен варијансе, често се користи јер су њене јединице исте као и оригинални подаци.
Што је стандардна девијација већа, подаци су променљивији; што је мања, то се подаци више групишу око средње вредности.
3. Квартили и IQR (интерквартилни распон)
Квартили деле податке на четири једнака дела:
– Q1 (доњи квартил), Q2 (медијана), Q3 (горњи квартил).
IQR = Q3 − Q1 приказује расподелу средњих 50% података и релативно је отпоран на аутсајдере.
Облик дистрибуције и аутсајдери
Дескриптивна статистика такође обраћа пажњу на облик дистрибуције података:
– Симетрично: подаци су равномерно распоређени лево и десно од средње вредности/медијане.
– Десно искривљено: много малих вредности, мало великих вредности.
– Лево искривљено: много великих вредности, мало малих вредности.
У међувремену, аутлајер је вредност која се значајно разликује од већине података. Аутлајери се могу јавити због грешака у евидентирању или значајних појава из стварног света (нпр. изузетно велике трансакције). Идентификација аутлајера је важна јер могу утицати на средњу вредност, варијансу и укупно тумачење.
Закључак
Дескриптивна статистика је суштински први корак у анализи података јер помаже у трансформацији сирових података у смислене информације. Путем нумеричких резимеа (средња вредност, медијана, мод), мера дисперзије (опсег, стандардна девијација, IQR) и презентације података у табелама и графиконима, аналитичари могу брзо и тачно разумети карактеристике података. Разумевање типа података и скале мерења такође одређује одговарајућу дескриптивну методу. Са овом основом, накнадна анализа – укључујући инференцијалну анализу и доношење одлука – може се спровести на фокусиранији и одговорнији начин.
Ако желите, могу прилагодити овај чланак да буде академскији (са цитатима), прилагођенији блогу или да укључим једноставне примере прорачуна и илустрације табелама/графиконима.