Анализа на распределба на податоци со користење на стандардна девијација

Анализа на распределба на податоци со користење на стандардна девијација

Во статистиката, едноставното разбирање на „центарот“ на еден збир податоци не е доволно. Два сета податоци можат да имаат иста средна вредност, но нивните карактеристики значително се разликуваат поради степенот на дисперзија. Тука концептот на дисперзија на податоци станува важен. Една од најпопуларните, најробусните и најчесто користените мерки за дисперзија во различни области - од образование и економија до здравство и наука за податоци - е стандардната девијација. Оваа статија го разгледува концептот, пресметката, толкувањето и употребата на стандардната девијација за да се анализира како се распределени податоците од нивната централна вредност.

1. Зошто е потребно да се анализира дистрибуцијата на податоци?

Замислете две одделенија со просечен резултат на тестот по математика од 80. Во одделението А, речиси сите ученици постигнале резултат помеѓу 78 и 82. Во одделението Б, некои ученици постигнале резултат од 50, а некои 100. Просеците се исти, но ситуациите во двете одделенија се значително различни. Одделение А покажува конзистентен успех, додека одделението Б покажува значителна разлика.

Со анализа на распределбата, можеме:
– Проценете ја конзистентноста или варијацијата на феноменот.
– Мерење на ризикот (на пр. варијација во приносите од инвестициите).
– Споредување на стабилноста на процесот (на пр. квалитет на производство).
– Откривање на потенцијални аномалии или екстремни податоци.

Стандардната девијација е примарна алатка за оваа намена бидејќи мери колку далеку се шират податоците од средната вредност.

2. Дефиниција на стандардна девијација

Стандардната девијација е квадратен корен од варијансата. Додека варијансата го мери просекот од квадратите на разликите помеѓу податоците и средната вредност, стандардната девијација ги враќа мерните единици на нивната оригинална скала (на пр., резултати од тестови, килограми, рупии итн.). Ова го олеснува толкувањето на стандардната девијација.

Интуитивно:
– Мала стандардна девијација → собраните податоци се блиску до средната вредност (поуниформни).
– Голема стандардна девијација → податоците се шират далеку од средната вредност (поразновидни).

ПРОЧИТАЈ  Статистички техники во биологијата

3. Формула за стандардна девијација: Популација наспроти примерок

Во статистиката, правиме разлика помеѓу пресметување на стандардна девијација за популации и примероци.

а) Стандардна девијација на популацијата (σ)
Ако податоците што се анализираат се однесуваат на сите членови на популацијата, формулата е:

\[
\sigma = \sqrt{\frac{\sum (x_i – \mu)^2}{N}}
\]

Информации:
– \(x_i\) = i-та вредност на податоците
– \(\mu\) = средна вредност на популацијата
– \(N\) = број на податоци за популацијата

б) Стандардна девијација на примерокот (и)
Ако податоците што се анализираат се само дел од популацијата (примерокот), формулата е:

\[
s = \sqrt{\frac{\sum (x_i – \bar{x})^2}{n-1}}
\]

Информации:
– \(\bar{x}\) = средна вредност на примерокот
– \(n\) = број на примероци на податоци
– \(n-1\) се нарекува степени на слобода (Беселова корекција), што се користи така што проценката на варијансата/стандардната девијација е непристрасна.

Во секојдневната пракса, податоците што ги имаме обично се во форма на примероци, па затоа формулата \(n-1\) е многу често користена.

4. Чекори за пресметување на стандардна девијација

За да го разберете процесот, еве ги општите чекори за пресметување на стандардната девијација на примерокот:

1. Пресметајте го просекот (\(\bar{x}\)).
2. Пресметајте ја разликата помеѓу секој податок и просекот (\(x_i – \bar{x}\)).
3. Пресметај ја разликата на квадрат \((x_i – \bar{x})^2\).
4. Собери ги сите квадрати.
5. Поделете со \(n-1\) за да ја добиете примерочната варијанса.
6. Одредете го квадратниот корен од резултатот за да ја добиете стандардната девијација (s).

Едноставен пример
Да претпоставиме дека вредностите на податоците се: 70, 75, 80, 85, 90 (n = 5)

– Просек: \(\bar{x} = (70+75+80+85+90)/5 = 80\)
– Разлика: -10, -5, 0, 5, 10
– Квадратна разлика: 100, 25, 0, 25, 100
– Број на квадрати: 250
– Варијанса на примерокот: \(250/(5-1)=62,5\)
– Стандардна девијација: \(s=\sqrt{62,5}\приближно 7,91\)

Едноставно толкување: вредностите отстапуваат во просек од околу 7,91 поени од средната вредност од 80.

5. Интерпретација на стандардна девијација во анализата на податоци

Стандардната девијација не е самостојна; нејзиното значење зависи од контекстот. Сепак, некои општи упатства можат да бидат корисни:

ПРОЧИТАЈ  Разбирање на асиметријата и куртозата

– Ако стандардната девијација е блиску до 0, податоците се високо концентрирани околу средната вредност.
– Ако стандардната девијација е голема, податоците се попроменливи, што укажува на нерамномерност.

Стандардната девијација често се користи и за:
– Споредување на две групи: на пример две класи со иста средна вредност, но различни стандардни отстапувања.
– Проценка на стабилноста на процесот: фабричкото производство со мала стандардна девијација на големината на производот значи поконзистентен квалитет.
– Мерење на волатилноста: во финансиите, стандардната девијација на приносите од акциите често се користи како индикатор за ризик.

6. Однос помеѓу стандардна девијација и нормална распределба

Кај податоците што следат нормална распределба, стандардната девијација има многу силна интерпретација преку емпириското правило:

– Околу 68% од податоците се во опсегот \(\bar{x} \pm 1s\)
– Околу 95% од податоците се во опсегот \(\bar{x} \pm 2s\)
– Околу 99,7% од податоците се во опсегот \(\bar{x} \pm 3s\)

Ова правило е корисно за проценка на тоа колку податоци се „нормални“ околу средната вредност и го олеснува откривањето на екстремните вредности. Сепак, важно е да се запомни дека ова правило е точно само ако податоците се всушност блиску до нормалата.

7. Стандардна девијација наспроти други мерки за ширење

Иако стандардната девијација е многу популарна, постојат и други мерки за дисперзија кои се исто така важни:

– Опсег: разликата помеѓу максималните и минималните вредности. Едноставно, но многу чувствително на отстапувања.
– IQR (интерквартилен опсег): опсегот помеѓу квартил 1 и квартил 3. Поотпорен на отстапувања од стандардната девијација.
– MAD (медијанска апсолутна девијација): робусна мерка базирана на медијаната, погодна за податоци со многу отстапувања.

Стандардната девијација е супериорна кога податоците се релативно „чисти“ и распределбата не е премногу опашкаста. Ако податоците содржат многу отстапувања, стандардната девијација може да стане поголема и помалку репрезентативна за поголемиот дел од податоците.

ПРОЧИТАЈ  Статистика во животната средина

8. Предности и ограничувања на стандардната девијација

Вишок
– Ги користи сите податоци (не само екстремните вредности).
– Има силна теоретска основа и често се користи во многу напредни статистички методи.
– Лесно за толкување бидејќи единиците се исти како и оригиналните податоци.

Ограничувања
– Многу чувствително на отстапувања бидејќи го вклучува квадратот на разликата.
– Толкувањето на „големо“ или „мало“ зависи од обемот и контекстот.
– Кај многу ненормални распределби, стандардната девијација може да биде помалку репрезентативна.

9. Заклучок

Анализирањето на дисперзијата на податоците е клучен чекор во разбирањето на карактеристиките на еден збир на податоци. Стандардната девијација обезбедува јасна мерка за тоа колку далеку се шират податоците од средната вредност, помагајќи ни да ја процениме конзистентноста, ризикот и квалитетот на еден процес или феномен. Со разбирање како да го пресметаме и толкуваме, можеме да донесуваме поинформирани одлуки, без разлика дали станува збор за академско истражување, евалуација на перформансите, контрола на квалитетот или деловна анализа.

На крајот на краиштата, стандардната девијација не е само број, туку важен резиме на неизвесноста и варијацијата својствени за податоците. За поцврста анализа, стандардната девијација треба да се користи во комбинација со други мерки - како што се медијаната, IQR или визуелизација на податоци - за да се обезбеди поцелосна и попрецизна слика за распределбата.

Tinggalkan коментар