Tilstand og median

Modus og median: Forklaring og anvendelse i statistik

Statistik er en gren af ​​matematikken, der beskæftiger sig med indsamling, analyse, fortolkning, præsentation og organisering af data. I statistik bruges forskellige mål for spredning og centrale determinanter for data til at analysere og forstå dem. To af de mest grundlæggende og vigtige er modus og median. Denne artikel vil forklare, hvad modus og median er, hvordan man beregner dem, og deres betydning i dataanalyse.

Hvad er tilstand?

Modusen er den værdi, der forekommer hyppigst i et datasæt. Mere teknisk set er modusen den værdi eller kategori, der har den højeste frekvens i en datafordeling. Moduser kan bruges til kategoriske, ordinale, interval- og ratiodata. I modsætning til middelværdien og medianen er modusen ikke altid unik. I nogle tilfælde kan data have mere end én modus (bimodal eller multimodal) eller slet ingen modus, hvis alle værdier forekommer med samme frekvens.

Sådan beregner du tilstand

Det er meget simpelt at beregne modusen. Du skal blot identificere den værdi, der forekommer hyppigst i dataene. Her er et simpelt eksempel:

Lad os sige, at vi har følgende datasæt: 3, 7, 5, 9, 7, 6, 7, 2.

I dette datasæt forekommer værdien 7 tre gange, mere end nogen anden værdi. Derfor er modusen for dette datasæt 7.

For mere komplekse data eller kategoriske data kan det være nødvendigt at organisere hyppighederne for hver værdi for lettere at identificere dem.

Eksempel på kategoriske data:
Der blev udført en undersøgelse for at finde ud af de mest foretrukne bilfarver: Rød, blå, sort, hvid, sort, blå, blå.

I dette eksempel:
– Rød vises 1 gang
– Blå vises 3 gange
– Sort optræder 2 gange
– Hvid optræder 1 gang

Datatilstanden er blå, fordi dette er den oftest nævnte farve (3 gange).

Når tilstanden ikke er unik eller ikke eksisterer

I nogle tilfælde kan data have mere end én tilstand eller endda slet ingen tilstand. Eksempel:

Bimodal eller multimodal:
Datasæt: 4, 4, 5, 5, 6, 6, 7
I dette eksempel optræder værdierne 4, 5 og 6 to gange hver. Derfor er dette datasæt multimodalt med tilstandene 4, 5 og 6.

Ingen tilstand:
Datasæt: 1, 2, 3, 4, 5
Hver værdi vises kun én gang, så der er ingen tilstand i dette datasæt.

Hvad er medianen?

Medianen er den midterste værdi i et sorteret datasæt. Den deler datasættet i to lige store dele, hvor halvdelen af ​​værdierne ligger under medianen og den anden halvdel over medianen. Medianen bruges ofte, fordi den ikke påvirkes af ekstreme værdier eller outliers som middelværdien, og giver dermed en bedre indikation af centrum af datafordelingen, når dataene har store afvigelser.

Sådan beregner du medianen

Trinene til at beregne medianen er som følger:

1. Sorter dataene i stigende rækkefølge.
2. Hvis antallet af data (N) er ulige, er medianen værdien i midterpositionen.
3. Hvis antallet af data (N) er lige, er medianen gennemsnittet af de to værdier i midten.

Forhold:

Datasæt med ulige tal:
Datasæt: 3, 7, 5, 9, 6
Sortér: 3, 5, 6, 7, 9
Median: 6 (værdien i midten)

Datasæt med lige tal:
Datasæt: 3, 7, 5, 9, 6, 8
Sortér: 3, 5, 6, 7, 8, 9
Median: (6 + 7) / 2 = 6.5

Median i kategoriske data

Selvom medianen oftere anvendes på kontinuerlige data eller ordinale data, kan den også bruges til kategoriske data med en klar orden.

Eksempler på kategoriske (ordinale) data:
Filmvurdering: God, Meget god, Rimelig, Meget god, God
Sortér efter rangering: Rimelig, God, God, Meget god, Fremragende
Median: God (tredje middelværdi)

Styrker og svagheder ved medianen

En af de største fordele ved medianen er dens følsomhed over for outliers. Lad os for eksempel sige, at vi har et indkomstdatasæt, og en administrerende direktør med en ekstremt høj indkomst er inkluderet. Medianen vil stadig give et mere realistisk billede af den centrale indkomst end gennemsnittet, som ville være forvrænget af ekstreme værdier. Ulempen ved medianen er dog, at i små datasæt kan manglende eller unøjagtige data have betydelig indflydelse på resultaterne.

Tilstand vs. median vs. gennemsnit

Både modus, median og middelværdi er mål for central tendens, der giver vigtig information om datafordelingens karakteristika.

– Gennemsnit: Det aritmetiske gennemsnit af alle data. Følsom over for outliers.
– Median: Den midterste værdi af de sorterede data. Ikke følsom over for outliers.
– Tilstand: Den værdi, der forekommer hyppigst. Nyttig til kategoriske data.

Hver har sine egne anvendelser og ulemper, og bruges nogle gange sammen for at give et mere omfattende billede.

Valg af den rigtige størrelse

Valget af det passende mål for central tendens afhænger af datatypen og formålet med analysen.

– Hvis dataene har outliers eller ikke er normalfordelt, kan medianen være mere passende.
– Hvis du er interesseret i den mest almindelige værdi eller dominerende kategori, vil tilstanden være mere nyttig.
– Hvis dataene er normalfordelt uden outliers, kan middelværdien give en god repræsentation.

For eksempel bruges medianen i ejendomsmarkedsanalyser ofte til at beskrive huspriser på grund af de ekstreme prisvariationer. I opinionsundersøgelser kan modusen bruges til at identificere det mest populære valg.

Konklusion

Modus og median er to meget nyttige mål for central tendens i statistik. Selvom de giver forskellige oplysninger, kan de forenkle og opsummere de vigtigste karakteristika ved et datasæt, hvilket hjælper med beslutningstagning baseret på disse data. Deres tilstedeværelse, sammen med middelværdien, giver forskere og analytikere mulighed for at få et mere komplet billede af de data, de studerer.

Tinggalkan kommentarer