Exempelfrågor och diskussion om fördelningsmått
Spridningsmått är statistiska begrepp som används för att beskriva hur utspridd eller varierad data inom en datamängd är. Spridningsskalan ger en mer djupgående titt på datafördelningen och avslöjar information som inte kan ses enbart från medianen och medelvärdet. Den här artikeln kommer att diskutera flera exempelproblem relaterade till spridningsmått och deras diskussion för att förtydliga detta koncept. Det finns olika spridningsmått, inklusive intervall, standardavvikelse, varians och interkvartilintervall (IQR).
1. Räckvidd
Definition
Intervallet är skillnaden mellan de högsta och lägsta värdena i en datamängd.
Problem exempel
Ett fotbollslag registrerar antalet mål de gjort i sina senaste 10 matcher enligt följande:
3, 5, 2, 8, 7, 2, 6, 9, 4 och 1.
Diskussion
För att beräkna intervallet måste vi hitta dataens maximi- och minimivärden.
– Maximal poäng: 9
– Minsta värde: 1
Intervall = Maximalt värde – Minimivärde = 9 – 1 = 8
Så, målspannet under de senaste 10 matcherna är 8 mål.
2. Standardavvikelse
Definition
Standardavvikelsen är ett mått på hur långt varje värde i en datamängd är från sitt medelvärde. Standardavvikelsen är kvadratroten av variansen.
Problem exempel
Här är resultaten på matematikprovet för en klass: 65, 70, 75, 80 och 85.
Diskussion
Det första steget är att beräkna medelpoängen.
\[
\text{Medelvärde} = \frac{65 + 70 + 75 + 80 + 85}{5} = 75
\]
Det andra steget är att beräkna skillnaden mellan varje värde och medelvärdet och sedan kvadrera resultatet:
– (65 – 75)² = 100
– (70 – 75)² = 25
– (75 – 75)² = 0
– (80 – 75)² = 25
– (85 – 75)² = 100
Det tredje steget är att hitta variansen genom att beräkna medelvärdet av kvadraterna av skillnaderna:
\[
Varians = 100 + 25 + 0 + 25 + 100 / 5 = 50
\]
Standardavvikelsen är kvadratroten av variansen:
\[
Standardavvikelse = 50 % avvikelse
\]
Så standardavvikelsen för testresultaten är cirka 7.07.
3. Varians
Definition
Variansen är medelvärdet av de kvadrerade skillnaderna mellan varje värde och dess medelvärde; den beskriver hur utspridd data är runt medelvärdet. Variansen är kvadraten på standardavvikelsen.
Problem exempel
Antag att vi har följande datamängd: 10, 20, 30, 40 och 50.
Diskussion
Det första steget är att beräkna medelvärdet av data.
\[
\text{Medelvärde} = \frac{10 + 20 + 30 + 40 + 50}{5} = 30
\]
Det andra steget är att beräkna skillnaden mellan varje värde och medelvärdet och sedan kvadrera resultatet:
– (10 – 30)² = 400
– (20 – 30)² = 100
– (30 – 30)² = 0
– (40 – 30)² = 100
– (50 – 30)² = 400
Det tredje steget är att hitta variansen genom att beräkna medelvärdet av kvadraterna av skillnaderna:
\[
Varians = 400 + 100 + 0 + 100 + 400 / 5 = 200
\]
Så, variansen för datamängden är 200.
4. Interkvartilavstånd (IQR)
Definition
Interkvartilintervallet (IQR) är skillnaden mellan den tredje kvartilen (Q3) och den första kvartilen (Q1). IQR ger ett mått på spridningen från de mittersta 50 % av data i en datauppsättning, vilket kan vara mer informativt än intervallet.
Problem exempel
Följande dataset har värdena: 1, 3, 4, 5, 6, 7, 8, 11, 13 och 14.
Diskussion
Först måste vi sortera informationen:
1, 3, 4, 5, 6, 7, 8, 11, 13, 14
För att beräkna Q1 och Q3 måste vi dela upp data i kvartiler.
– Medianvärdet (Q2) ligger mellan 6 och 7: \((6+7)/2 = 6.5\)
För Q1 tar vi medianen av de lägre värdena:
- 1, 3, 4, 5, 6
– Medianen för denna delmängd är 4
För Q3 tar vi medianen av de övre värdena:
- 7, 8, 11, 13, 14
– Medianen för denna delmängd är 11
Interkvartilintervall (IQR) = Q3 – Q1 = 11 – 4 = 7
Så är IQR för datasetet 7.
slutsats
Spridningsmått är viktiga aspekter av statistik som hjälper oss att förstå graden av variation i data. I den här artikeln har vi diskuterat och gett exempel och diskussioner för flera vanligt förekommande mått på spridning: intervall, standardavvikelse, varians och interkvartilintervall. Genom att förstå dessa begrepp och hur man beräknar dem får vi en bättre förståelse för egenskaperna hos de data vi analyserar, vilket i sin tur kan hjälpa oss att fatta mer välgrundade beslut baserat på dessa data.