Egyedi és csoportosított adatok mediánjának kiszámítására szolgáló technikák
A medián a statisztikában gyakran használt centrális tendencia mérőszáma. Az átlaggal (mean) ellentétben, amely az összes értéket összeadja, majd elosztja az értékek számával, a medián a rendezett adathalmaz „középső értékét” hangsúlyozza. Mivel a pozícióra összpontosít, a medián viszonylag ellenálló a szélsőséges értékekkel (kiugró értékekkel) szemben, például amikor egy érték nagyon nagy vagy nagyon kicsi a többihez képest. Ezért a mediánt széles körben használják a gazdasági adatelemzésben, az oktatásban, a társadalomkutatásban és még a teszteredmények értékelésében is.
Ebben a cikkben kétféle adattípus mediánjának kiszámítási technikáit tárgyaljuk: egyedi adatok (csoportosítás nélküli) és csoportosított adatok (gyakorisági eloszlású táblázatban bemutatva). A képlet mellett a téma a könnyű megvalósítás érdekében gyakorlati lépéseket is tartalmaz.
-
1. A medián alapfogalma
A medián a középső érték, miután az adatokat a legkisebbtől a legnagyobbig rendeztük. Ha az adatpontok száma páratlan, a medián a pontosan középső érték. Ha az adatpontok száma páros, a medián a két középső érték átlaga.
Intuitív módon a medián két részre osztja az adatokat:
– Az adatok 50%-a a medián alatt (vagy azzal egyenlő) van
– Az adatok 50%-a a medián felett van (vagy egyenlő azzal)
Mivel a medián sorrend alapú, az első lépés, ami szinte mindig szükséges, az adatok rendezése.
-
2. Egyedi adatok mediánjának kiszámítása
Az egyedi adatok olyan adatok, amelyeket a jelenlegi állapotukban jelenítenek meg (például a tanulók osztályzatainak listája), és nem intervallumosztályokba összesítve, mint a csoportos adatok esetében.
A. Általános lépések
1. Rendezze az adatokat a legkisebb értéktől a legnagyobbig.
2. Határozza meg az adatok mennyiségét, például n.
3. Határozza meg a középvonal helyzetét:
– Ha n páratlan, akkor a medián az \(n+1)/2\ pozícióban van.
– Ha n páros, akkor a medián az \(n/2\) és \(n/2)+1\) pozíciókban lévő adatok átlaga.
B. Medián képlet egyedi adatokra
– Ha n páratlan:
\[
Én = x_{(n+1)/2}
\]
Ez azt jelenti, hogy a medián az \(n+1)/2\)-edik rendű adatérték.
– Ha n páros:
\[
Me = ∫_{n/2} + x_{(n/2)+1}}{2}
\]
C. Példa egyedi adatokra (n páratlan)
Adatok: 7, 2, 9, 4, 3
1) Rendezés: 2, 3, 4, 7, 9
2) n = 5 (páratlan)
3) Medián pozíció = \((5+1)/2 = 3\)
Medián = 3. adat = 4
Tehát az adatok mediánja 4.
D. Példa egyedi adatokra (n páros)
Adatok: 10, 4, 6, 8
1) Rendezés: 4, 6, 8, 10
2) n = 4 (páros)
3) A középső pozíció a 2. és 3. adat.
Medián = \((6 + 8)/2 = 7\)
Tehát az adatok mediánja 7.
E. Fontos megjegyzés: Gyakoriságú adatok
Előfordul, hogy egyetlen adathalmaz értékeként és gyakoriságaként is megadható (pl. a 60 kétszer, a 70 ötször jelenik meg). Ebben az esetben a mediánt továbbra is az adatok „sorrendje” alapján határozzuk meg, de a kumulatív gyakoriságot felhasználhatjuk a medián pozíciójának meghatározására anélkül, hogy az adatpontokat egyenként felsorolnánk. Az elv ugyanaz: keressük meg az (n+1)/2. pozíciót (páratlan) vagy az (n/2) és (n/2)+1. pozíciót (páros), majd nézzük meg azokat az értékeket, amelyek lefedik ezt a pozíciót a kumulatív gyakoriság alapján.
-
3. Csoportosított adatok mediánjának kiszámítása
A csoportosított adatok olyan adatok, amelyeket osztályintervallumokba és azok gyakoriságába foglaltak össze. Például: 3 fő, akiknek a magassága 150–154 cm, 8 fő, akiknek a magassága 155–159 cm, és így tovább. Az egyedi adatokkal ellentétben a csoportosított adatok mediánja általában nem pontosan meghatározott, mivel nem ismerjük az intervallumon belüli egyedi értékeket. Ezért a mediánt közelítéssel (becsléssel) számítjuk ki a csoportosított eloszlások mediánképletének felhasználásával.
A. Fontos kifejezések a csoportadatok mediánjában
A képlet használata előtt meg kell értenünk néhány összetevőt:
– n = teljes gyakoriság (az adatok teljes száma)
– n/2 = kumulatív medián pozíció
– Medián osztály = az első intervallumosztály, amely ≥ n/2 kumulatív gyakoriságot eredményez
– L = a medián osztály alsó széle (nem az alsó határ, hanem az osztály széle; folytonos adatok esetén általában 0,5-ös korrekciót használunk, ha az adatok egész számok)
– F = a medián osztály előtti kumulatív gyakoriság
– f = medián osztálygyakoriság
– c = osztályhossz (intervallum szélessége)
B. A csoportadatok mediánjának meghatározásának lépései
1. Hozzon létre egy gyakorisági eloszlási táblázatot, és adjon hozzá egy kumulatív gyakorisági oszlopot.
2. Számítsa ki n-t (a frekvenciák számát) és határozza meg n/2 értékét.
3. Határozza meg a medián osztályt, nevezetesen azt az osztályt, amely n/2 pozíciót tartalmaz a kumulatív gyakoriság alapján.
4. Írja be az értékeket a csoportadatok mediánképletébe.
C. Csoportadatok medián képlete
\[
Me = L + ∫(n2 – Ff) szorozva c-vel
\]
Ez a képlet lineáris interpolációt végez a medián osztályon belül, feltételezve, hogy az adatok egyenletesen oszlanak el az osztályintervallumon belül.
D. Példa a csoportadatok mediánjára
Például a következő teszteredmény-adatok:
| Értékintervallum | Gyakoriság (f) |
|—|—:|
| 40–49 | 5 |
| 50–59 | 8 |
| 60–69 | 12 |
| 70–79 | 10 |
| 80–89 | 5 |
1) Teljes gyakoriság:
\[
n = 5 + 8 + 12 + 10 + 5 = 40
\]
2) Számítsa ki n/2-t:
\[
n/2 = 20
\]
3) Összesített gyakoriság:
– 40–49: 5
– 50–59: 5+8 = 13
– 60–69: 13+12 = 25
– 70–79: 35
– 80–89: 40
A 20. pozíció abban az osztályban található, ahol az első összesített pontszám ≥ 20, azaz 60–69. Tehát ez a medián osztály.
4) Határozza meg az összetevőket:
– L = a medián osztály alsó széle. A 60–69 intervallum esetében az alsó szél 59,5 (ha az adat egész érték).
– F = kumulatív gyakoriság a medián osztály előtt = 13
– f = medián osztálygyakoriság = 12
– c = osztályhossz = 10
5) Írd be a képletbe:
\[
Me = 59,5 + ∫(20 – 13, 12) szorozva 10-zel
\]
\[
Me = 59,5 + ∫(712)∫ szorozva 10-zel
\]
\[
Én = 59,5 + 5,833… = 65,333…
\]
Tehát a csoportadatok mediánja körülbelül 65,33.
-
4. Gyakori hibák
Néhány gyakori hiba a medián kiszámításakor:
1. Az adatok nem rendeződnek egyedi adatok szerint, így a középső érték nem pontos.
2. A medián helyzetének helytelen meghatározása, amikor n páros (a két középső érték átlagát kell venni).
3. Csoportadatok esetén helytelen a medián osztályt választani, mivel az nem hoz létre kumulatív gyakoriságot.
4. Az alsó él (L) osztály alsó határértékének használata, ha az adatok folytonos/intervallum egész számok.
5. Az osztályhossz (c) helytelen meghatározása, különösen, ha az intervallumok inkonzisztensek.
-
5. Következtetés
A medián egy egyszerű, mégis hatékony mérőszám a centrális tendenciára, különösen akkor, ha az adatok szélsőséges értékeket tartalmaznak. Egyedi adathalmazok esetén a mediánt közvetlenül a középső pozícióból határozzák meg az adatok rendezése után, a páratlan és páros számú adathalmazok esetében eltérő bánásmóddal. Eközben csoportosított adathalmazok esetén a mediánt egy interpolációs képlettel számítják ki, amely a medián osztályán, a kumulatív gyakoriságon és az osztályhosszon alapul.
A koncepció és a lépések megértésével gyorsan és pontosan kiszámíthatja a mediánt, mind egyszerű adatokon, mind táblázatokban összefoglalt adatokon. Sok analitikai helyzetben a medián reprezentatívabb választás, mint az átlag, különösen akkor, ha az adateloszlás aszimmetrikus vagy kiugró értékeket tartalmaz.
Ha szeretnéd, gyakorló kérdéseket is hozzáadhatok a beszélgetések mellett, hogy elmélyítsem az egyéni és csoportos adatok mediánjának megértését.