計算單組和分組資料中位數的方法

計算單組和分組資料中位數的方法

中位數是統計中常用的一種集中趨勢量測。與平均值(平均數)不同,平均值是將所有數值相加再除以數值的個數,而中位數則強調排序後資料集的「中間值」。由於中位數關注的是位置,因此它對極端值(異常值)的抵抗力較強,例如當某個值相對於其他值非常大或非常小時。正因如此,中位數被廣泛應用於經濟數據分析、教育、社會研究,甚至考試成績評估等領域。

本文將探討計算兩種類型資料的中位數的方法:單組資料(未分組)和分組資料(以頻數分佈表形式呈現)。除了公式之外,本文也將介紹便於實施的實用步驟。

1. 中位數的基本概念

中位數是將資料依從小到大的順序排列後位於中間位置的值。如果資料點的個數為奇數,則中位數是剛好位於中間的那個值。如果資料點的個數為偶數,則中位數是中間兩個值的平均值。

直觀地說,中位數將數據分成兩部分:
50% 的數據低於(或等於)中位數
50% 的數據高於(或等於)中位數

因為中位數是基於排序的,所以幾乎總是需要的第一步是對資料進行排序。

2. 計算單一資料的中位數

單一資料是指按原樣呈現的資料(例如學生成績清單),而不是像分組資料那樣按區間類別進行匯總的資料。

A. 一般步驟

1. 將資料依從小到大的順序排序。
2. 確定資料量,例如 n。
3. 確定中位數的位置:
– 如果 n 為奇數,則中位數位於位置 \((n+1)/2\)。
– 如果 n 為偶數,則中位數是位置 \(n/2\) 和 \((n/2)+1\) 處資料的平均值。

  推論統計學中的t檢驗

B. 單組資料的中位數公式

– 如果 n 為奇數:
\[
Me = x_{(n+1)/2}
\]
這意味著中位數是第 (n+1)/2 個資料值。

– 如果 n 為偶數:
\[
Me = \frac{x_{n/2} + x_{(n/2)+1}}{2}
\]

C. 單一資料範例(n 為奇數)

數據:7、2、9、4、3
1)排序:2、3、4、7、9
2) n = 5(奇數)
3) 中位數位置 = \((5+1)/2 = 3\)
中位數 = 第 3 個數據點 = 4

所以,這些數據的中位數是 4。

D. 單一資料範例(n 為偶數)

數據:10、4、6、8
1)排序:4、6、8、10
2) n = 4(偶數)
3)中間位置是第2和第3個資料。
中位數 = \((6 + 8)/2 = 7\)

所以,這些數據的中位數是 7。

E. 重要提示:具有頻率的數據

有時,單一資料集可能以數值和頻數的形式給出(例如,60 出現兩次,70 出現五次)。在這種情況下,中位數仍然基於資料的「排序」來確定,但我們可以使用累積頻數來確定中位數的位置,而無需逐一列出資料點。原理相同:找到第 (n+1)/2 個位置(奇數)或第 (n/2) 個和第 (n/2)+1 個位置(偶數),然後根據累積頻數查看覆蓋該位置的值。

3. 計算分組資料的中位數

分組資料是指已依類別區間及其頻數進行匯總的資料。例如:3 人身高在 150-154 公分之間,8 人身高在 155-159 公分之間,以此類推。與單一資料不同,分組資料的中位數通常無法精確確定,因為我們不知道區間內各個個體的特定數值。因此,中位數通常使用分組分佈的中位數公式進行近似計算(估計)。

A. 群體資料中的重要術語 中位數

在使用公式之前,我們需要了解以下幾個組成部分:

  統計中的時間序列分析

– n = 總頻數(資料總數)
– n/2 = 累積中位數位置
– 中位數組 = 第一個累積頻數 ≥ n/2 的區間組
– L = 中位數所在組別的下限(不是下限,而是群組邊緣;對於連續數據,如果數據為整數,通常使用 0,5 的調整)
– F = 中位數之前的累積頻率
– f = 中位數類別頻率
– c = 組距(區間寬度)

B. 決定組別資料中位數的步驟

1. 建立頻率分佈表並新增累計頻率列。
2. 計算 n(頻率數)並確定 n/2。
3. 根據累積頻率決定中位數所在群組,即包含 n/2 個位置的組別。
4. 將這些值代入該組資料的中位數公式。

C. 分組資料的中位數公式

\[
Me = L + \left(\frac{\frac{n}{2} – F}{f}\right)\times c
\]

此公式在中間值類別內執行線性內插,假設資料在類別區間內均勻分佈。

D. 組資料的中位數範例

例如,以下是測驗分數資料:

| 值區間 | 頻率 (f) |
|—|—:|
| 40–49 | 5 |
| 50–59 | 8 |
| 60–69 | 12 |
| 70–79 | 10 |
| 80–89 | 5 |

1)總頻數:
\[
n = 5+8+12+10+5 = 40
\]
2)計算 n/2:
\[
n/2 = 20
\]

3)累計頻率:
– 40–49: 5
– 50–59:5+8 = 13
– 60–69:13+12 = 25
– 70–79: 35
– 80–89: 40

第 20 名屬於累積得分第一個 ≥ 20 的類別,即 60-69 分。因此,這是中位數類別。

4)確定組成部分:
– L = 中位數所在組別的下限。對於區間 60–69,下限為 59,5(如果資料為整數值)。
– F = 中位數之前的累積頻數 = 13
– f = 中位數組頻數 = 12
– c = 班級長度 = 10

5)代入公式:
\[
Me = 59,5 + \left(\frac{20 – 13}{12}\right)\times 10
\]
\[
Me = 59,5 + \left(\frac{7}{12}\right)\times 10
\]
\[
我 = 59,5 + 5,833… = 65,333…
\]

  法律統計學

因此,該組數據的中位數約為 65,33。

4. 常見錯誤

計算中位數時的一些常見錯誤:

1. 單一資料未進行排序,因此中間值不準確。
2. 當 n 為偶數時,錯誤地確定了中位數的位置(必須取中間兩個值的平均值)。
3. 對於分組數據,選擇中位數組是錯誤的,因為它不能產生累積頻率。
4. 當資料是連續的/區間是整數時,使用下緣(L)類別的下限。
5. 錯誤地確定組長 (c),尤其是在組距不一致的情況下。

5. 結論

中位數是一種簡單而有效的集中趨勢量測,尤其適用於資料包含極端值的情況。對於單一資料集,中位數直接取資料排序後的中間位置,奇數個資料集和偶數個資料集的處理方法不同。而對於分組資料集,中位數則需要根據中位數所在群組、累計頻數和組長,透過內插公式計算。

透過理解概念和步驟,您可以快速且準確地計算中位數,無論是簡單的資料還是匯總在表格中的資料。在許多分析情境中,中位數比平均數更具代表性,尤其是在資料分佈不對稱或包含異常值的情況下。

如果你願意,我也可以加入一些練習題和討論,以加強你對單一數據和群體數據中位數的理解。

請留言