描述統計中平均數、中位數和眾數的差異
在描述統計學中,主要目標之一是概括資料以便於理解。對於規模龐大、種類繁多且有時「雜亂無章」的數據,以集中趨勢度量的形式呈現會更具資訊量。最常用的三種集中趨勢量是平均數、中位數和眾數。雖然這三種度量都旨在展現數據集的“代表性值”,但它們的運算方法、對異常值的敏感性以及適用場景卻大相徑庭。
本文討論了平均數、中位數和眾數的含義、計算方法、優缺點以及應用範例,以便您可以為正在分析的資料選擇最合適的度量。
1. 平均值(平均值):定義及計算方法
平均值是所有數據值的總和除以數據點的數量。平均值通常被稱為“均值”,在日常生活中最為常見。它透過按比例考慮所有值,提供了資料集中程度的快照。
平均公式:
\[
\bar{x} = \frac{\sum x_i}{n}
\]
信息:
– \(\sum x_i\) = 所有資料值的總和
– \(n\) = 資料數量
康托:
假設五名學生的考試成績分別為:70、75、80、85、90。
平均值 = (70 + 75 + 80 + 85 + 90) / 5 = 400 / 5 = 80
平均優勢
1. 充分利用所有數據,確保所用資訊完整。
2. 易於計算,廣泛用於進階分析(例如變異數、標準差)。
3. 適用於數值資料和相對對稱的分佈。
平均不足
1. 對異常值非常敏感。一個極端值就能使平均值與大部分數據嚴重偏離。
2. 如果資料分佈不均勻,則不一定代表「典型值」。
異常值效應範例:
收入資料(百萬印尼盾):3、3、4、4、5、50
平均值 = (3+3+4+4+5+50)/6 = 69/6 = 11,5
雖然大多數人的收入在 3 萬至 5 萬美元之間,但平均值不太具代表性。
2. 中位數(中間值):定義及計算方法
中位數是將資料依從小到大的順序排列後位於中間位置的值。中位數強調的是位置而非整體大小,因此更能抵抗異常值的影響。
如何確定中位數:
1. 對資料進行排序。
2. 如果資料個數為奇數,則中位數是中間位置的值。
3. 如果資料個數為偶數,則中位數是中間兩個值的平均值。
範例(奇數):
數據:2、3、5、7、9
中位數 = 中間值 = 5
例如(偶數):
數據:10、20、30、40
中位數 = (20 + 30) / 2 = 25
中位數優勢
1. 抗異常值和極端值的能力強。
2. 適用於收入、房價或等待時間等偏斜資料。
3. 可用於有序資料(例如滿意度評級:非常滿意、滿意、中立、不滿意)。
中位數缺陷
1. 計算中不使用所有資料值(更「基於位置」)。
2. 較不適合需要平均性質的高階數學分析。
如果我們回到收入的例子:3、3、4、4、5、50
資料已排序,6 個資料的中位數是第 3 個值和第 4 個值的平均值:(4 + 4) / 2 = 4
這個中位數更能代表大多數情況。
3. 眾數(最值):定義及確定方法
眾數是指資料集中出現次數最多的數值。在某些情況下,數據可能具有以下特徵:
單峰分佈:只有一個值出現頻率最高
– 雙峰模式:兩個值出現頻率最高
– 多種模式(多模態)
– 無模式:如果所有數值出現的頻率相同。
康托:
數據:2、3、3、4、5
眾數 = 3(出現頻率最高)
雙峰分佈範例:
數據:1、2、2、3、3、4
模式 = 2 和 3
模式優勢
1. 唯一可用於名目資料(例如喜歡的顏色、喜歡的品牌)的集中趨勢量測。
2. 容易理解,因為它立即顯示了最主要的類別/值。
3. 不受異常值的影響,因為極端值不會改變最常出現的值的頻率。
缺乏模式
1. 有時它不是唯一(可以有多個),甚至根本不存在。
2. 穩定性較差;數據中的微小變化都可能改變模式。
3. 在數學上並不總是代表數據的「中心」。
4. 平均數、中位數和眾數的主要區別
綜上所述,這三者之間的差異可以從計算方法、對異常值的敏感度以及適用的資料類型等方面看出:
1. 平均值使用所有值,最適合對稱的數值數據,但對異常值敏感。
2. 基於位置的中位數,適用於偏斜數據,對異常值更具穩健性。
3. 基於頻率的眾數,適用於分類/名目數據,並能看出最主要的數值。
許多統計學書籍都指出,這三種分佈之間存在著某種普遍關係:
– 對稱分佈:平均數 ≈ 中位數 ≈ 眾數
– 分佈右偏(偏斜):平均數 > 中位數 > 眾數
– 左偏分佈:平均數 < 中位數 < 眾數。然而,這只是一種趨勢,並非絕對規律。 5. 何時使用平均數、中位數或眾數?選擇合適的集中趨勢量測取決於資料的性質和分析目的。以下情況應使用平均值:- 資料為數值型(區間/比率型)。 - 分佈相對對稱。 - 沒有極端異常值,或異常值已處理。 - 需要為其他統計計算提供基礎。例如:班級考試成績分佈均勻,且平均成績為平均值。