描述统计中均值、中位数和众数的区别
在描述统计学中,主要目标之一是概括数据以便于理解。对于规模庞大、种类繁多且有时“杂乱无章”的数据,以集中趋势度量的形式呈现会更具信息量。最常用的三种集中趋势度量是均值、中位数和众数。虽然这三种度量都旨在展现数据集的“代表性值”,但它们的运算方法、对异常值的敏感性以及适用场景却大相径庭。
本文讨论了均值、中位数和众数的含义、计算方法、优缺点以及应用示例,以便您可以为正在分析的数据选择最合适的度量。
1. 平均值(均值):定义及计算方法
平均值是所有数据值的总和除以数据点的数量。平均值通常被称为“均值”,在日常生活中最为常见。它通过按比例考虑所有值,提供了数据集中程度的快照。
平均公式:
\[
\bar{x} = \frac{\sum x_i}{n}
\]
凯特兰甘(Keterangan):
– \(\sum x_i\) = 所有数据值的总和
– \(n\) = 数据数量
康托:
假设五名学生的考试成绩分别为:70、75、80、85、90。
平均值 = (70 + 75 + 80 + 85 + 90) / 5 = 400 / 5 = 80
平均优势
1. 充分利用所有数据,确保所用信息完整。
2. 易于计算,广泛用于高级分析(例如方差、标准差)。
3. 适用于数值数据和相对对称的分布。
平均不足
1. 对异常值非常敏感。一个极端值就能使平均值与大部分数据严重偏离。
2. 如果数据分布不均匀,则不一定代表“典型值”。
异常值效应示例:
收入数据(百万印尼盾):3、3、4、4、5、50
平均值 = (3+3+4+4+5+50)/6 = 69/6 = 11,5
虽然大多数人的收入在 3 万至 5 万美元之间,但平均值不太具有代表性。
2. 中位数(中间值):定义及计算方法
中位数是将数据按从小到大的顺序排列后位于中间位置的值。中位数强调的是位置而非整体大小,因此更能抵抗异常值的影响。
如何确定中位数:
1. 对数据进行排序。
2. 如果数据个数为奇数,则中位数是中间位置的值。
3. 如果数据个数为偶数,则中位数是中间两个值的平均值。
示例(奇数):
数据:2、3、5、7、9
中位数 = 中间值 = 5
例如(偶数):
数据:10、20、30、40
中位数 = (20 + 30) / 2 = 25
中位数优势
1. 抗异常值和极端值的能力强。
2. 适用于收入、房价或等待时间等偏斜数据。
3. 可用于有序数据(例如满意度评级:非常满意、满意、中立、不满意)。
中位数缺陷
1. 计算中不使用所有数据值(更“基于位置”)。
2. 不太适合需要平均性质的高级数学分析。
如果我们回到收入的例子:3、3、4、4、5、50
数据已排序,6 个数据的中位数是第 3 个值和第 4 个值的平均值:(4 + 4) / 2 = 4
这个中位数更能代表大多数情况。
3. 众数(最值):定义及确定方法
众数是指数据集中出现次数最多的值。在某些情况下,数据可能具有以下特征:
单峰分布:只有一个值出现频率最高
– 双峰模式:两个值出现频率最高
– 多种模式(多模态)
– 无模式:如果所有值出现的频率相同。
康托:
数据:2、3、3、4、5
众数 = 3(出现频率最高)
双峰分布示例:
数据:1、2、2、3、3、4
模式 = 2 和 3
模式优势
1. 唯一可用于名义数据(例如最喜欢的颜色、最喜欢的品牌)的集中趋势度量。
2. 容易理解,因为它立即显示了最主要的类别/值。
3. 不受异常值的影响,因为极端值不会改变最常出现的值的频率。
缺乏模式
1. 有时它不是唯一(可以有多个),甚至根本不存在。
2. 稳定性较差;数据中的微小变化都可能改变模式。
3. 在数学上并不总是代表数据的“中心”。
4. 均值、中位数和众数的主要区别
综上所述,这三者之间的区别可以从计算方法、对异常值的敏感性以及适用的数据类型等方面看出:
1. 平均值使用所有值,最适合对称的数值数据,但对异常值敏感。
2. 基于位置的中位数,适用于偏斜数据,对异常值更具鲁棒性。
3. 基于频率的众数,适用于分类/名义数据,并能看出最主要的数值。
许多统计学书籍都指出,这三种分布之间存在着某种普遍关系:
– 对称分布:均值 ≈ 中位数 ≈ 众数
– 分布右偏(偏斜):均值 > 中位数 > 众数
– 左偏分布:均值 < 中位数 < 众数。然而,这只是一种趋势,并非绝对规律。5. 何时使用均值、中位数或众数?选择合适的集中趋势度量取决于数据的性质和分析目的。以下情况应使用均值:- 数据为数值型(区间/比率型)。- 分布相对对称。- 没有极端异常值,或者异常值已得到处理。- 需要为其他统计计算提供基础。例如:班级考试成绩分布均匀,且平均成绩为均值。