描述统计中均值、中位数和众数的区别
在描述统计学中,主要目标之一是概括数据以便于理解。对于规模庞大、种类繁多且有时“杂乱无章”的数据,以集中趋势度量的形式呈现会更具信息量。最常用的三种集中趋势度量是均值、中位数和众数。虽然这三种度量都旨在展现数据集的“代表性值”,但它们的运算方法、对异常值的敏感性以及适用场景却大相径庭。
本文讨论了均值、中位数和众数的含义、计算方法、优缺点以及应用示例,以便您可以为正在分析的数据选择最合适的度量。
1. 平均值(均值):定义及计算方法
平均值是所有数据值的总和除以数据点的数量。平均值通常被称为“均值”,在日常生活中最为常见。它通过按比例考虑所有值,提供了数据集中程度的快照。
平均公式:
\[
\bar{x} = \frac{\sum x_i}{n}
\]
凯特兰甘(Keterangan):
– \(\sum x_i\) = 所有数据值的总和
– \(n\) = 数据数量
康托:
假设五名学生的考试成绩分别为:70、75、80、85、90。
平均值 = (70 + 75 + 80 + 85 + 90) / 5 = 400 / 5 = 80
平均优势
1. 充分利用所有数据,确保所用信息完整。
2. 易于计算,广泛用于高级分析(例如方差、标准差)。
3. 适用于数值数据和相对对称的分布。
平均不足
1. 对异常值非常敏感。一个极端值就能使平均值与大部分数据严重偏离。
2. 如果数据分布不均匀,则不一定代表“典型值”。
异常值效应示例:
收入数据(百万印尼盾):3、3、4、4、5、50
平均值 = (3+3+4+4+5+50)/6 = 69/6 = 11,5
虽然大多数人的收入在 3 万至 5 万美元之间,但平均值不太具有代表性。
2. 中位数(中间值):定义及计算方法
中位数是将数据按从小到大的顺序排列后位于中间位置的值。中位数强调的是位置而非整体大小,因此更能抵抗异常值的影响。
如何确定中位数:
1. 对数据进行排序。
2. 如果数据个数为奇数,则中位数是中间位置的值。
3. 如果数据个数为偶数,则中位数是中间两个值的平均值。
示例(奇数):
数据:2、3、5、7、9
中位数 = 中间值 = 5
例如(偶数):
数据:10、20、30、40
中位数 = (20 + 30) / 2 = 25
中位数优势
1. 抗异常值和极端值的能力强。
2. 适用于收入、房价或等待时间等偏斜数据。
3. 可用于有序数据(例如满意度评级:非常满意、满意、中立、不满意)。
中位数缺陷
1. 计算中不使用所有数据值(更“基于位置”)。
2. 不太适合需要平均性质的高级数学分析。
如果我们回到收入的例子:3、3、4、4、5、50
数据已排序,6 个数据的中位数是第 3 个值和第 4 个值的平均值:(4 + 4) / 2 = 4
这个中位数更能代表大多数情况。
3. 众数(最值):定义及确定方法
众数是指数据集中出现次数最多的值。在某些情况下,数据可能具有以下特征:
单峰分布:只有一个值出现频率最高
– 双峰模式:两个值出现频率最高
– 多种模式(多模态)
– 无模式:如果所有值出现的频率相同。
康托:
数据:2、3、3、4、5
众数 = 3(出现频率最高)
双峰分布示例:
数据:1、2、2、3、3、4
模式 = 2 和 3
模式优势
1. 唯一可用于名义数据(例如最喜欢的颜色、最喜欢的品牌)的集中趋势度量。
2. 容易理解,因为它立即显示了最主要的类别/值。
3. 不受异常值的影响,因为极端值不会改变最常出现的值的频率。
缺乏模式
1. 有时它不是唯一(可以有多个),甚至根本不存在。
2. 稳定性较差;数据中的微小变化都可能改变模式。
3. 在数学上并不总是代表数据的“中心”。
4. 均值、中位数和众数的主要区别
综上所述,这三者之间的区别可以从计算方法、对异常值的敏感性以及适用的数据类型等方面看出:
1. 平均值使用所有值,最适合对称的数值数据,但对异常值敏感。
2. 基于位置的中位数,适用于偏斜数据,对异常值更具鲁棒性。
3. 基于频率的众数,适用于分类/名义数据,并能看出最主要的数值。
许多统计学书籍都指出,这三种分布之间存在着某种普遍关系:
– 对称分布:均值 ≈ 中位数 ≈ 众数
– 分布右偏(偏斜):均值 > 中位数 > 众数
– Distribusi miring ke kiri (skewed left) : mean < median < modus
Namun ini adalah kecenderungan, bukan aturan mutlak.
5. Kapan Menggunakan Mean, Median, atau Modus?
Memilih ukuran pemusatan yang tepat bergantung pada karakter data dan tujuan analisis.
Gunakan Mean jika:
- Data berbentuk numerik (interval/rasio).
- Distribusi relatif simetris.
- Tidak ada outlier ekstrem atau outlier sudah ditangani.
- Anda membutuhkan dasar untuk perhitungan statistik lainnya.
Contoh situasi: rata-rata nilai ujian kelas dengan sebaran nilai wajar.
Gunakan Median jika:
- Data numerik tetapi terdapat outlier atau distribusinya miring.
- Anda ingin nilai “tipikal” yang lebih stabil.
- Data bersifat ordinal.
Contoh situasi: median gaji karyawan, median harga rumah, median waktu tempuh perjalanan.
Gunakan Modus jika:
- Data bersifat nominal atau kategorik.
- Anda ingin mengetahui pilihan yang paling umum.
Contoh situasi: ukuran baju yang paling banyak dibeli (S/M/L), metode pembayaran paling sering dipakai, atau jenis produk terlaris.
Kesimpulan
Mean, median, dan modus adalah tiga ukuran pemusatan data yang sangat penting dalam statistika deskriptif. Mean memberikan rata-rata dengan mempertimbangkan semua nilai, namun rentan terhadap outlier. Median menunjukkan nilai tengah yang lebih tahan terhadap nilai ekstrem dan cocok untuk data yang skewed. Modus menyoroti nilai atau kategori yang paling sering muncul dan sangat berguna untuk data kategorik.
Dengan memahami perbedaan dan konteks penggunaannya, Anda dapat memilih ukuran pemusatan yang paling tepat agar kesimpulan dari data menjadi lebih akurat dan mudah dipahami. Jika data Anda memiliki outlier besar, median sering lebih representatif; jika data bersifat kategorik, modus adalah pilihan utama; dan jika data simetris dan “bersih,” mean bisa menjadi ringkasan yang paling informatif.