討論組別資料的變異數和標準差的範例問題
介紹
在統計學中,變異數和標準差是兩個至關重要的統計量,它們對於理解數據相對於平均值的離散程度至關重要。變異數衡量資料偏離平均值的程度,而標準差是變異數的平方根,它提供的度量單位與原始資料單位相同。
定義
– 變異數(σ² 或 S²):是每個資料值與資料平均值之差的平方的平均值。
– 標準差(σ 或 S):是變異數的平方根。
組資料的變異數和標準差公式
對於分組數據,我們使用每個類別中數據的頻數。公式如下:
瓦里安
\[ S^2 = \frac{ \sum f_i \left( x_i – \bar{x} \right)^2 }{ N-1 } \]
標準差
\[ S = \sqrt{S^2} \]
在哪裡:
– \( f_i \) = 各類別的頻率。
– \( x_i \) = 各組的中點。
– \( \bar{x} \) = 組資料的平均值。
– \( N \) = 資料總數。
範例問題及討論
假設我們有按類別分組的一群人的體重數據。
| 體重區間(公斤) | 頻率(次) |
|————————|————–|
| 50 – 54 | 2 |
| 55 – 59 | 5 |
| 60 – 64 | 8 |
| 65 – 69 | 7 |
| 70 – 74 | 3 |
第一步是確定每個類別的中點(\( x_i \) ),然後計算平均值(\( \bar{x} \))。
1. 計算中點 ( \( x_i \) )
\[ \text{中點} = \frac{\text{下限} + \text{上限}}{2} \]
| 體重區間 (kg) | 頻率 (f) | 中點 ( \( x_i \) ) |
|——————|————–|————————|
| 50 – 54 | 2 | 52 |
| 55 – 59 | 5 | 57 |
| 60 – 64 | 8 | 62 |
| 65 – 69 | 7 | 67 |
| 70 – 74 | 3 | 72 |
2. 計算平均值 ( \( \bar{x} \) )
\[ \bar{x} = \frac{ \sum f_i x_i }{ N } \]
資料總數 \( N \):
\[ N = 2 + 5 + 8 + 7 + 3 = 25 \]
\[ \sum f_i x_i = (2 \times 52) + (5 \times 57) + (8 \times 62) + (7 \times 67) + (3 \times 72) \]
\[ = 104 + 285 + 496 + 469 + 216 = 1570 \]
因此,平均數(\( \bar{x} \)):
\[ \bar{x} = \frac{ 1570 }{ 25 } = 62.8 \]
3. 計算變異數(\( S^2 \) )
我們需要計算 \( \sum f_i ( x_i – \bar{x} )^2 \):
\[
\begin{align }
(x_i – \bar{x})^2: & (52 – 62.8)^2 = 118.84 \\
& (57 – 62.8)^2 = 33.64 \\
& (62 – 62.8)^2 = 0.64 \\
& (67 – 62.8)^2 = 17.64 \\
& (72 – 62.8)^2 = 84.64
\end{align }
\]
乘以頻率:
\[
\begin{align }
f_i (x_i – \bar{x})^2: & 2 \times 118.84 = 237.68 \\
5 × 33.64 = 168.2
8 × 0.64 = 5.12
7 × 17.64 = 123.48
3 × 84.64 = 253.92
\end{align }
\]
\[
\sum f_i (x_i – \bar{x})^2 = 237.68 + 168.2 + 5.12 + 123.48 + 253.92 = 788.4
\]
現在我們可以計算變異數(\( S^2 \)):
\[ S^2 = \frac{ 788.4 }{ 25 – 1 } = \frac{ 788.4 }{ 24 } \approx 32.85 \]
4. 計算標準差(\( S \) )
標準差(\(S\)):
\[ S = \sqrt{ S^2 } \]
\[ S = \sqrt{ 32.85 } \approx 5.73 \]
結論
根據以上範例數據,我們得出:
– 計算出的平均體重:62.8 公斤
– 計算變異數:32.85 kg²
– 計算標準差:5.73 公斤
標準差的解釋是,體重數據與平均值的平均偏差約為 5.73 公斤。這表明數據相對於平均值的離散程度,有助於推斷數據的變異性。
透徹理解變異數和標準差至關重要,尤其對於從事統計、研究和測試的人員而言,因為他們需要理解數據中的分組或分佈。掌握如何計算和解釋這兩個指標有助於根據現有數據做出更明智的決策。