단일 데이터 및 그룹 데이터의 중앙값 계산 기법
중앙값은 통계에서 자주 사용되는 중심 경향 측정값입니다. 모든 값을 더한 후 값의 개수로 나누는 평균과는 달리, 중앙값은 정렬된 데이터 세트에서 "중간 값"을 강조합니다. 위치에 초점을 맞추는 특성 때문에 중앙값은 다른 값에 비해 매우 크거나 작은 극단적인 값(이상치)에 비교적 영향을 덜 받습니다. 이러한 이유로 중앙값은 경제 데이터 분석, 교육, 사회 연구, 심지어 시험 점수 평가에 이르기까지 널리 사용됩니다.
이 글에서는 단일 데이터(집합화되지 않은 데이터)와 집단 데이터(빈도 분포표로 제시된 데이터) 두 가지 유형의 데이터에 대한 중앙값 계산 기법을 다룹니다. 공식뿐만 아니라 실제 적용을 위한 단계별 방법도 함께 설명합니다.
-
1. 중앙값의 기본 개념
중앙값은 데이터를 작은 값부터 큰 값 순으로 정렬했을 때 가운데에 있는 값입니다. 데이터 포인트의 개수가 홀수이면 중앙값은 정확히 가운데 값입니다. 데이터 포인트의 개수가 짝수이면 중앙값은 가운데 두 값의 평균입니다.
직관적으로 중앙값은 데이터를 두 부분으로 나눕니다.
– 데이터의 50%는 중앙값보다 작거나 같습니다.
– 데이터의 50%는 중앙값보다 크거나 같습니다.
중앙값은 순서에 따라 달라지기 때문에 거의 항상 가장 먼저 해야 하는 작업은 데이터를 정렬하는 것입니다.
-
2. 단일 데이터의 중앙값 계산
단일 데이터는 그룹 데이터처럼 구간별로 요약되지 않고 있는 그대로 제시되는 데이터입니다(예: 학생 성적 목록).
A. 일반적인 절차
1. 데이터를 가장 작은 값부터 가장 큰 값 순으로 정렬합니다.
2. 데이터의 양(예: n)을 결정합니다.
3. 중앙값의 위치를 확인합니다.
– n이 홀수이면 중앙값은 \((n+1)/2\) 위치에 있습니다.
– n이 짝수이면 중앙값은 위치 \(n/2\)와 \((n/2)+1\)의 데이터의 평균입니다.
B. 단일 데이터에 대한 중앙값 공식
– n이 홀수인 경우:
\[
Me = x_{(n+1)/2}
\]
이는 중앙값이 \((n+1)/2\)번째 순서의 데이터 값임을 의미합니다.
– n이 짝수인 경우:
\[
Me = \frac{x_{n/2} + x_{(n/2)+1}}{2}
\]
C. 단일 데이터의 예 (n이 홀수인 경우)
데이터: 7, 2, 9, 4, 3
1) 정렬 순서: 2, 3, 4, 7, 9
2) n = 5 (홀수)
3) 중앙값 위치 = \((5+1)/2 = 3\)
중앙값 = 3번째 데이터 = 4
따라서 데이터의 중앙값은 4입니다.
D. 단일 데이터의 예 (n이 짝수인 경우)
데이터: 10, 4, 6, 8
1) 정렬: 4, 6, 8, 10
2) n = 4 (짝수)
3) 중간 위치는 두 번째와 세 번째 데이터입니다.
중앙값 = \((6 + 8)/2 = 7\)
따라서 데이터의 중앙값은 7입니다.
E. 중요 참고 사항: 빈도수를 가진 데이터
때로는 하나의 데이터가 값과 빈도로 주어지는 경우가 있습니다(예: 60이 두 번, 70이 다섯 번 나타남). 이 경우에도 중앙값은 데이터의 "순서"를 기반으로 찾지만, 개별 데이터 포인트를 나열하지 않고 누적 빈도를 이용하여 중앙값의 위치를 결정할 수 있습니다. 원리는 동일합니다. 홀수일 경우 (n+1)/2번째 위치, 짝수일 경우 (n/2)번째와 (n/2)+1번째 위치를 찾은 다음, 누적 빈도를 이용하여 해당 위치에 포함되는 값들을 찾습니다.
-
3. 그룹화된 데이터의 중앙값 계산
집단화된 데이터는 각 구간과 그 빈도로 요약된 데이터입니다. 예를 들어, 키가 150~154cm인 사람이 3명, 키가 155~159cm인 사람이 8명 등과 같습니다. 단일 데이터와 달리, 집단화된 데이터는 구간 내 개별 값을 알 수 없기 때문에 중앙값을 정확하게 구할 수 없는 경우가 많습니다. 따라서 집단화된 분포에 대한 중앙값 공식을 사용하여 근사값(추정값)을 계산합니다.
A. 그룹 데이터에서 중요한 용어 - 중앙값
이 공식을 사용하기 전에 몇 가지 구성 요소를 이해해야 합니다.
– n = 총 빈도 (총 데이터 수)
– n/2 = 누적 중앙값 위치
– 중앙값 계급 = 누적 빈도가 n/2 이상인 첫 번째 구간 계급
– L = 중앙값 계급의 하단 경계(하한값이 아니라 계급 경계값입니다. 연속형 데이터의 경우, 데이터가 정수이면 일반적으로 0,5를 조정값으로 사용합니다.)
– F = 중앙값 계급 이전의 누적 빈도
– f = 계급 빈도의 중앙값
– c = 계급 길이(구간 너비)
B. 그룹 데이터의 중앙값을 구하는 단계
1. 빈도 분포표를 작성하고 누적 빈도 열을 추가합니다.
2. n(빈도수)을 계산하고 n/2를 구합니다.
3. 누적 빈도를 기준으로 n/2개의 위치를 포함하는 계급, 즉 중앙값 계급을 결정합니다.
4. 그룹 데이터의 중앙값 공식에 값을 입력합니다.
C. 그룹 데이터에 대한 중앙값 공식
\[
Me = L + \left(\frac{\frac{n}{2} – F}{f}\right)\times c
\]
이 공식은 데이터가 계급 구간 전체에 걸쳐 고르게 분포되어 있다고 가정하고 중앙값 계급 내에서 선형 보간을 수행합니다.
D. 그룹 데이터의 중앙값 예시
예를 들어, 다음과 같은 시험 점수 데이터가 있습니다.
| 값 구간 | 빈도수 (f) |
|—|—:|
| 40–49 | 5 |
| 50–59 | 8 |
| 60–69 | 12 |
| 70–79 | 10 |
| 80–89 | 5 |
1) 총 빈도수:
\[
n = 5+8+12+10+5 = 40
\]
2) n/2를 계산하세요:
\[
n/2 = 20
\]
3) 누적 빈도:
– 40–49: 5
– 50–59: 5+8 = 13
– 60–69: 13+12 = 25
– 70–79: 35
– 80–89: 40
20번째 순위는 누적 점수가 20점 이상인 첫 번째 그룹, 즉 60~69점 그룹에 속합니다. 따라서 이 그룹은 중간값 그룹입니다.
4) 구성 요소를 결정합니다.
– L = 중앙값 계급의 하한. 60~69 구간의 경우, 하한은 59,5입니다(데이터가 정수일 경우).
– F = 중앙값 이전의 누적 빈도 (계급수 = 13)
– f = 계급 빈도의 중앙값 = 12
– c = 계급 길이 = 10
5) 다음 공식을 입력하세요:
\[
Me = 59,5 + \left(\frac{20 – 13}{12}\right)\times 10
\]
\[
나 = 59,5 + \left(\frac{7}{12}\right)\times 10
\]
\[
나 = 59,5 + 5,833… = 65,333…
\]
따라서 그룹 데이터의 중앙값은 대략 65,33입니다.
-
4. 흔히 저지르는 실수
중앙값을 계산할 때 흔히 저지르는 실수 몇 가지:
1. 개별 데이터에 대해 정렬을 하지 않으므로 중간값이 정확하지 않습니다.
2. n이 짝수일 때 중앙값의 위치를 잘못 결정하는 경우 (중간 두 값의 평균을 취해야 함).
3. 집단 데이터의 경우, 중앙값 계급을 선택하는 것은 누적 빈도를 생성하지 않으므로 잘못된 방법입니다.
4. 데이터가 연속적이거나 구간이 정수인 경우 하위 경계(L) 클래스의 하한값을 사용합니다.
5. 특히 구간이 일관되지 않은 경우, 계급 길이(c)를 잘못 결정하는 경우.
-
5. 페누투프
중앙값은 특히 데이터에 극단값이 포함되어 있을 때 중심 경향을 나타내는 간단하면서도 강력한 척도입니다. 단일 데이터 세트의 경우, 데이터를 정렬한 후 가운데 위치를 직접 계산하며, 데이터 세트의 개수가 홀수와 짝수일 때 처리 방식이 다릅니다. 한편, 그룹화된 데이터 세트의 경우, 중앙값 계급, 누적 빈도, 계급 길이를 기반으로 하는 보간법을 사용하여 중앙값을 계산합니다.
개념과 계산 단계를 이해하면 단순 데이터뿐 아니라 표로 요약된 데이터에서도 중앙값을 빠르고 정확하게 계산할 수 있습니다. 특히 데이터 분포가 비대칭이거나 이상치가 포함된 경우, 많은 분석 상황에서 중앙값은 평균보다 더 대표적인 선택이 될 수 있습니다.
원하시면, 개별 데이터와 그룹 데이터의 중앙값에 대한 이해를 높이기 위해 연습 문제와 해설을 추가해 드릴 수도 있습니다.