데이터를 계급 구간으로 그룹화하는 방법
데이터를 계급 구간으로 나누는 것은 기술 통계에서 매우 중요한 단계입니다. 그 목적은 방대한 양의 원시 데이터를 단순화하여 읽기, 분석, 그리고 빈도 분포표나 히스토그램으로 나타내기 쉽게 만드는 것입니다. 데이터가 너무 다양하고 흩어져 있으면 패턴을 파악하기 어려운 경우가 많습니다. 계급 구간은 데이터를 특정 값 그룹으로 분류하여 데이터 분포, 가장 빈번하게 나타나는 값, 심지어 중심 경향까지 더 명확하게 이해할 수 있도록 해줍니다.
이 글에서는 계급 구간의 의미, 필요한 경우, 그리고 응용 예시와 함께 데이터를 계급 구간으로 분류하는 실질적인 단계에 대해 설명합니다.
1. 계급 구간 이해하기
계급 구간은 빈도 분포에서 데이터를 그룹화하는 데 사용되는 값의 범위입니다. 각 구간에는 일반적으로 하한과 상한이 있습니다. 예를 들어, 10~19 구간은 10과 19 사이의 값을 가진 모든 데이터가 해당 계급에 속함을 나타냅니다.
빈도 분포표에서 계급 구간은 유사한 값들을 담는 "칸" 역할을 합니다. 이를 통해 모든 값을 개별적으로 나열하는 것보다 데이터를 간결하게 표현할 수 있습니다. 또한 계급 구간은 히스토그램이나 빈도 다각형과 같은 그래프를 만드는 기초가 됩니다.
2. 데이터는 언제 그룹화해야 하나요?
모든 데이터를 계급 구간으로 나눌 필요는 없습니다. 일반적으로 다음과 같은 경우에 그룹화가 필요합니다.
1. 방대한 양의 데이터, 예를 들어 30개 또는 50개 이상의 관측치.
2. 데이터 범위가 넓어 값이 흩어져 있어 읽기 어렵습니다.
3. 우리는 데이터의 분포 패턴을 확인하고 싶습니다. 예를 들어 데이터가 정규 분포를 따르는지, 비대칭 분포를 보이는지, 아니면 두 개의 봉우리가 있는지 등을 알아보고 싶습니다.
4. 히스토그램은 구간형 계급을 필요로 하므로, 데이터는 히스토그램으로 제시될 것입니다.
데이터의 양이 적은 경우(예: 10개 값), 구간을 포함하지 않고 단일 빈도표만으로도 충분한 경우가 많습니다.
3. 데이터를 계급 구간으로 그룹화하는 단계
계급 구간을 구하는 데 가장 일반적으로 사용되는 단계는 다음과 같습니다.
1단계: 최소값과 최대값 데이터 결정
먼저 데이터의 최소값과 최대값을 확인합니다.
– 최솟값 = \( x_{\min} \)
– 최댓값 = \( x_{\max} \)
이 값은 데이터의 범위를 계산하는 데 사용됩니다.
2단계: 범위 계산
범위는 최댓값과 최솟값의 차이입니다.
\[
R = x_{\max} – x_{\min}
\]
범위는 데이터 분포의 폭을 나타냅니다.
3단계: 클래스 수(k)를 결정합니다.
학급 수는 여러 가지 방법으로 결정할 수 있습니다. 가장 일반적인 방법은 스터지스 법칙을 사용하는 것입니다.
\[
k = 1 + 3{,}3 \log_{10}(n)
\]
여기서 \( n \)은 데이터의 양입니다.
계산 결과는 일반적으로 가장 가까운 정수(또는 올림)로 반올림되어 학급 수가 너무 적어지지 않도록 합니다.
스터지스 검정 외에도, 시각화 요구 사항과 표본 크기에 따라 5~12 사이의 클래스 크기를 선택하는 것이 일반적인 방법입니다. 하지만 스터지스 검정은 작은 데이터 세트에 특히 적합합니다.
4단계: 계급 너비(i) 계산
계급 너비는 각 계급 구간의 길이입니다. 공식은 다음과 같습니다.
\[
i = \frac{R}{k}
\]
계급 너비는 사용하기 쉬워야 하므로 일반적으로 데이터의 맥락에 따라 5, 10, 2 또는 0,5와 같은 "깔끔한" 숫자로 반올림됩니다. 이러한 반올림은 구간을 쉽게 읽고 혼동을 방지하는 데 중요합니다.
반올림 결과 때문에 모든 데이터를 포함할 수 없는 경우, 계급 너비를 약간 늘릴 수 있습니다.
5단계: 계급 구간 결정
최솟값을 첫 번째 구간의 하한값으로 설정합니다. 그런 다음 최댓값을 포함할 때까지 연속적인 구간을 생성합니다.
예를 들어, 최소값이 32이고 클래스 너비가 5인 경우 다음과 같이 클래스를 생성할 수 있습니다.
– 32~36
– 37~41
– 42~46
- 등.
중요: 클래스 간에 공백이나 중복이 없도록 하십시오. 모든 데이터 값은 정확히 하나의 클래스에 속해야 합니다.
6단계: (선택 사항) 클래스 경계 생성
데이터가 정수형(예: 시험 점수)인 경우, 계급 구간을 연속형으로 만들기 위해 계급 경계를 설정하는 경우가 많습니다. 이는 상한값에 0,5를 더하고 하한값에서 0,5를 빼는 방식으로 이루어집니다.
예를 들어, 32~36반의 경우, 반 경계는 다음과 같습니다.
– 31,5~36,5
이는 히스토그램에서 막대들이 간격 없이 연결되도록 하는 데 유용합니다.
7단계: 각 계급의 빈도를 계산합니다.
계급 구간이 결정되면 각 구간에 속하는 데이터 포인트의 개수를 셉니다. 그 결과는 빈도 열(f)에 기록됩니다.
데이터 양이 많을 경우, 집계 방식을 사용하면 속도를 높이고 오류를 줄일 수 있습니다.
8단계: 빈도 분포표 작성
최소 빈도 분포표에는 다음 내용이 포함됩니다.
– 계급 구간
– 주파수(f)
다음과 같은 열을 추가할 수 있습니다.
– 계급의 중간점(xi)
– 누적 빈도
– 상대 빈도(백분율)
4. 데이터 그룹화 예시
예를 들어, 최저 점수 42점, 최고 점수 94점을 받은 40명의 학생의 시험 점수 데이터가 있습니다.
1. 최소 = 42, 최대 = 94
2. 범위 :
\[
R = 94 – 42 = 52
\]
3. 수업 수 (Sturges):
\[
k = 1 + 3{,}3 \log(40)
\approx 1 + 3{,}3(1{,}602)
약 6,29
\]
반올림해서 6~7개 수업으로 정했습니다. 더 자세한 설명을 위해 7개 수업을 선택했습니다.
4. 클래스 너비:
\[
i = \frac{52}{7} \approx 7{,}43
\]
8로 반올림했습니다.
5. 42부터 시작하여 너비가 8인 간격을 만드세요.
– 42~49
– 50~57
– 58~65
– 66~73
– 74~81
– 82~89
– 90~97
마지막 구간은 97에 도달했으므로 최대값인 94도 여전히 허용되었습니다.
6. 다음으로, 데이터를 기반으로 각 구간의 빈도를 계산합니다(예: 그래프 사용). 최종 표는 특정 점수 범위에 속하는 학생 수를 보여주므로, 학생들의 성과를 빠르게 평가할 수 있습니다.
5. 수업 구간을 더욱 효과적으로 만드는 팁
1. 표들을 쉽게 비교할 수 있도록 일관된 클래스 너비를 사용하세요.
2. 괄호를 너무 많이 사용하지 마세요. 표가 길어져서 읽기 어려워집니다.
3. 수업 수가 너무 적으면 중요한 정보가 누락될 수 있고 분포가 너무 불규칙해 보일 수 있으므로 수업 수를 너무 적게 두지 마십시오.
4. 데이터의 맥락에 맞게 계급 너비의 반올림 값을 조정합니다. 온도 데이터의 경우 1 또는 0,5가 적절할 수 있으며, 시험 점수 데이터의 경우 일반적으로 5 또는 10이 적절합니다.
5. 모든 데이터가 누락된 값 없이 입력되었는지 확인하기 위해 클래스 경계를 다시 한번 확인하십시오.
결론
데이터를 계급 구간으로 나누는 것은 데이터를 단순화하고 분포를 명확하게 나타내는 중요한 기법입니다. 이 과정에는 최솟값과 최댓값 결정, 범위 계산, 계급 개수 결정(종종 스터지스 공식 사용), 계급 너비 계산, 계급 구간 설정, 그리고 각 계급의 빈도 계산이 포함됩니다. 적절한 계급 구간을 사용하면 복잡한 원시 데이터를 표나 그래프 형태로 쉽게 이해할 수 있는 정보로 변환할 수 있습니다.
원하시면 원시 데이터(값 목록)를 사용하여 전체 예시를 만들고, 이를 바탕으로 빈도 분포표와 히스토그램을 작성해 드릴 수도 있습니다.