그룹화된 데이터에 대한 히스토그램 작성 기법
히스토그램은 통계학에서, 특히 군집화된 데이터를 다룰 때 자주 사용되는 데이터 표현 도구입니다. 개별 범주를 표시하는 일반 막대 그래프와 달리, 히스토그램은 계급 구간으로 그룹화된 수치 데이터의 빈도 분포를 보여줍니다. 히스토그램을 통해 데이터 분포 패턴, 추세(예: 오른쪽 또는 왼쪽으로 치우침), 심지어 분포 형태(정규 분포, 비대칭 분포, 이봉 분포 등)까지 파악할 수 있습니다. 이 글에서는 빈도 분포표 작성부터 정확한 히스토그램 그리기까지, 군집화된 데이터에 대한 히스토그램을 체계적으로 작성하는 기법을 다룹니다.
1. 그룹화된 데이터와 히스토그램 이해하기
그룹화된 데이터는 여러 계급 구간으로 요약된 수치 데이터입니다. 예를 들어, 학생 시험 점수는 더 이상 개별적으로 표시되지 않고 40~49, 50~59, 60~69 등과 같은 범위로 그룹화됩니다. 각 구간에는 빈도가 있으며, 이는 해당 구간에 포함되는 데이터 포인트의 개수입니다.
히스토그램은 연속적인 값의 범위를 나타내기 때문에 간격이 없거나 매우 작은 막대들이 촘촘하게 배열된 그래프입니다. 막대의 너비는 계급 구간의 길이를 나타내고, 막대의 높이는 빈도 또는 빈도 밀도(계급 너비가 같은지 다른지에 따라 다름)를 나타냅니다.
2. 빈도 분포표 작성
히스토그램을 만드는 첫 번째 단계는 빈도 분포표를 작성하는 것입니다. 이 과정은 일반적으로 다음과 같은 단계를 포함합니다.
1. 데이터의 최소값과 최대값을 구하십시오.
2. 범위는 최댓값에서 최솟값을 뺀 값으로 계산합니다.
3. 학급의 개수(k)를 결정합니다.
4. 계급 길이(p)를 구합니다. (p = 범위 / k, 필요한 경우 반올림).
5. 계급 구간을 나누고 각 구간의 빈도를 계산합니다.
학급 수를 결정하는 데에는 여러 가지 지침이 있습니다. 그중 하나는 스터지스 공식입니다.
k = 1 + 3,3 log10(n)
여기서 n은 데이터 포인트의 개수입니다. k의 결과는 가장 가까운 정수로 반올림됩니다.
간단한 예: n = 40인 경우 k ≈ 1 + 3,3 log10(40) ≈ 1 + 3,3(1,602) ≈ 6,29이므로 6개 또는 7개의 클래스를 선택할 수 있습니다.
3. 클래스 경계 및 클래스 에지 결정
히스토그램을 작성할 때 흔히 저지르는 실수는 계급 경계와 계급 모서리를 혼동하는 것입니다.
계급 구간은 50~59와 같이 간격으로 쓰인 숫자입니다.
학급 경계는 학급들을 분리하는 연속적인 경계로서, 학급들 사이에 "간격"이 없도록 합니다.
데이터가 정수인 경우, 일반적으로 0,5를 더하고 빼서 학급 경계를 결정합니다.
콘토:
– 50~59 구간의 클래스 간선은 49,5~59,5입니다.
– 60~69 구간의 클래스 간선은 59,5~69,5입니다.
따라서 각 클래스의 경계는 59,5에서 만나므로 히스토그램이 통합되어 진정한 연속성을 나타내는 것처럼 보입니다.
하지만 데이터가 연속적인 측정값(예: 키(cm)이며 소수점 이하 자릿수가 있는 경우)인 경우, 계급 경계를 결정하는 것은 측정의 정확도에 따라 달라집니다. 핵심 원칙은 계급 경계가 겹치지 않고 간격이 생기지 않도록 하는 것입니다.
4. X축과 Y축의 눈금 크기를 결정합니다.
히스토그램에는 두 개의 주요 축이 있습니다.
– X축(가로): 계급 구간을 표시합니다(일반적으로 연속성을 보장하기 위해 계급 경계를 사용합니다).
– Y축(세로): 빈도를 나타냅니다.
계급 구간의 너비가 모두 같으면 막대 높이는 빈도를 이용하여 간단히 계산할 수 있습니다. 하지만 계급 구간의 너비가 서로 다르면 막대 높이는 빈도 밀도를 이용하여 계산해야 합니다.
빈도 밀도 = 빈도 / 계급 너비
밀도를 사용하는 것이 중요한 이유는 막대의 면적이 실제 빈도에 비례하도록 하기 위함입니다. 그렇지 않으면, 더 넓은 구간은 데이터 양이 더 많아서가 아니라 단순히 폭이 넓기 때문에 "더 크게" 보일 것입니다.
5. 히스토그램 막대 그리기
음계와 음정 간격이 정해지면 다음 단계는 악보를 그리는 것입니다.
히스토그램을 그리는 올바른 방법:
1. X축에 학급 경계를 순서대로 표시하십시오.
2. 각 간격마다 해당 간격과 너비가 같은 직사각형 막대를 그리세요.
3. 막대의 높이는 빈도(또는 계급 너비가 같지 않은 경우 빈도 밀도)에 해당합니다.
4. 줄기들이 서로 틈 없이 밀착되도록 심으세요.
5. 히스토그램에 제목을 붙이고, X축과 Y축에 레이블을 지정하고, 필요한 경우 단위를 표시하십시오.
예를 들어, 계급 구간이 40~49, 50~59, 60~69이고 각 계급의 빈도가 5, 12, 18이라면, 60~69 계급의 빈도가 가장 크기 때문에 해당 계급의 막대가 다른 계급보다 높게 표시됩니다.
6. 히스토그램 읽기 및 해석
히스토그램은 단순한 그림이 아니라 분석 도구입니다. 히스토그램을 통해 다음과 같은 정보를 얻을 수 있습니다.
– 최빈값 클래스: 막대 그래프의 높이가 가장 높은 클래스(빈도가 가장 높은 클래스).
– 분포 형태: 대칭형, 오른쪽으로 치우친 형태(양의 왜곡), 왼쪽으로 치우친 형태(음의 왜곡), 또는 두 개의 봉우리가 있는 형태(이봉형).
– 데이터 분포: 데이터가 특정 구간에 집중되어 있는지 아니면 넓게 분포되어 있는지 여부.
– 이상치 표시: 데이터셋의 맨 끝에 빈도가 낮고 주요 그룹과 분리된 클래스가 있는 경우.
좋은 해석에는 일반적으로 간략한 결론이 수반됩니다. 예를 들어, "대부분의 데이터는 60~79 범위에 속하며, 이는 참가자들의 점수가 중간 범주에 속하는 경향이 있음을 나타냅니다."
7. 흔히 저지르는 실수
피해야 할 몇 가지 실수는 다음과 같습니다.
1. 막대 그래프처럼 보이도록 막대 사이에 간격을 두세요.
2. 클래스 경계를 사용하고 클래스 가장자리를 사용하지 않으므로 데이터 범위에 간격이 생깁니다.
3. 계급 너비가 다를 때 막대 높이를 조정하지 않아 빈도 비교에 편향이 발생합니다.
4. 축 눈금이 일관되지 않거나 빈도 축에서 0부터 시작하지 않습니다(시각적으로 오해를 불러일으킬 수 있음).
5. 계급 구간이 연속적이지 않거나 겹치지 않습니다. 예를 들어 50-60과 60-70처럼 계급 경계에 대한 설명이 없습니다.
8. 히스토그램을 더욱 유익하게 만드는 실용적인 팁
히스토그램을 더 쉽게 이해할 수 있도록 하기 위해:
– 적절한 수의 클래스를 사용하세요(일반적으로 데이터 양에 따라 5~12개 클래스).
- 구간이 너무 좁으면(클래스가 너무 많으면) 히스토그램이 "잡음"이 많아지므로 피하십시오.
– 구간이 너무 넓으면(계통수가 너무 적으면) 분포 패턴이 제대로 드러나지 않으므로 피해야 합니다.
– 보고서에 필요한 경우 데이터 출처, 표본 크기(n) 및 기타 정보를 포함하십시오.
엑셀, 구글 시트 또는 통계 프로그램과 같은 소프트웨어를 사용하는 경우, 히스토그램 결과가 잘못되지 않도록 계급 경계와 계급 너비의 개념을 항상 이해해야 합니다.
폐회
군집 데이터의 히스토그램을 작성하는 기법은 계급 구간 설정, 계급 경계 결정, 그리고 적절한 막대 높이 설정에 있어 정확성을 요구합니다. 계급 구간이 균일한 경우, 막대 높이는 단순히 빈도로 설정하면 됩니다. 하지만 계급 구간이 균일하지 않은 경우에는 빈도 밀도를 사용하여 공정하고 정확한 시각화를 유지할 수 있습니다. 제대로 작성된 히스토그램을 통해 데이터 분포 패턴을 빠르게 파악하고 통계 분석에서 더욱 정확한 해석을 내릴 수 있습니다.
원하시면 샘플 데이터를 추가하고 히스토그램이 완성될 때까지 모든 계산 단계를 (수동으로 또는 엑셀/시트를 사용하여) 수행해 드릴 수 있습니다.