통계 데이터에서 사분위수, 십분위수 및 백분위수를 계산하는 방법

통계 데이터에서 사분위수, 십분위수 및 백분위수를 계산하는 방법

통계학에서 우리는 종종 데이터 세트 내에서 특정 값의 위치를 ​​파악해야 합니다. 단순히 평균이나 중앙값을 계산하는 것만으로는 충분하지 않습니다. 이러한 값들은 데이터의 분포 양상이나 특정 관측치가 다른 관측치들과 어떻게 비교되는지를 제대로 설명하지 못하기 때문입니다. 바로 이럴 때 사분위수, 십분위수, 백분위수가 유용하게 사용됩니다. 이 세 가지는 정렬된 데이터를 동일한 값으로 나누는 위치 측정값입니다. 이 글에서는 사분위수, 십분위수, 백분위수의 정의, 일반적인 계산 방법, 그리고 단일 데이터 세트와 그룹화된 데이터 세트 모두에 대한 계산법을 다룹니다.

-

1. 기본 개념: 데이터는 정렬되어 있어야 합니다.

사분위수, 십분위수 또는 백분위수를 계산하기 전에 가장 중요한 단계는 데이터를 작은 값부터 큰 값 순으로 정렬하는 것입니다. 데이터가 정렬되면 인덱스 위치를 기준으로 사분위수, 십분위수 또는 백분위수의 위치를 ​​​​확인할 수 있습니다.

일반적으로:
사분위수는 데이터를 4개의 부분으로 나눕니다.
데실은 데이터를 10개 부분으로 나눕니다.
백분위수는 데이터를 100개 부분으로 나눕니다.

실제로 사분위수, 십분위수, 백분위수는 시험 점수, 소득 데이터, 신체 계측(키/몸무게) 및 성과 평가 분석에 흔히 사용됩니다.

-

2. 사분위수(Q1, Q2, Q3) 계산 방법

A. 단일 데이터의 사분위수 (그룹화되지 않음)

사분위수는 다음과 같이 구성됩니다.
– Q1: 하위 사분위수(데이터의 25%가 이 값 아래에 있음)
– 2분기: 중앙값(50%)
– Q3: 상위 사분위수(75%)

단일 데이터 사분위수를 계산하는 단계:
1. 데이터를 정렬합니다.
2. 위치 공식을 사용하여 사분위수 위치를 계산합니다.
– 위치 Q1 = \((n+1)/4\)
– 위치 Q2 = \(2(n+1)/4\) 또는 \((n+1)/2\)
– 위치 Q3 = \(3(n+1)/4\)

위치가 정수이면 해당 위치의 값을 취합니다. 위치가 소수이면 보간법(가장 가까운 두 데이터 포인트 사이의 값)을 사용합니다.

간단한 예시:
정렬된 데이터: 4, 6, 7, 8, 10, 12, 13, 15 (n = 8)
위치 Q1 = (8+1)/4 = 2,25 → 두 번째 데이터와 세 번째 데이터 사이에 있습니다.
따라서 Q1은 6과 7 사이입니다. 보간법:
Q1 = 6 + 0,25(7−6) = 6,25.

-

B. 그룹화된 데이터에서의 사분위수 (빈도 분포)

그룹화된 데이터(예: 계급 구간)의 경우, 사분위수는 다음 공식을 사용하여 계산됩니다.

\[
Q_k = L + \left( \frac{\left(\frac{k}{4}n – F\right)}{f} \right) \times c
\]

설명 :
– \(Q_k\): k번째 사분위수 (k = 1,2,3)
– \(L\): 사분위수 계급의 하단
– \(n\): 데이터 개수(총 빈도)
– \(F\): 사분위수 계급 이전의 누적 빈도
– \(f\): 사분위수 계급의 빈도
– \(c\): 클래스 길이

일반적인 단계:
1. 누적 빈도를 구하십시오.
2. 사분위수의 위치를 ​​결정합니다: \(k/4 \times n\).
3. 해당 위치를 포함하는 클래스를 찾으세요.
4. 공식을 입력하세요.

-

3. 십분위수(D1~D9) 계산 방법

십분위수는 데이터를 10개 부분으로 나눕니다.
– \(D_1\)은 데이터의 하위 10% 한계를 나타냅니다.
– \(D_5\)는 중앙값과 같습니다.
– \(D_9\)는 90% 데이터 제한을 나타냅니다.

A. 단일 데이터의 십분위수

십분위수 위치 공식:
\[
위치 } D_k = \frac{k(n+1)}{10}
\]
\(k = 1,2,\dots,9\)인 경우.

위치를 구한 후에는 사분위수를 구할 때와 마찬가지로 값을 취하는 방법은 동일합니다. 정수이면 직접 취하고, 소수이면 보간법을 사용합니다.

-

B. 그룹화된 데이터의 십분위수

그룹화된 데이터에 대한 십분위수 공식:

\[
D_k = L + \left( \frac{\left(\frac{k}{10}n – F\right)}{f} \right) \times c
\]

설명은 사분위수와 동일하지만, 나누는 수가 10입니다.

Langkah :
1. \(k/10 \times n\)을 계산하세요.
2. 누적 빈도를 기준으로 십분위 계급을 결정합니다.
3. 공식에 대입합니다.

십분위수는 경제 분석에서 자주 사용되는데, 예를 들어 사람들의 소득을 10개 그룹으로 나누는 데 사용됩니다(1분위수는 가장 가난한 그룹이고 10분위수는 가장 부유한 그룹입니다).

-

4. 백분위수 계산 방법 (P1~P99)

백분위수는 데이터를 100개 부분으로 나누기 때문에 더 자세한 정보를 제공합니다. P25는 1사분위수, P50은 중앙값, P75는 3사분위수에 해당합니다. 즉, 사분위수는 백분위수의 특수한 경우라고 할 수 있습니다.

A. 단일 데이터에 대한 백분위수

백분위수 계산 공식:
\[
위치 } P_k = \frac{k(n+1)}{100}
\]
\(k = 1,2,\dots,99\)인 경우.

절차는 동일합니다. 데이터를 정렬하고, 위치를 계산한 다음, 값을 취하거나 보간합니다.

-

B. 그룹화된 데이터의 백분위수

그룹화된 데이터 백분위수 공식:

\[
P_k = L + \left( \frac{\left(\frac{k}{100}n – F\right)}{f} \right) \times c
\]

단계는 십분위수/사분위수와 동일합니다.
1. \(k/100 \times n\)의 위치를 ​​구하십시오.
2. 누적 빈도의 백분위 계급을 구하십시오.
3. 공식을 사용하세요.

백분위수는 학업 및 건강 평가에 자주 사용됩니다. 예를 들어, 아이의 키가 80번째 백분위수에 해당한다는 것은 그 아이가 같은 나이 또래 아이들 중 80%보다 키가 크다는 것을 의미합니다.

-

5. 중요한 팁과 흔히 저지르는 실수

1. 데이터는 정렬되어 있어야 합니다(특히 단일 데이터의 경우). 정렬되지 않은 데이터는 사분위수/십분위수/백분위수에 아무런 의미가 없습니다.
2. 연속형 개념을 사용하는 경우, 그룹화된 데이터에는 계급 경계가 아닌 계급 모서리를 사용해야 합니다.
3. 사분위수/십분위수/백분위수 계급은 누적 빈도를 기반으로 결정되므로 누적 빈도가 정확해야 합니다.
4. 계급 길이(c)에 주의하십시오. 계급 길이는 계산 결과에 영향을 미치므로 잘못되면 안 됩니다.
5. 위치를 반올림하지 않을 경우 보간법이 중요합니다. 많은 학생들이 위치를 즉시 반올림하는데, 이는 정확도를 떨어뜨릴 수 있습니다.

-

6. 페누투프

사분위수, 십분위수, 백분위수는 데이터 분포를 이해하는 데 중요한 통계 도구입니다. 사분위수는 간단한 요약(예: 상자 그림)에 적합하고, 십분위수는 소득 분석과 같은 보다 세부적인 그룹화에 유용하며, 백분위수는 모집단 내에서 특정 개인의 위치를 ​​평가하는 데 도움이 됩니다. 데이터 정렬, 위치 결정, 단일 데이터 또는 그룹 데이터에 적합한 공식 사용과 같은 기본 단계를 이해하면 사분위수, 십분위수, 백분위수를 더욱 정확하고 신뢰할 수 있게 계산할 수 있습니다.

원하시면, 그룹화된 데이터 표(간격, 빈도, 누적 빈도)의 전체 예시를 추가하고 Q1, D7, P85를 자세히 계산하여 연습하기 쉽도록 도와드리겠습니다.

댓글을 남겨주세요