統計データにおける四分位数、十分位数、百分位数の計算方法
統計学では、データセット内の値の位置を特定する必要があることがよくあります。平均値や中央値を計算するだけでは不十分です。これらの指標では、データの分布状況や、ある観測値が他の観測値とどのように比較されるかを適切に表現できないからです。そこで、四分位数、十分位数、百分位数といった指標が重要になります。これらは、ソートされたデータを等しい部分に分割する位置指標です。この記事では、これらの定義、一般的な手順、そして単一データセットとグループ化されたデータセットの両方における四分位数、十分位数、百分位数の計算方法について説明します。
-
1. 基本概念:データはソートされなければならない
四分位数、十分位数、または百分位数を計算する前に、最も重要な手順は、データを小さい順から大きい順に並べ替えることです。データが並べ替えられたら、インデックスの位置に基づいて、四分位数、十分位数、または百分位数の位置を特定できます。
一般的に:
四分位数はデータを4つの部分に分割します。
デシルとは、データを10等分するものです。
パーセンタイルはデータを100等分します。
実際には、四分位数、十分位数、百分位数は、テストの点数、収入データ、人体計測値(身長/体重)、および業績評価の分析によく用いられます。
-
2. 四分位数(Q1、Q2、Q3)の計算方法
A. 単一データにおける四分位数(グループ化されていないデータ)
四分位数は以下で構成されます。
– Q1:下位四分位数(データの25%がそれ以下)
– Q2:中央値(50%)
– Q3:上位四分位(75%)
単一データの四分位数を計算する手順:
1. データを並べ替える。
2. 位置の公式を用いて四分位位置を計算します。
– 位置 Q1 = \((n+1)/4\)
– 位置 Q2 = \(2(n+1)/4\) または \((n+1)/2\)
– 位置 Q3 = \(3(n+1)/4\)
位置が整数の場合は、その位置の値を取得します。位置が小数の場合は、補間(最も近い2つのデータポイント間の値を取得)します。
簡単な例を挙げます。
ソートされたデータ: 4, 6, 7, 8, 10, 12, 13, 15 (n = 8)
位置 Q1 = (8+1)/4 = 2,25 → は 2 番目のデータと 3 番目のデータの間にあります。
したがって、Q1は6と7の間です。補間:
Q1 = 6 + 0,25(7−6) = 6,25。
-
B. グループ化されたデータにおける四分位数(度数分布)
グループ化されたデータ(例:階級間隔)の場合、四分位数は次の式を使用して計算されます。
\[
Q_k = L + \left( \frac{\left(\frac{k}{4}n – F\right)}{f} \right) \times c
\]
ケテランガン:
– \(Q_k\): k 四分位数 (k = 1,2,3)
– \(L\): 四分位階級の下限
– \(n\): データ数(総頻度)
– \(F\): 四分位階級前の累積頻度
– \(f\): 四分位階級における頻度
– \(c\): クラスの長さ
一般的な手順:
1. 累積頻度を作成します。
2. 四分位数 \(k/4 \times n\) の位置を決定します。
3. その位置を含むクラスを見つけます。
4. 式に入力します。
-
3.デシル(D1~D9)の計算方法
デシルはデータを10等分し、以下のようになります。
– \(D_1\)はデータの下位10%の限界を示します。
– \(D_5\) は中央値に等しい。
– \(D_9\)は90%のデータ制限を示します。
A. 単一データにおけるデシル
デシル位置の計算式:
\[
位置 D_k = \frac{k(n+1)}{10}
\]
\(k = 1,2,\dots,9\)。
位置がわかったら、値の取得方法は四分位数の場合と同じです。整数であればそのまま取得し、小数であれば補間します。
-
B. グループ化されたデータのデシル
グループ化されたデータのデシル計算式:
\[
D_k = L + \left( \frac{\left(\frac{k}{10}n – F\right)}{f} \right) \times c
\]
説明は四分位数と同じですが、除数が10である点が異なります。
ランカ:
1. \(k/10 \times n\) を計算します。
2. 累積度数に基づいてデシル階級を決定する。
3. 式に代入します。
デシルは経済分析でよく用いられ、例えば人々の所得を10のグループに分ける(デシル1が最も貧しく、デシル10が最も裕福である)。
-
4. パーセンタイル(P1~P99)の計算方法
パーセンタイルはデータを100等分するため、より詳細な情報が得られます。P25は第1四分位数、P50は中央値、P75は第3四分位数に相当します。つまり、四分位数は実際にはパーセンタイルの特殊なケースと言えます。
A. 単一データのパーセンタイル
パーセンタイル順位の計算式:
\[
位置 P_k = \frac{k(n+1)}{100}
\]
\(k = 1,2,\dots,99\)。
手順は同じです。データをソートし、位置を計算し、値を取得するか、補間します。
-
B. グループ化されたデータにおけるパーセンタイル
グループ化されたデータのパーセンタイル計算式:
\[
P_k = L + \left( \frac{\left(\frac{k}{100}n – F\right)}{f} \right) \times c
\]
手順はデシル/四分位数の場合と全く同じです。
1. 位置 \(k/100 \times n\) を決定します。
2. 累積度数のパーセンタイル階級を求めます。
3. 公式を使用します。
パーセンタイルは、学業成績や健康状態の評価によく用いられます。例えば、身長が80パーセンタイルであるということは、その子どもが同年齢の子どもの80%よりも身長が高いことを意味します。
-
5.重要なヒントとよくある間違い
1. データはソートする必要があります(特に単一データの場合)。ソートしないと、四分位数、十分位数、パーセンタイルは意味をなしません。
2. 連続的な概念を使用する場合は、グループ化されたデータに対してクラス境界ではなくクラスエッジを使用するようにしてください。
3. 累積度数は正しくなければなりません。なぜなら、四分位数、十分位数、百分位数は累積度数から決定されるからです。
4. クラス長(c)に注意してください。クラス長は計算結果に影響するため、間違ってはいけません。
5. 位置が四捨五入されていない場合は、補間が重要になります。多くの学生は、精度が低下する可能性があるにもかかわらず、すぐに位置を四捨五入してしまいます。
-
6. ペヌトゥプ
四分位数、十分位数、百分位数は、データの分布を理解するための重要な統計ツールです。四分位数は単純な要約(例えば、箱ひげ図)に適しており、十分位数は所得分析などのより詳細なグループ分けに役立ちます。一方、百分位数は、母集団内における特定の個人の位置を評価するのに役立ちます。データの順序付け、位置の決定、単一データまたはグループデータに適した数式の使用といった基本的な手順を理解することで、四分位数、十分位数、百分位数をより高い精度と信頼性で計算できるようになります。
ご希望であれば、グループ化されたデータ表(間隔、度数、累積度数)の完全な例を追加し、Q1、D7、P85を詳細に計算して、練習しやすくすることもできます。