Пример за дискусионен въпрос относно коефициента на детерминация
Коефициентът на детерминация (R²) е важен параметър в регресионния анализ, показващ колко добре един регресионен модел обяснява действителната вариабилност на данните. В тази статия ще обясним концепцията за коефициента на детерминация чрез подробен пример и дискусия.
Основна концепция за коефициент на детерминация
Коефициентът на детерминация или \(R^2 \) се измерва по скала от 0 до 1, където:
– \( R^2 = 0 \) показва, че регресионният модел изобщо не е в състояние да обясни променливостта на данните.
– \( R^2 = 1 \) показва, че регресионният модел е в състояние да обясни перфектно цялата вариабилност на данните.
Основната формула за изчисляване на коефициента на детерминация е:
\[ R^2 = 1 – \frac{SSR}{SST} \]
Къде:
– SSR (Сума от квадрати на остатъци) е сумата от квадратите на разликите между стойностите, предсказани от модела, и действителните стойности.
– SST (Обща сума на квадратите) е сборът от сумата на квадратите на разликите между действителната стойност и средната стойност на действителните стойности.
Пример за проблеми
Нека обсъдим примерна задача, за да разберем по-задълбочено изчисляването на коефициента на детерминация.
Пример за проблеми:
Да предположим, че имаме данни за броя на учебните часове (X) и резултатите от изпитите (Y) на 10 студенти:
| Студенти | Учебни часове (X) | Резултат от изпита (Y) |
|——-|——————–|——————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |
Ще създадем прост линеен регресионен модел, където резултатите от изпитите (Y) се прогнозират въз основа на учебните часове (X).
Дискусия
1. Изграждане на прост линеен регресионен модел
Един прост линеен регресионен модел има вида:
\[ Y = a + bX \]
Къде:
– \( Y \) е прогнозираният резултат от теста.
– \( X \) е броят на учебните часове.
– \( a \) е пресечната точка (точката на пресичане с оста Y, когато X = 0).
– \( b \) е наклонът (наклонът на регресионната линия).
За да изчислим параметрите (a) и (b), използваме следната формула:
\[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
\[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]
Където \(n \) е броят на данните (в този случай n = 10).
От таблицата можем да изчислим:
– \(\sum{X} = 36\)
– \(\sum{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\sum{Y^2} = 50428\)
– \(\sum{XY} = 2576\)
Нека първо изчислим b:
\[b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
\[b = \frac{25760 – 25344}{1400 – 1296} \]
\[b = \frac{416}{104} \]
\[ b = 4 \]
След това изчисляваме:
\[ a = \frac{704 – 4(36)}{10} \]
\[ a = \frac{704 – 144}{10} \]
\[ a = \frac{560}{10} \]
\[ a = 56 \]
И така, моделът на линейна регресия, който получаваме, е:
\[Y = 56 + 4X \]
2. Изчислете прогнозираната стойност (Y')
След това изчисляваме прогнозираната стойност (Y') за всяко (X):
| Студенти | Учебни часове (X) | Резултат от изпита (Y) | Прогнозиран резултат (Y') |
|——-|——————–|——————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |
3. Изчисляване на SSR и SST
След това изчисляваме SSR и SST, за да получим \( R^2 \).
SSR:
\[ SSR = \sum{(Y – Y')^2} \]
\[ ССР = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
\[SSR = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
\[SSR = 454 \]
SST:
\[ SST = \sum{(Y – \bar{Y})^2} \]
Къде:
\[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]
\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[ SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
\[ SST = 1107.44 \]
4. Изчисляване на коефициента на детерминация \( R^2 \):
\[ R^2 = 1 – \frac{SSR}{SST} \]
\[R^2 = 1 – \frac{454}{1107.44} \]
\[R^2 = 1 – 0.41 \]
\[R^2 = 0.59 \]
Заключение
От горното изчисление получихме коефициент на детерминация (R2 = 0.59). Това показва, че създаденият от нас линеен регресионен модел може да обясни приблизително 59% от променливостта в резултатите от изпитите въз основа на учебните часове. Останалите 41% от променливостта може да се дължи на други фактори, които не са включени в модела.
Като разберем стъпките и изчисленията по-горе, можем да видим значението на коефициента на детерминация при оценката на това колко добре изграденият от нас регресионен модел обяснява действителната вариабилност на данните. Той е много полезен инструмент в статистическия анализ и моделирането на данни.