线性回归示例问题及讨论
线性回归是一种用于确定两个或多个变量之间关系的统计方法。该方法广泛应用于经济学、商业、社会科学和自然科学等各个领域。本文将探讨线性回归的概念、计算方法,并提供几个例题及解释,以帮助读者深入理解这一概念。
理解线性回归
线性回归是一种分析方法,用于建立一个或多个自变量(预测变量)与一个因变量(响应变量)之间的关系模型。简单线性回归涉及一个自变量和一个因变量,而多元线性回归涉及多个自变量。
简单线性回归线的方程为:
\[ Y = a + bX \]
在哪里:
– \( Y \) 是因变量。
– \( X \) 是自变量。
– \( a \) 是截距,即当 X = 0 时 Y 的值。
– \( b \) 是回归系数,即当 X 变化一个单位时,Y 变化多少。
线性回归步骤
1. 收集数据:首先,收集要分析的数据。
2.绘制数据:创建散点图,看看变量之间是否存在线性关系。
3. 计算回归系数:使用最小二乘法确定最佳直线。
4. 检验模型:用 t 检验检验回归系数的显著性,并确定 R 平方值,以查看模型与数据的拟合程度。
康托·索尔·丹·彭巴哈桑
例题 1:简单线性回归
问题:
一位研究人员想要了解学习时长(X)与学生考试成绩(Y)之间的关系。所获得的数据如下:
| 学习时长(X) | 考试成绩(Y) |
|——————–|——————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
根据这些数据建立线性回归方程!
讨论:
1. 计算平均值:
\[
X̄ = (2 + 3 + 5 + 7 + 8)/5 = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. 计算回归系数 \( b \):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum (X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \approx 3.08
\]
3. 计算截距 \( a \):
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 × 5 = 80 – 15.4 = 64.6
\]
4. 回归方程:
\[
Y = 64.6 + 3.08X
\]
因此,该数据的线性回归方程为 \( Y = 64.6 + 3.08X \)。这意味着每增加一小时的学习时间,预计考试成绩将提高 3.08 分。
例题 2:模型测试及解读
问题:
继续使用相同的数据,计算 R 平方 (R²) 值来衡量模型与数据的拟合程度。此外,检验回归系数 \( b \) 的显著性。
讨论:
1. 计算总平方和(SST)、回归平方和(SSR)和误差平方和(SSE):
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
SST = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \sum (\hat{Y}_i – \bar{Y})^2
\]
其中 \( \hat{Y}_i \) 是回归方程的预测值:
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
Ȳ = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
2. 计算 SSE:
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
3. 计算 R 平方值:
\[
R² = \frac{SSR}{SST} = \frac{149.8}{250} \approx 0.6
\]
R平方值为0.6表明该模型可以解释数据中约60%的变异。这表明回归线与数据拟合得相当好。
4. 系数 \( b \) 显著性的 t 检验:
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = \sqrt{33.4} / \sqrt{26} \approx 1.13
\]
\[
t = \frac{3.08}{1.13} \approx 2.73
\]
假设 t 统计量约为 2.73,并使用常用的显著性阈值 (α = 0.05),则将其与 t 分布表进行比较。例如,对于自由度 df = 3,临界 t 值约为 2.353。此时,t 观测值大于临界值,表明该系数显著。
结论
本文介绍了线性回归的基础知识,包括如何计算回归系数和截距,以及如何通过例题解释结果。熟练运用此方法需要经常使用各种数据集进行练习。线性回归是数据分析中一种非常有效的工具,能够深入揭示变量之间的关系。