最小二乘法:一种数学估计方法
彭达胡乱
最小二乘法是一种统计技术,用于估计回归模型中的参数,其方法是最小化实际值与模型预测值之间的误差平方和。该方法非常流行,广泛应用于经济学、工程学、生物学和社会科学等各个领域。最小二乘法的概念最早由阿德里安-马里·勒让德于19世纪初提出,后经卡尔·弗里德里希·高斯进一步发展完善。
基本理解
一般来说,最小二乘法旨在通过最小化残差平方和(或预测误差)来找到数据集的最佳拟合回归线。残差是观测值与预测值之间的差值。
如果我们有一个由观测值对组成的数据集 \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)\),那么我们的目标是找到直线 \(y = mx + b\),使平方误差和 sum\( \sum_{i=1}^{n} (y_i – (mx_i + b))^2 最小化。
这种方法既适用于简单线性回归,也适用于多元线性回归。简单线性回归只有一个自变量(x),而多元线性回归则涉及多个自变量。
简单线性回归
我们先从简单的线性回归开始。假设我们有一个数据集 \((x_1, y_1), (x_2, y_2), …, (x_n, y_n))。我们想要拟合的简单线性回归模型是:
\[ y = mx + b + \epsilon \]
其中 \( m \) 为斜率,\( b \) 为截距,\( \epsilon \) 为随机误差。
利用最小二乘法,我们可以通过最小化平方误差函数来找到参数 \( m \) 和 \( b \) 的估计值:
\[ S(m, b) = \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \]
为了最小化 \( S(m, b) \),我们求出 \( S \) 对 \( m \) 和 \( b \) 的偏导数,然后求解该方程得到 \( m \) 和 \( b \):
\[ \begin{aligned}
\frac{\partial S}{\partial m} &= -2 \sum_{i=1}^{n} x_i (y_i – (mx_i + b)) = 0 \\
\frac{\partial S}{\partial b} &= -2 \sum_{i=1}^{n} (y_i – (mx_i + b)) = 0
\end{aligned} \]
经过简化,我们得到以下两个正规方程:
\[ \begin{aligned}
n\bar{y} &= m \sum_{i=1}^{n} x_i + nb \\
\sum_{i=1}^{n}x_i y_i &= m \sum_{i=1}^{n}x_i^2 + b \sum_{i=1}^{n}x_i
\end{aligned} \]
通过求解上述方程组,我们可以找到使平方误差最小的 \( m \) 和 \( b \) 的值。
多元线性回归
在多元线性回归中,我们会遇到有多个自变量的情况。假设我们的数据以元组 \((x_{i1}, x_{i2}, …, x_{ik}, y_i)\) 的形式存在。我们使用的回归模型是:
\[ y = b_0 + b_1 x_1 + b_2 x_2 + … + b_k x_k + \epsilon \]
该方程可以写成矩阵形式:
\[ \mathbf{y} = \mathbf{X} \mathbf{b} + \mathbf{\epsilon} \]
di mana:
– \( \mathbf{y} \) 是观测到的 y 值的列向量。
– \( \mathbf{X} \) 是一个观测到的 x 值矩阵(包括第 1 列截距)。
– \( \mathbf{b} \) 是参数的列向量(包括 \( b_0 \))。
最小二乘法的目标是最小化以下二次误差函数:
\[ S(\mathbf{b}) = (\mathbf{y} – \mathbf{Xb})^T (\mathbf{y} – \mathbf{Xb}) \]
为了最小化该函数,我们对 S 关于 \( \mathbf{b} \) 求偏导数并令其为零。由此得到多元线性回归的正规方程:
\[ \mathbf{X}^T \mathbf{Xb} = \mathbf{X}^T \mathbf{y} \]
通过求解上述方程组,我们可以得到参数 \( \mathbf{b} \): 的估计值
\[ \mathbf{b} = (\mathbf{X}^T \mathbf{X})^{-1} \mathbf{X}^T \mathbf{y} \]
优势与局限性
最小二乘法有很多优点。它是一种非常高效且简便的方法。如果 \( \mathbf{X}^T \mathbf{X} \) 可逆,它能提供唯一解,因此在许多实际应用中非常可靠。
然而,最小二乘法也存在局限性。它对异常值非常敏感,因为平方误差更侧重于较大的差异而非较小的差异。此外,为了获得良好的结果,必须满足误差服从均值为零、方差恒定的正态分布这一经典假设。
应用实践
最小二乘法常用于数据趋势分析、预测和机器学习中,以构建预测模型。在金融行业,最小二乘法用于预测股票价格或市场表现。在医学领域,它用于模拟药物剂量与患者反应之间的关系。在社会科学领域,它有助于理解教育和收入等变量之间的关系。
结论
最小二乘法是统计学和数据分析中的基础技术之一。虽然概念简单,但该方法在建模和理解变量间关系方面却非常强大。由于其应用范围广泛,对专业人士和研究人员而言,深入理解该方法都至关重要。展望未来,随着大数据时代数据量的不断增长,最小二乘法等经典方法的改进和应用将变得越来越重要。