Метод наименьших квадратов: математический подход к оценке
Пендаулуан
Метод наименьших квадратов — это статистический метод, используемый для оценки параметров в регрессионной модели путем минимизации суммы квадратов ошибок между фактическими значениями и значениями, предсказанными моделью. Этот метод очень популярен и часто используется в различных областях, таких как экономика, инженерия, биология и социальные науки. Концепция метода наименьших квадратов была впервые предложена Адриеном-Мари Лежандром в начале XIX века и впоследствии получила дальнейшее развитие у Карла Фридриха Гаусса.
Базовое понимание
В общем, метод наименьших квадратов направлен на поиск наилучшей линии регрессии для набора данных путем минимизации суммы квадратов остатков, или ошибок прогнозирования. Остаток — это разница между наблюдаемым значением и прогнозируемым значением.
Если у нас есть набор данных, состоящий из пар наблюдений \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)\), то наша цель — найти прямую \(y = mx + b\), которая минимизирует сумму квадратов ошибок sum\( \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \).
Этот метод применим как к простой линейной регрессии, так и к множественной линейной регрессии. В простой линейной регрессии у нас есть только одна независимая переменная (x), тогда как в множественной линейной регрессии задействовано более одной независимой переменной.
Простая линейная регрессия
Начнём с простой линейной регрессии. Предположим, у нас есть набор данных \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)). Модель простой линейной регрессии, которую мы хотим построить, выглядит следующим образом:
[ y = mx + b + \epsilon \]
где \( m \) — наклон, \( b \) — точка пересечения с осью Y, а \( \epsilon \) — случайная ошибка.
Используя метод наименьших квадратов, мы можем найти оценки параметров \( m \) и \( b \), минимизируя квадратичную функцию ошибок:
\[ S(m, b) = \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \]
Чтобы минимизировать \( S(m, b) \), найдем частные производные \( S \) по \( m \) и \( b \), а затем решим это уравнение относительно \( m \) и \( b \):
\[ \begin{aligned}
\frac{\partial S}{\partial m} &= -2 \sum_{i=1}^{n} x_i (y_i – (mx_i + b)) = 0 \\
\frac{\partial S}{\partial b} &= -2 \sum_{i=1}^{n} (y_i – (mx_i + b)) = 0
\end{aligned} \]
После упрощения получаем следующие два нормальных уравнения:
\[ \begin{aligned}
n\bar{y} &= m \sum_{i=1}^{n} x_i + nb \\
\sum_{i=1}^{n}x_i y_i &= m \sum_{i=1}^{n}x_i^2 + b \sum_{i=1}^{n}x_i
\end{aligned} \]
Решив приведенную выше систему уравнений, мы можем найти значения \( m \) и \( b \), которые минимизируют квадратичную ошибку.
Множественная линейная регрессия
В множественной линейной регрессии мы сталкиваемся с ситуацией, когда у нас более одной независимой переменной. Предположим, у нас есть данные в виде кортежа \((x_{i1}, x_{i2}, …, x_{ik}, y_i)\). Используемая нами регрессионная модель выглядит следующим образом:
[ y = b_0 + b_1 x_1 + b_2 x_2 + … + b_k x_k + \epsilon \]
Это уравнение можно записать в матричной форме следующим образом:
\[ \mathbf{y} = \mathbf{X} \mathbf{b} + \mathbf{\epsilon} \]
ди мана:
– \( \mathbf{y} \) — это вектор-столбец наблюдаемых значений y.
– \( \mathbf{X} \) — это матрица наблюдаемых значений x (включая столбец 1 для свободного члена).
– \( \mathbf{b} \) — это вектор-столбец параметров (включая \( b_0 \)).
Целью метода наименьших квадратов является минимизация следующей квадратичной функции ошибок:
\[ S(\mathbf{b}) = (\mathbf{y} – \mathbf{Xb})^T (\mathbf{y} – \mathbf{Xb}) \]
Чтобы минимизировать эту функцию, мы берем частную производную S по \( \mathbf{b} \) и приравниваем ее к нулю. Это дает нормальное уравнение для множественной линейной регрессии:
\[ \mathbf{X}^T \mathbf{Xb} = \mathbf{X}^T \mathbf{y} \]
Решив приведенную выше систему уравнений, мы можем получить оценку параметра \( \mathbf{b} \):
\[ \mathbf{b} = (\mathbf{X}^T \mathbf{X})^{-1} \mathbf{X}^T \mathbf{y} \]
Keuntungan dan Keterbatasan
Метод наименьших квадратов обладает множеством преимуществ. Это очень эффективный и простой в использовании метод. Он предлагает единственное решение, если \( \mathbf{X}^T \mathbf{X} \) обратима, что делает его надежным для многих практических применений.
Однако метод наименьших квадратов также имеет ограничения. Он очень чувствителен к выбросам, поскольку квадрат ошибки сильнее выделяет большие различия, чем малые. Кроме того, для получения хороших результатов необходимо соблюдение классического предположения о том, что ошибки имеют нормальное распределение с нулевым средним и постоянной дисперсией.
Aplikasi Praktis
Метод наименьших квадратов часто используется в анализе тенденций данных, прогнозировании и машинном обучении для построения прогностических моделей. В финансовой сфере метод наименьших квадратов применяется для прогнозирования цен на акции или показателей рынка. В медицине он используется для моделирования зависимости между дозировкой лекарства и реакцией пациента. В социальных науках он помогает понять взаимосвязь между такими переменными, как образование и доход.
заключение
Метод наименьших квадратов — один из фундаментальных методов в статистике и анализе данных. Несмотря на простоту концепции, этот метод обладает значительными возможностями для моделирования и понимания взаимосвязей между переменными. Благодаря широкому спектру применений в самых разных областях, глубокое понимание этого метода бесценно как для профессионалов, так и для исследователей. В будущем, с ростом объёма данных в эпоху больших данных, адаптация и применение классических методов, таких как метод наименьших квадратов, будут становиться всё более актуальными.