Preguntas e debate de exemplos de regresión lineal
A regresión lineal é un método estatístico que se emprega para determinar a relación entre dúas ou máis variables. Este método úsase amplamente en diversos campos, como a economía, os negocios, as ciencias sociais e as ciencias naturais. Neste artigo, falaremos da regresión lineal, de como calculala e proporcionaremos varios problemas de exemplo con explicacións para axudar aos lectores a comprender este concepto en profundidade.
Comprender a regresión lineal
A regresión lineal é un método analítico empregado para modelar a relación entre unha ou máis variables independentes (preditores) e unha variable dependente (resposta). A regresión lineal simple implica unha variable independente e unha variable dependente, mentres que a regresión lineal múltiple implica máis dunha variable independente.
A ecuación dunha recta de regresión lineal simple é:
\[ Y = a + bX \]
Onde:
– \(Y \) é a variable dependente.
– \(X\) é a variable independente.
– \(a \) é a intersección, que é o valor de Y cando X = 0.
– \(b \) é o coeficiente de regresión, é dicir, canto cambia Y se X cambia nunha unidade.
Pasos de regresión lineal
1. Recompilación de datos: primeiro, recompila os datos que se van analizar.
2. Representar os datos: Crea un diagrama de dispersión para ver se existe unha relación lineal entre as variables.
3. Calcula o coeficiente de regresión: usa o método dos mínimos cadrados para determinar a mellor recta.
4. Proba do modelo: Comproba a significancia dos coeficientes de regresión cunha proba t e determina o valor de R cadrado para ver o ben que se axusta o modelo aos datos.
Exemplos de preguntas e debate
Pregunta de exemplo 1: Regresión lineal simple
Pregunta:
Un investigador quere coñecer a relación entre o número de horas de estudo (X) e as puntuacións dos estudantes nos exames (Y). Os datos obtidos son os seguintes:
| Horas de estudo (X) | Puntuación do exame (Y) |
|——————–|———————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
Fai unha ecuación de regresión lineal a partir destes datos!
Debate:
1. Cálculo da media:
\[
X = 2 + 3 + 5 + 7 + 8/5 = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. Cálculo do coeficiente de regresión \(b \):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
suma (Xi – X)(Yi – Y) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
suma (Xi – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \approx 3.08
\]
3. Cálculo da intersección \( a \):
\[
a = Y – b X
\]
\[
a = 80 – 3.08 × 5 = 80 – 15.4 = 64.6
\]
4. Ecuación de regresión:
\[
Y = 64.6 + 3.08X
\]
Entón, a ecuación de regresión lineal para os datos é \(Y = 64.6 + 3.08X \). Isto significa que se espera que cada hora adicional de estudo aumente a puntuación do exame en 3.08 puntos.
Pregunta de exemplo 2: Proba e interpretación do modelo
Pregunta:
Continuando cos mesmos datos, calcula o valor de R cadrado (R²) para medir o axuste do modelo aos datos. Ademais, comproba a significancia do coeficiente de regresión ∫(b).
Debate:
1. Calcula a suma total de cadrados (SST), a suma de cadrados da regresión (SSR) e a suma de cadrados do erro (SSE):
\[
SST = \sum (Yi – \bar{Y})^2
\]
\[
Temperatura da superficie = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \sum (\hat{Y}_i – \bar{Y})^2
\]
Onde \( \hat{Y}_i \) é o valor predicido da ecuación de regresión:
\[
Y_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76; 70.84; 76.0; 82.16; 85.24]
\]
\[
Y = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
2. Cálculo da SSE:
\[
SSE = SST – SSR = 250 – 149.8 = 100.2
\]
3. Cálculo de R ao cadrado:
\[
R^2 = \frac{SSR}{SST} = \frac{149.8}{250} \approx 0.6
\]
Un valor de R cadrado de 0.6 indica que este modelo explica aproximadamente o 60 % da variación nos datos. Isto indica que a recta de regresión axusta bastante ben os datos.
4. Proba t para a significancia do coeficiente \(b \):
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = 33.4 / 26 \sqrt{1.13}
\]
\[
t = \frac{3.08}{1.13} \approx 2.73
\]
Cunha estatística t \approx 2.73, se empregamos un limiar común para a significancia (α = 0.05), comparámolo coa táboa t. Por exemplo, para \(dl = 3), o valor crítico \(t\) é de aproximadamente 2.353. Entón \(t observado > t crítico\), o que indica que o coeficiente é significativo.
Conclusión
Neste artigo, tratamos os conceptos básicos da regresión lineal, como calcular o coeficiente de regresión e a intersección, e como interpretar os resultados mediante problemas de exemplo. A práctica frecuente con varios conxuntos de datos é esencial para adquirir competencia no uso deste método. A regresión lineal é unha ferramenta valiosa na análise de datos e pode proporcionar información detallada sobre as relacións entre variables.