Analisi di Regressione Lineare Semplice
A regressione lineare simplice hè una tecnica statistica aduprata per analizà a relazione trà duie variabili quantitative. A variabile chì pruvemu à prevede hè chjamata variabile dipendente o di risposta, mentre chì a variabile aduprata per fà a previsione hè chjamata variabile indipendente o predittiva. In a regressione lineare simplice, pruvemu à truvà a megliu linea retta chì descrive a relazione trà queste duie variabili.
Cuncetti basi di regressione lineare simplice
A regressione lineare simplice hè basata annantu à l'ipotesi chì ci sia una relazione lineare trà a variabile dipendente \(Y\) è a variabile indipendente \(X\). A forma generale di un mudellu di regressione lineare simplice hè:
Y = β0 + β1 X + ε
Induve:
– \(Y \) hè a variabile dipendente.
– \(X \) hè a variabile indipendente.
– \( \beta_0 \) hè l'intercetta, chì hè u valore di \(Y \) quandu \(X = 0 \).
– \( \beta_1 \) hè a pendenza o u gradiente, chì hè u cambiamentu mediu in \(Y\) per ogni cambiamentu unitariu in \(X\).
– \(\epsilon\) hè l'errore o u termine residuale chì rapprisenta a variabilità in \(Y\) chì ùn pò esse spiegata da \(X\).
L'obiettivu di a regressione lineare simplice hè di stimà i parametri \(\beta_0\) è \(\beta_1\) in modu chì u mudellu possi esse adupratu per prevede u valore di \(Y\) assuciatu à u valore di \(X\).
Metudu di i Minimi Quadrati
Unu di i metudi i più cumunimenti usati per adattà un mudellu di regressione lineare simplice hè u metudu di i minimi quadrati. Stu metudu hà per scopu di minimizà a somma di i quadrati di e deviazioni verticali trà l'osservazioni attuali è i valori previsti da u mudellu. Supponemu chì avemu n osservazioni custituite da coppie \((x_i, y_i)\) per \(i = 1, 2, …, n\). A funzione da minimizà hè:
S(β0, β1) = \sum_{i=1}^{n} (y_i – (β0 + β1 x_i))^2
Per truvà \(\beta_0\) è \(\beta_1\) chì minimizanu sta funzione, pigliemu e derivate parziali di \(S(\beta_0, \beta_1)\) in rispettu à ogni parametru è mettimu ste derivate à zeru. U calculu matematicu pò esse simplificatu cusì:
\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]
\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]
Induve:
– \(\bar{x}\) hè a media di \(X\)
– \(\bar{y}\) hè a media di \(Y\)
Dopu avè ottenutu i parametri \(\beta_0\) è \(\beta_1\), un mudellu di regressione lineare simplice pò esse adupratu per predì u valore di \(Y\) per ogni valore di \(X\).
Ipotesi in Regressione Lineare Semplice
Per risultati validi è affidabili, a regressione lineare simplice assume parechje cose:
1. Linearità: A relazione trà a variabile dipendente è a variabile indipendente deve esse lineare.
2. Indipendenza: L'osservazioni devenu esse indipendenti l'una da l'altra.
3. Omoschedasticità: A variabilità residuale deve esse costante in tuttu u range di valori di a variabile indipendente.
4. Nurmalità Residuale: I residui (errori) devenu seguità una distribuzione nurmale.
Sè queste ipotesi ùn sò micca rispettate, i risultati di un mudellu di regressione lineare simplice ùn saranu micca affidabili è ùn saranu micca capaci di fà previsioni precise.
Valutazione di u mudellu di regressione
Un modu per valutà quantu bè un mudellu di regressione lineare simplice hà previstu hè di utilizà u Coefficiente di Determinazione (\(R^2\)). U coefficiente di determinazione mostra a proporzione di variabilità in a variabile dipendente chì pò esse spiegata da a variabilità in e variabili indipendenti.
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
Induve:
– \(\hat{y}_i\) hè u valore previstu di \(Y\).
– \(y_i\) hè u valore attuale di \(Y\).
– \(\bar{y}\) hè a media di i valori di \(Y\).
U valore \(R^2\) varieghja da 0 à 1. Un valore \(R^2\) vicinu à 1 indica chì u mudellu pò spiegà a maiò parte di a variabilità in a variabile dipendente.
Implementazione in linguaghju di prugrammazione
Per implementà una regressione lineare simplice, pudemu aduprà diversi software statistici o linguaggi di prugrammazione. Quì sottu hè un esempiu d'implementazione in Python cù a biblioteca `scikit-learn`:
"` pitone
import numpy cum'è np
impurtà matplotlib.pyplot cum'è plt
da sklearn.linear_model import LinearRegression
da sklearn.metrics import mean_squared_error, r2_score
Dati
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
mudeddu
mudellu = LinearRegression ()
model.fit (X, y)
Previsione
y_pred = model.predict (X)
Coefficiente
beta_0 = mudellu.intercetta_
beta_1 = mudellu.coef_[0]
stampa (f'Intercetta: {beta_0}')
stampa (f'Pendenza: {beta_1}')
print(f'Errore quadraticu mediu: {errore_quadratu_mediu(y, y_pred)}')
print(f'Coefficiente di determinazione (R^2): {r2_score(y, y_pred)}')
Graficu di dati è linea di regressione
plt.scatter(X, y, culore = 'blu')
plt.plot(X, y_pred, culore='rossu')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
""
In l'esempiu sopra, prima impurtemu e biblioteche necessarie, definimu i dati \(X\) è \(Y\), è dopu usemu l'ughjettu `LinearRegression` da `scikit-learn` per adattà un mudellu à i dati. Una volta chì u mudellu hè adattatu, facemu previsioni è calculemu i coefficienti, è ancu l'errore quadraticu mediu è u coefficientu di determinazione. Infine, tracciamu i dati è a linea di regressione.
Cunclusioni
A regressione lineare simplice hè un putente strumentu d'analisi statistica utilizatu per spiegà a relazione trà duie variabili quantitative. Cù alcune ipotesi basiche nantu à a linearità, l'indipendenza, l'omoschedasticità è a nurmalità, pudemu prevede u valore di a variabile dipendente basatu annantu à i valori di e variabili indipendenti. U metudu di i minimi quadrati furnisce un modu efficace per adattà una linea di regressione è determinà i parametri ottimali. A valutazione di u mudellu per mezu di u cuefficiente di determinazione (R2) furnisce una visione di e prestazioni di u nostru mudellu.
Ancu s'è a regressione lineare simplice hà limitazioni, cum'è esse capace di trattà solu duie variabili è l'ipotesi chì devenu esse rispettate, sta tecnica ferma una basa impurtante in statistiche è analisi di dati, è hè spessu aduprata cum'è un primu passu per capisce a relazione trà e variabili prima di passà à metudi più cumplessi.