Simpla Lineara Regresa Analizo
Simpla lineara regreso estas statistika tekniko uzata por analizi la rilaton inter du kvantaj variabloj. La variablo, kiun ni provas antaŭdiri, nomiĝas la dependa aŭ responda variablo, dum la variablo uzata por fari la antaŭdiron nomiĝas la sendependa aŭ antaŭdira variablo. En simpla lineara regreso, ni provas trovi la plej bonan rektan linion, kiu priskribas la rilaton inter ĉi tiuj du variabloj.
Bazaj Konceptoj de Simpla Lineara Regreso
Simpla lineara regreso baziĝas sur la supozo, ke ekzistas lineara rilato inter la dependa variablo ∏ kaj la sendependa variablo ∏. La ĝenerala formo de simpla lineara regresmodelo estas:
\[ Y = β₀ + β₁ X + ε]
Kie:
– \(Y \) estas la dependa variablo.
– \(X \) estas la sendependa variablo.
– \( \beta_0 \) estas la intersekco, kiu estas la valoro de \(Y\) kiam \(X = 0\).
– \( \beta_1 \) estas la deklivo aŭ gradiento, kiu estas la averaĝa ŝanĝo en \(Y\) por ĉiu unuoŝanĝo en \(X\).
– ∫(∫epsilon) estas la eraro aŭ resta termo kiu reprezentas la ŝanĝiĝemon en ∫(Y) kiu ne povas esti klarigita per ∫(X).
La celo de simpla lineara regreso estas taksi la parametrojn β0 kaj β1 tiel ke la modelo povas esti uzata por antaŭdiri la valoron de Y asociitan kun la valoro de X.
Metodo de plej malgrandaj kvadratoj
Unu el la plej ofte uzataj metodoj por alĝustigi simplan linearan regresmodelon estas la metodo de plej malgrandaj kvadratoj. Ĉi tiu metodo celas minimumigi la sumon de la kvadratoj de la vertikalaj devioj inter la faktaj observoj kaj la valoroj antaŭdiritaj de la modelo. Supozu, ke ni havas n observojn konsistantajn el paroj \((x_i, y_i)\) por \(i = 1, 2, …, n\). La funkcio minimumigota estas:
S(β0, β1) = sumo i=1 n (yi – (β0 + β1 xi))²
Por trovi ∫(β0) kaj ∫(β1) kiuj minimumigas ĉi tiun funkcion, ni prenas la partajn derivaĵojn de ∫(S(β0, β1)) rilate al ĉiu parametro kaj metas ĉi tiujn derivaĵojn al nulo. La matematika kalkulo povas esti simpligita jene:
\[ β1 = \frac{\sumo_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sumo_{i=1}^{n} (x_i – \bar{x})^2} \]
\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]
Kie:
– \(\bar{x}\) estas la averaĝo de \(X\)
– \(\bar{y}\) estas la averaĝo de \(Y\)
Post akiro de la parametroj \(\beta_0\) kaj \(\beta_1\), simpla lineara regresmodelo povas esti uzata por antaŭdiri la valoron de \(Y\) por ĉiu valoro de \(X\).
Supozoj en Simpla Lineara Regreso
Por validaj kaj fidindaj rezultoj, simpla lineara regreso supozas plurajn aferojn:
1. Lineareco: La rilato inter la dependa variablo kaj la sendependa variablo devas esti lineara.
2. Sendependeco: Observaĵoj devas esti sendependaj unu de la alia.
3. Homoskedasteco: La resta ŝanĝiĝemo devas esti konstanta tra la tuta intervalo de valoroj de la sendependa variablo.
4. Resta Normaleco: Restaĵoj (eraroj) devas sekvi normalan distribuon.
Se ĉi tiuj supozoj ne estas plenumitaj, la rezultoj de simpla lineara regresmodelo estos nefidindaj kaj eble ne povos fari precizajn prognozojn.
Takso de Regresa Modelo
Unu maniero taksi kiom bone simpla lineara regresmodelo antaŭdiris estas uzi la Koeficienton de Determinado (\(R^2\)). La koeficiento de determinado montras la proporcion de ŝanĝiĝemo en la dependa variablo, kiu povas esti klarigita per la ŝanĝiĝemo en la sendependaj variabloj.
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
Kie:
– \(\hat{y}_i\) estas la antaŭdirita valoro de \(Y\).
– \(y_i\) estas la efektiva valoro de \(Y\).
– \(\bar{y}\) estas la averaĝo de la valoroj de \(Y\).
La valoro de \(R^2\) varias de 0 ĝis 1. Valoro de \(R^2\) proksima al 1 indikas, ke la modelo povas klarigi plejparton de la ŝanĝiĝemo en la dependa variablo.
Efektivigo en Programlingvo
Por efektivigi simplan linearan regreson, ni povas uzi diversajn statistikajn programojn aŭ programlingvojn. Jen ekzempla efektivigo en Python uzante la bibliotekon `scikit-learn`:
“`pitono
importi numpy kiel np
importu matplotlib.pyplot kiel plt
el sklearn.linear_model importi Linearan Regreson
el sklearn.metrics importi meznombran_kvadratan_eraron, r2_poentaron
datumoj
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
modelo
modelo = LinearaRegreso()
modelo.taŭga(X, y)
Antaŭdiro
y_pred = modelo.antaŭdiri(X)
Koeficiento
beta_0 = modelo.interkapto_
beta_1 = modelo.koef_[0]
presi(f'Interkapto: {beta_0}')
presi(f'Deklivo: {beta_1}')
presi(f'Meza kvadrata eraro: {meza_kvadrata_eraro(y, y_pred)}')
presi(f'Determinokoeficiento (R^2): {r2_poentaro(y, y_antaŭ)}')
Daten-intrigo kaj regreslinio
plt.scatter(X, y, koloro='blua')
plt.plot(X, y_pred, koloro='ruĝa')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
“
En la supra ekzemplo, ni unue importas la necesajn bibliotekojn, difinas la datumojn \(X\) kaj \(Y\), kaj poste uzas la objekton `LinearRegression` el `scikit-learn` por alĝustigi modelon al la datumoj. Post kiam la modelo estas alĝustigita, ni faras prognozojn kaj kalkulas la koeficientojn, same kiel la mezan kvadratan eraron kaj la koeficienton de determinado. Fine, ni desegnas la datumojn kaj la regreslinion.
Konkludo
Simpla lineara regreso estas potenca statistika analizilo uzata por klarigi la rilaton inter du kvantaj variabloj. Kun kelkaj bazaj supozoj pri lineareco, sendependeco, homoskedasteco kaj normaleco, ni povas antaŭdiri la valoron de la dependa variablo surbaze de la valoroj de la sendependaj variabloj. La metodo de plej malgrandaj kvadratoj provizas efikan manieron por alĝustigi regreslinion kaj determini optimumajn parametrojn. Modeltaksado per la koeficiento de determinado (R2) donas komprenon pri kiom bone nia modelo funkcias.
Kvankam simpla lineara regreso havas limigojn, kiel ekzemple la kapablo pritrakti nur du variablojn kaj la supozojn, kiujn oni devas plenumi, ĉi tiu tekniko restas grava fundamento en statistiko kaj datuma analizo, kaj ofte estas uzata kiel unua paŝo en komprenado de la rilato inter variabloj antaŭ ol transiri al pli kompleksaj metodoj.