Kleinste kwadrate metode

Kleinste Kwadrate Metode: 'n Wiskundige Benadering tot Skatting

Inleiding

Die metode van kleinste kwadrate is 'n statistiese tegniek wat gebruik word om parameters in 'n regressiemodel te skat deur die som van die kwadraatfoute tussen die werklike waardes en die waardes wat deur die model voorspel word, te minimaliseer. Hierdie metode is baie gewild en word gereeld in verskeie velde soos ekonomie, ingenieurswese, biologie en die sosiale wetenskappe gebruik. Die konsep van kleinste kwadrate is die eerste keer deur Adrien-Marie Legendre in die vroeë 19de eeu voorgestel en is later verder ontwikkel deur Carl Friedrich Gauss.

Basiese Begrip

Oor die algemeen poog die kleinste kwadrate-metode om die beste-passing regressielyn vir 'n datastel te vind deur die som van kwadrate van die residue, of voorspellingsfoute, te minimaliseer. Die residu is die verskil tussen die waargenome waarde en die voorspelde waarde.

As ons 'n datastel het wat bestaan ​​uit pare waarnemings (x_1, y_1), (x_2, y_2), …, (x_n, y_n)), dan is ons doel om die lyn y = mx + b te vind wat die som van die kwadraatfoute sum (i=1, n (y_i – (mx_i + b))^2) minimaliseer.

Hierdie metode kan toegepas word op beide eenvoudige lineêre regressie en meervoudige lineêre regressie. In eenvoudige lineêre regressie het ons slegs een onafhanklike veranderlike (x), terwyl meervoudige lineêre regressie meer as een onafhanklike veranderlike behels.

Eenvoudige Lineêre Regressie

Kom ons begin met eenvoudige lineêre regressie. Veronderstel ons het 'n datastel \((x_1, y_1), (x_2, y_2), …, (x_n, y_n)). Die eenvoudige lineêre regressiemodel wat ons wil pas, is:

[y = mx + b + epsilon]

waar \(m \) die helling is, \(b \) die afsnit is, en \(epsilon \) die ewekansige fout is.

Deur die kleinste kwadrate-metode te gebruik, kan ons ramings van die parameters \(m \) en \(b \) vind deur die kwadraatfoutfunksie te minimaliseer:

LEES  Hoe om kwartiele, desiele en persentiele in statistiese data te bereken

[ S(m, b) = \sum_{i=1}^{n} (y_i – (mx_i + b))^2 \]

Om S(m, b) te minimaliseer, vind ons die parsiële afgeleides van S met betrekking tot m en b, en los dan hierdie vergelyking vir m en b op:

\[ \begin{aligned}
\frac{\partial S}{\partial m} &= -2 \sum_{i=1}^{n} x_i (y_i – (mx_i + b)) = 0 \\
\frac{\partial S}{\partial b} &= -2 \sum_{i=1}^{n} (y_i – (mx_i + b)) = 0
\end{aligned} \]

Na vereenvoudiging kry ons die volgende twee normale vergelykings:

\[ \begin{aligned}
n\bar{y} & = m \sum_{i=1}^{n} x_i + nb \\
\sum_{i=1}^{n}x_i y_i & = m \sum_{i=1}^{n}x_i^2 + b \sum_{i=1}^{n}x_i
\end{aligned} \]

Deur die bogenoemde stelsel vergelykings op te los, kan ons die waardes van \(m \) en \(b \) vind wat die kwadraatfout minimaliseer.

Meervoudige lineêre regressie

In meervoudige lineêre regressie staan ​​ons voor 'n situasie waar ons meer as een onafhanklike veranderlike het. Veronderstel ons het data in die vorm van 'n tupel \((x_{i1}, x_{i2}, …, x_{ik}, y_i)\). Die regressiemodel wat ons gebruik is:

\[ y = b_0 + b_1 x_1 + b_2 x_2 + … + b_k x_k + \epsilon \]

Hierdie vergelyking kan in matriksvorm geskryf word as:

\[ \mathbf{y} = \mathbf{X} \mathbf{b} + \mathbf{\epsilon} \]

Waar:
– \( \mathbf{y} \) is 'n kolomvektor van waargenome y-waardes.
– \( \mathbf{X} \) is 'n matriks van waargenome x-waardes (insluitend kolom 1 vir die afsnit).
– \( \mathbf{b} \) is 'n kolomvektor van die parameters (insluitend \(b_0 \)).

Die doel van die kleinste kwadrate-metode is om die volgende kwadratiese foutfunksie te minimaliseer:

\[ S(\mathbf{b}) = (\mathbf{y} – \mathbf{Xb})^T (\mathbf{y} – \mathbf{Xb}) \]

Om hierdie funksie te minimaliseer, neem ons die parsiële afgeleide van S met betrekking tot \( \mathbf{b} \) en stel dit op nul. Dit lewer die normale vergelyking vir meervoudige lineêre regressie:

LEES  Hoe om standaardafwyking te bereken

[\mathbf{X}^T \mathbf{X} = \mathbf{X}^T \mathbf{y} \]

Deur die bogenoemde stelsel vergelykings op te los, kan ons 'n skatting van die parameter \( \mathbf{b} \) verkry:

[ b = ( X^T X)^{-1} X^T y ]

Voordele en Beperkings

Die kleinste kwadrate-metode het baie voordele. Dit is 'n baie doeltreffende en eenvoudige metode om te gebruik. Dit bied 'n unieke oplossing as \( \mathbf{X}^T \mathbf{X} \) inverteerbaar is, wat dit betroubaar maak vir baie praktiese toepassings.

Die kleinste kwadrate-metode het egter ook beperkings. Dit is baie sensitief vir uitskieters omdat die kwadraatfout groot verskille meer beklemtoon as klein verskille. Verder moet die klassieke aanname dat die foute 'n normale verspreiding met nul gemiddelde en konstante variansie het, nagekom word vir goeie resultate.

Praktiese Toepassings

Die kleinste kwadrate-metode word gereeld gebruik in data-tendensanalise, voorspelling en masjienleer om voorspellende modelle te bou. In die finansiële bedryf word die kleinste kwadrate-metode gebruik om aandeelpryse of markprestasie te voorspel. In medisyne word dit gebruik om die verband tussen geneesmiddeldosis en pasiëntrespons te modelleer. In die sosiale wetenskappe help dit om die verband tussen veranderlikes soos opvoeding en inkomste te verstaan.

Afsluiting

Die kleinste kwadrate-metode is een van die fundamentele tegnieke in statistiek en data-analise. Alhoewel dit eenvoudig in konsep is, bied hierdie metode beduidende krag in die modellering en begrip van verwantskappe tussen veranderlikes. Met wydverspreide toepassings oor 'n wye reeks velde, is 'n deeglike begrip van hierdie metode van onskatbare waarde vir professionele persone en navorsers. In die toekoms, met die toenemende volume data wat in die grootdata-era teëgekom word, sal die aanpassing en toepassing van klassieke metodes soos kleinste kwadrate net toenemend relevant word.

Lewer kommentaar