Halimbawa ng tanong sa talakayan tungkol sa koepisyent ng determinasyon
Ang koepisyent ng determinasyon (R²) ay isang mahalagang parameter sa pagsusuri ng regresyon, na nagpapahiwatig kung gaano kahusay na ipinapaliwanag ng isang modelo ng regresyon ang aktwal na pagkakaiba-iba ng datos. Sa artikulong ito, ipapaliwanag namin ang konsepto ng koepisyent ng determinasyon sa pamamagitan ng isang detalyadong halimbawa at talakayan.
Pangunahing Konsepto ng Koepisyent ng Determinasyon
Ang koepisyent ng determinasyon o \( R^2 \) ay sinusukat sa isang iskala na 0 hanggang 1, kung saan:
– Ipinapahiwatig ng \( R^2 = 0 \) na hindi kayang ipaliwanag ng modelo ng regresyon ang baryabolidad ng datos.
– Ipinapakita ng \( R^2 = 1 \) na kayang ipaliwanag nang perpekto ng modelo ng regresyon ang lahat ng baryabolidad ng datos.
Ang pangunahing pormula para sa pagkalkula ng koepisyent ng pagpapasiya ay:
\[ R^2 = 1 – \frac{SSR}{SST} \]
Saan:
– Ang SSR (Sum of Squared Residuals) ay ang kabuuan ng mga parisukat ng mga pagkakaiba sa pagitan ng mga halagang hinulaang ng modelo at ng mga aktwal na halaga.
– Ang SST (Kabuuang Kabuuan ng mga Parisukat) ay ang kabuuan ng kabuuan ng mga parisukat ng mga pagkakaiba sa pagitan ng aktwal na halaga at ng average ng mga aktwal na halaga.
Halimbawa ng mga problema
Talakayin natin ang isang halimbawang problema upang mas maunawaan ang pagkalkula ng koepisyent ng determinasyon.
Halimbawa ng mga problema:
Ipagpalagay na mayroon tayong datos sa bilang ng mga oras ng pag-aaral (X) at mga marka sa pagsusulit (Y) ng 10 estudyante:
| Mga Mag-aaral | Mga Oras ng Pag-aaral (X) | Iskor sa Pagsusulit (Y) |
|——-|———————–|———————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |
Gagawa tayo ng isang simpleng linear regression model kung saan ang mga marka sa pagsusulit (Y) ay hinuhulaan batay sa mga oras ng pag-aaral (X).
Pagtalakay
1. Pagbuo ng Isang Simpleng Linear Regression Model
Ang isang simpleng linear regression model ay may anyong:
\[ Y = a + bX \]
Saan:
– Ang \( Y \) ay ang hinulaang marka sa pagsusulit.
– Ang \( X \) ay ang bilang ng mga oras ng pag-aaral.
– Ang \( a \) ay ang intercept (ang punto ng intersection sa Y axis kapag ang X = 0).
– Ang \( b \) ay ang slope (pagkahilig ng linya ng regresyon).
Para kalkulahin ang mga parametro \( a \) at \( b \), ginagamit namin ang sumusunod na pormula:
\[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
\[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]
Kung saan ang \(n \) ay ang bilang ng datos (sa kasong ito n = 10).
Mula sa talahanayan, maaari nating kalkulahin:
– \(\kabuuan{X} = 36\)
– \(\kabuuan{Y} = 704\)
– \(\kabuuan{X^2} = 140\)
– \(\kabuuan{Y^2} = 50428\)
– \(\kabuuan{XY} = 2576\)
Kalkulahin muna natin ang b:
b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2}
\[ b = \frac{25760 – 25344}{1400 – 1296} \]
\[ b = \frac{416}{104} \]
\[ b = 4 \]
Pagkatapos, kinakalkula namin ang isang:
\[ a = \frac{704 – 4(36)}{10} \]
\[ a = \frac{704 – 144}{10} \]
\[ a = \frac{560}{10} \]
\[ a = 56 \]
Kaya, ang linear regression model na makukuha natin ay:
\[ Y = 56 + 4X \]
2. Kalkulahin ang Hinulaang Halaga (Y')
Susunod, kakalkulahin natin ang hinulaang halaga \( Y' \) para sa bawat \( X \):
| Mga Mag-aaral | Mga Oras ng Pag-aaral (X) | Iskor sa Pagsusulit (Y) | Hinulaang Iskor (Y') |
|——-|———————–|———————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |
3. Pagkalkula ng SSR at SST
Susunod, kakalkulahin natin ang SSR at SST para makuha ang \( R^2 \).
SSR:
\[ SSR = \sum{(Y – Y')^2} \]
SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2
\[ SSR = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
\[ SSR = 454 \]
SST:
\[ SST = \sum{(Y – \bar{Y})^2} \]
Saan:
\[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]
\[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
\[ SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
\[ SST = 1107.44 \]
4. Pagkalkula ng Koepisyent ng Determinasyon \( R^2 \):
\[ R^2 = 1 – \frac{SSR}{SST} \]
\[ R^2 = 1 – \frac{454}{1107.44} \]
\[ R^2 = 1 – 0.41 \]
\[ R^2 = 0.59 \]
Konklusyon
Mula sa kalkulasyon sa itaas, nakakuha kami ng coefficient of determination (R2 = 0.59). Ipinapahiwatig nito na ang linear regression model na aming nilikha ay kayang ipaliwanag ang humigit-kumulang 59% ng variability sa mga marka ng pagsusulit batay sa mga oras ng pag-aaral. Ang natitirang 41% ng variability ay maaaring dahil sa iba pang mga salik na hindi kasama sa modelo.
Sa pamamagitan ng pag-unawa sa mga hakbang at kalkulasyon sa itaas, makikita natin ang kahalagahan ng coefficient of determination sa pagtatasa kung gaano kahusay na naipapaliwanag ng modelo ng regresyon na ating binubuo ang aktwal na baryabolidad ng datos. Ito ay isang lubhang kapaki-pakinabang na kagamitan sa pagsusuring istatistikal at pagmomodelo ng datos.