ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਉਦਾਹਰਨ ਸਵਾਲ ਅਤੇ ਚਰਚਾ
ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਇੱਕ ਅੰਕੜਾਤਮਕ ਵਿਧੀ ਹੈ ਜੋ ਦੋ ਜਾਂ ਦੋ ਤੋਂ ਵੱਧ ਵੇਰੀਏਬਲਾਂ ਵਿਚਕਾਰ ਸਬੰਧ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਵਰਤੀ ਜਾਂਦੀ ਹੈ। ਇਹ ਵਿਧੀ ਅਰਥ ਸ਼ਾਸਤਰ, ਵਪਾਰ, ਸਮਾਜਿਕ ਵਿਗਿਆਨ ਅਤੇ ਕੁਦਰਤੀ ਵਿਗਿਆਨ ਸਮੇਤ ਵੱਖ-ਵੱਖ ਖੇਤਰਾਂ ਵਿੱਚ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਵਰਤੀ ਜਾਂਦੀ ਹੈ। ਇਸ ਲੇਖ ਵਿੱਚ, ਅਸੀਂ ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ, ਇਸਦੀ ਗਣਨਾ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਅਤੇ ਪਾਠਕਾਂ ਨੂੰ ਇਸ ਸੰਕਲਪ ਨੂੰ ਡੂੰਘਾਈ ਨਾਲ ਸਮਝਣ ਵਿੱਚ ਮਦਦ ਕਰਨ ਲਈ ਵਿਆਖਿਆਵਾਂ ਦੇ ਨਾਲ ਕਈ ਉਦਾਹਰਣ ਸਮੱਸਿਆਵਾਂ ਪ੍ਰਦਾਨ ਕਰਾਂਗੇ।
ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਨੂੰ ਸਮਝਣਾ
ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਇੱਕ ਵਿਸ਼ਲੇਸ਼ਣਾਤਮਕ ਵਿਧੀ ਹੈ ਜੋ ਇੱਕ ਜਾਂ ਇੱਕ ਤੋਂ ਵੱਧ ਸੁਤੰਤਰ ਵੇਰੀਏਬਲ (ਭਵਿੱਖਬਾਣੀ) ਅਤੇ ਇੱਕ ਨਿਰਭਰ ਵੇਰੀਏਬਲ (ਪ੍ਰਤੀਕਿਰਿਆ) ਵਿਚਕਾਰ ਸਬੰਧਾਂ ਨੂੰ ਮਾਡਲ ਕਰਨ ਲਈ ਵਰਤੀ ਜਾਂਦੀ ਹੈ। ਸਧਾਰਨ ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਵਿੱਚ ਇੱਕ ਸੁਤੰਤਰ ਵੇਰੀਏਬਲ ਅਤੇ ਇੱਕ ਨਿਰਭਰ ਵੇਰੀਏਬਲ ਸ਼ਾਮਲ ਹੁੰਦਾ ਹੈ, ਜਦੋਂ ਕਿ ਮਲਟੀਪਲ ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਵਿੱਚ ਇੱਕ ਤੋਂ ਵੱਧ ਸੁਤੰਤਰ ਵੇਰੀਏਬਲ ਸ਼ਾਮਲ ਹੁੰਦੇ ਹਨ।
ਇੱਕ ਸਧਾਰਨ ਰੇਖਿਕ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਦਾ ਸਮੀਕਰਨ ਇਹ ਹੈ:
\[ ਵਾਈ = ਏ + ਬੀਐਕਸ \]
ਮਨ:
– \( Y \) ਨਿਰਭਰ ਵੇਰੀਏਬਲ ਹੈ।
– \( X \) ਇੱਕ ਸੁਤੰਤਰ ਵੇਰੀਏਬਲ ਹੈ।
– \( a \) ਇੰਟਰਸੈਪਟ ਹੈ, ਜੋ ਕਿ Y ਦਾ ਮੁੱਲ ਹੈ ਜਦੋਂ X = 0 ਹੁੰਦਾ ਹੈ।
– \( b \) ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ ਹੈ, ਯਾਨੀ ਕਿ ਜੇਕਰ X ਇੱਕ ਯੂਨਿਟ ਨਾਲ ਬਦਲਦਾ ਹੈ ਤਾਂ Y ਕਿੰਨਾ ਬਦਲਦਾ ਹੈ।
ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਸਟੈਪਸ
1. ਡੇਟਾ ਇਕੱਠਾ ਕਰੋ: ਪਹਿਲਾਂ, ਵਿਸ਼ਲੇਸ਼ਣ ਕੀਤੇ ਜਾਣ ਵਾਲੇ ਡੇਟਾ ਨੂੰ ਇਕੱਠਾ ਕਰੋ।
2. ਪਲਾਟ ਡੇਟਾ: ਇਹ ਦੇਖਣ ਲਈ ਕਿ ਕੀ ਵੇਰੀਏਬਲਾਂ ਵਿਚਕਾਰ ਕੋਈ ਰੇਖਿਕ ਸਬੰਧ ਹੈ, ਇੱਕ ਸਕੈਟਰ ਪਲਾਟ ਬਣਾਓ।
3. ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ ਦੀ ਗਣਨਾ ਕਰੋ: ਸਭ ਤੋਂ ਵਧੀਆ ਰੇਖਾ ਨਿਰਧਾਰਤ ਕਰਨ ਲਈ ਘੱਟੋ ਘੱਟ ਵਰਗ ਵਿਧੀ ਦੀ ਵਰਤੋਂ ਕਰੋ।
4. ਮਾਡਲ ਦੀ ਜਾਂਚ: ਇੱਕ t-ਟੈਸਟ ਨਾਲ ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ ਦੀ ਮਹੱਤਤਾ ਦੀ ਜਾਂਚ ਕਰੋ ਅਤੇ R-ਵਰਗ ਮੁੱਲ ਨਿਰਧਾਰਤ ਕਰੋ ਕਿ ਮਾਡਲ ਡੇਟਾ ਵਿੱਚ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫਿੱਟ ਬੈਠਦਾ ਹੈ।
ਨਮੂਨਾ ਸਵਾਲ ਅਤੇ ਚਰਚਾ
ਉਦਾਹਰਨ ਸਵਾਲ 1: ਸਧਾਰਨ ਰੇਖਿਕ ਰਿਗਰੈਸ਼ਨ
ਸਵਾਲ:
ਇੱਕ ਖੋਜਕਰਤਾ ਪੜ੍ਹਾਈ ਦੇ ਘੰਟਿਆਂ (X) ਅਤੇ ਵਿਦਿਆਰਥੀਆਂ ਦੇ ਪ੍ਰੀਖਿਆ ਸਕੋਰ (Y) ਵਿਚਕਾਰ ਸਬੰਧ ਜਾਣਨਾ ਚਾਹੁੰਦਾ ਹੈ। ਪ੍ਰਾਪਤ ਡੇਟਾ ਇਸ ਪ੍ਰਕਾਰ ਹੈ:
| ਪੜ੍ਹਾਈ ਦੇ ਘੰਟੇ (X) | ਪ੍ਰੀਖਿਆ ਸਕੋਰ (Y) |
|——————–|——————–|
| 2 | 70 |
| 3 | 75 |
| 5 | 80 |
| 7 | 85 |
| 8 | 90 |
ਇਸ ਡੇਟਾ ਤੋਂ ਇੱਕ ਰੇਖਿਕ ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ ਬਣਾਓ!
ਚਰਚਾ:
1. ਔਸਤ ਦੀ ਗਣਨਾ ਕਰਨਾ:
\[
\bar{X} = \frac{2 + 3 + 5 + 7 + 8}{5} = 5
\]
\[
\bar{Y} = \frac{70 + 75 + 80 + 85 + 90}{5} = 80
\]
2. ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ ਦੀ ਗਣਨਾ ਕਰਨਾ \( b \):
\[
b = \frac{\sum (X_i – \bar{X})(Y_i – \bar{Y})}{\sum (X_i – \bar{X})^2}
\]
\[
\sum (X_i – \bar{X})(Y_i – \bar{Y}) = (2 – 5)(70 – 80) + (3 – 5)(75 – 80) + (5 – 5)(80 – 80) + (7 – 5)(85 – 80) + (8 – 5)(90 – 80)
\]
\[
= (-3)(-10) + (-2)(-5) + (0)(0) + (2)(5) + (3)(10) = 30 + 10 + 0 + 10 + 30 = 80
\]
\[
\sum (X_i – \bar{X})^2 = (2 – 5)^2 + (3 – 5)^2 + (5 – 5)^2 + (7 – 5)^2 + (8 – 5)^2
\]
\[
= 9 + 4 + 0 + 4 + 9 = 26
\]
\[
b = \frac{80}{26} \ਲਗਭਗ 3.08
\]
3. ਇੰਟਰਸੈਪਟ \( a \) ਦੀ ਗਣਨਾ ਕਰਨਾ:
\[
a = \bar{Y} – b\bar{X}
\]
\[
a = 80 – 3.08 \ ਗੁਣਾ 5 = 80 – 15.4 = 64.6
\]
4. ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ:
\[
ਵਾਈ = 64.6 + 3.08X
\]
ਇਸ ਲਈ, ਡੇਟਾ ਲਈ ਰੇਖਿਕ ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ \( Y = 64.6 + 3.08X \) ਹੈ। ਇਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਅਧਿਐਨ ਦੇ ਹਰੇਕ ਵਾਧੂ ਘੰਟੇ ਨਾਲ ਟੈਸਟ ਸਕੋਰ ਵਿੱਚ 3.08 ਅੰਕਾਂ ਦਾ ਵਾਧਾ ਹੋਣ ਦੀ ਉਮੀਦ ਹੈ।
ਉਦਾਹਰਨ ਪ੍ਰਸ਼ਨ 2: ਮਾਡਲ ਟੈਸਟ ਅਤੇ ਵਿਆਖਿਆ
ਸਵਾਲ:
ਉਸੇ ਡੇਟਾ ਦੇ ਨਾਲ ਜਾਰੀ ਰੱਖਦੇ ਹੋਏ, R-ਵਰਗ (R²) ਮੁੱਲ ਦੀ ਗਣਨਾ ਕਰੋ ਤਾਂ ਜੋ ਇਹ ਮਾਪਿਆ ਜਾ ਸਕੇ ਕਿ ਮਾਡਲ ਡੇਟਾ ਵਿੱਚ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫਿੱਟ ਬੈਠਦਾ ਹੈ। ਨਾਲ ਹੀ, ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ \( b \) ਦੀ ਮਹੱਤਤਾ ਦੀ ਜਾਂਚ ਕਰੋ।
ਚਰਚਾ:
1. ਵਰਗਾਂ ਦੇ ਕੁੱਲ ਜੋੜ (SST), ਵਰਗਾਂ ਦੇ ਰਿਗਰੈਸ਼ਨ ਜੋੜ (SSR), ਅਤੇ ਵਰਗਾਂ ਦੇ ਗਲਤੀ ਜੋੜ (SSE) ਦੀ ਗਣਨਾ ਕਰੋ:
\[
SST = \sum (Y_i – \bar{Y})^2
\]
\[
ਐਸਐਸਟੀ = (70 – 80)^2 + (75 – 80)^2 + (80 – 80)^2 + (85 – 80)^2 + (90 – 80)^2 = 100 + 25 + 0 + 25 + 100 = 250
\]
\[
SSR = \ਜੋੜ (\ਟੋਪੀ{Y}_i – \ਬਾਰ{Y})^2
\]
ਜਿੱਥੇ \( \hat{Y}_i \) ਰਿਗਰੈਸ਼ਨ ਸਮੀਕਰਨ ਦਾ ਅਨੁਮਾਨਿਤ ਮੁੱਲ ਹੈ:
\[
\hat{Y}_i = 64.6 + 3.08X_i
\]
\[
\hat{Y} = [67.76, 70.84, 76.0, 82.16, 85.24]
\]
\[
\bar{Y} = 80
\]
\[
SSR = (67.76 – 80)^2 + (70.84 – 80)^2 + (76.0 – 80)^2 + (82.16 – 80)^2 + (85.24 – 80)^2
\]
\[
SSR = (-12.24)^2 + (-9.16)^2 + (-4.0)^2 + 2.16^2 + 5.24^2 = 149.8
\]
2. SSE ਦੀ ਗਣਨਾ ਕਰਨਾ:
\[
ਐਸਐਸਈ = ਐਸਐਸਟੀ – ਐਸਐਸਆਰ = 250 – 149.8 = 100.2
\]
3. R-ਵਰਗ ਦੀ ਗਣਨਾ ਕਰਨਾ:
\[
R^2 = \frac{SSR}{SST} = \frac{149.8}{250} \ਲਗਭਗ 0.6
\]
0.6 ਦਾ R-ਵਰਗ ਮੁੱਲ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਇਹ ਮਾਡਲ ਡੇਟਾ ਵਿੱਚ ਲਗਭਗ 60% ਭਿੰਨਤਾ ਦੀ ਵਿਆਖਿਆ ਕਰਦਾ ਹੈ। ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਰਿਗਰੈਸ਼ਨ ਲਾਈਨ ਡੇਟਾ ਨੂੰ ਕਾਫ਼ੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫਿੱਟ ਕਰਦੀ ਹੈ।
4. ਗੁਣਾਂਕ ਦੀ ਮਹੱਤਤਾ ਲਈ t-ਟੈਸਟ \( b \):
\[
t = \frac{b}{SE(b)}
\]
\[
SE(b) = \sqrt{\frac{SSE}{n-2}} / \sqrt{\sum (X_i – \bar{X})^2}
\]
\[
SE(b) = \sqrt{\frac{100.2}{5-2}} / \sqrt{26}
\]
\[
SE(b) = \sqrt{33.4} / \sqrt{26} \ਲਗਭਗ 1.13
\]
\[
t = \frac{3.08}{1.13} \ਲਗਭਗ 2.73
\]
ਇੱਕ \( t-statistic \approx 2.73 \) ਦੇ ਨਾਲ, ਜੇਕਰ ਅਸੀਂ ਮਹੱਤਤਾ ਲਈ ਇੱਕ ਆਮ ਥ੍ਰੈਸ਼ਹੋਲਡ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਾਂ (α = 0.05), ਤਾਂ ਅਸੀਂ ਇਸਦੀ ਤੁਲਨਾ t-ਸਾਰਣੀ ਨਾਲ ਕਰਦੇ ਹਾਂ। ਉਦਾਹਰਨ ਲਈ, \( df = 3 \) ਲਈ, ਨਾਜ਼ੁਕ \( t \) ਲਗਭਗ 2.353 ਹੈ। ਫਿਰ \( t-observed > t-critical \), ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਗੁਣਾਂਕ ਮਹੱਤਵਪੂਰਨ ਹੈ।
ਸਿੱਟਾ
ਇਸ ਲੇਖ ਵਿੱਚ, ਅਸੀਂ ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਦੀਆਂ ਮੂਲ ਗੱਲਾਂ, ਰਿਗਰੈਸ਼ਨ ਗੁਣਾਂਕ ਅਤੇ ਇੰਟਰਸੈਪਟ ਦੀ ਗਣਨਾ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਅਤੇ ਉਦਾਹਰਣ ਸਮੱਸਿਆਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਨਤੀਜਿਆਂ ਦੀ ਵਿਆਖਿਆ ਕਿਵੇਂ ਕਰਨੀ ਹੈ, ਨੂੰ ਕਵਰ ਕੀਤਾ ਹੈ। ਇਸ ਵਿਧੀ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਨਿਪੁੰਨ ਬਣਨ ਲਈ ਵੱਖ-ਵੱਖ ਡੇਟਾ ਸੈੱਟਾਂ ਨਾਲ ਵਾਰ-ਵਾਰ ਅਭਿਆਸ ਕਰਨਾ ਜ਼ਰੂਰੀ ਹੈ। ਲੀਨੀਅਰ ਰਿਗਰੈਸ਼ਨ ਡੇਟਾ ਵਿਸ਼ਲੇਸ਼ਣ ਵਿੱਚ ਇੱਕ ਕੀਮਤੀ ਸਾਧਨ ਹੈ ਅਤੇ ਵੇਰੀਏਬਲਾਂ ਵਿਚਕਾਰ ਸਬੰਧਾਂ ਵਿੱਚ ਡੂੰਘੀ ਸੂਝ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦਾ ਹੈ।