සරල රේඛීය ප්‍රතිගාමී විශ්ලේෂණය

සරල රේඛීය ප්‍රතිගමන විශ්ලේෂණය

සරල රේඛීය ප්‍රතිගමනය යනු ප්‍රමාණාත්මක විචල්‍ය දෙකක් අතර සම්බන්ධතාවය විශ්ලේෂණය කිරීමට භාවිතා කරන සංඛ්‍යානමය තාක්‍ෂණයකි. අප පුරෝකථනය කිරීමට උත්සාහ කරන විචල්‍යය යැපෙන හෝ ප්‍රතිචාර විචල්‍යය ලෙස හඳුන්වන අතර, පුරෝකථනය කිරීමට භාවිතා කරන විචල්‍යය ස්වාධීන හෝ පුරෝකථන විචල්‍යය ලෙස හැඳින්වේ. සරල රේඛීය ප්‍රතිගමනයේදී, මෙම විචල්‍ය දෙක අතර සම්බන්ධතාවය විස්තර කරන හොඳම සරල රේඛාව සොයා ගැනීමට අපි උත්සාහ කරමු.

සරල රේඛීය ප්‍රතිගමනය පිළිබඳ මූලික සංකල්ප

සරල රේඛීය ප්‍රතිගමනය පදනම් වී ඇත්තේ යැපෙන විචල්‍යය \(Y\) සහ ස්වාධීන විචල්‍යය \(X\) අතර රේඛීය සම්බන්ධතාවයක් ඇති බවට උපකල්පනය මත ය. සරල රේඛීය ප්‍රතිගමන ආකෘතියක සාමාන්‍ය ස්වරූපය:

\[ Y = \beta_0 + \beta_1 X + \epsilon \]

මා:
– \( Y \) යනු යැපෙන විචල්‍යයයි.
– \( X \) යනු ස්වාධීන විචල්‍යයයි.
– \( \beta_0 \) යනු අන්තඃඛණ්ඩය වන අතර, එය \(X = 0\) විට \(Y\) හි අගය වේ.
– \( \beta_1 \) යනු බෑවුම හෝ අනුක්‍රමණය වන අතර, එය \(X\) හි සෑම ඒකක වෙනසක් සඳහාම \(Y\) හි සාමාන්‍ය වෙනස වේ.
– \( \epsilon \) යනු \(X\) මගින් පැහැදිලි කළ නොහැකි \(Y\) හි විචල්‍යතාවය නිරූපණය කරන දෝෂය හෝ අවශේෂ පදයයි.

සරල රේඛීය ප්‍රතිගමනයේ ඉලක්කය වන්නේ \(\beta_0\) සහ \(\beta_1\) පරාමිතීන් ඇස්තමේන්තු කිරීමයි, එවිට ආකෘතිය \(X\) අගය හා සම්බන්ධ \(Y\) අගය පුරෝකථනය කිරීමට භාවිතා කළ හැකිය.

අවම වර්ග ක්‍රමය

සරල රේඛීය ප්‍රතිගාමී ආකෘතියක් සවි කිරීම සඳහා බහුලව භාවිතා වන ක්‍රමවලින් එකක් වන්නේ අවම චතුරස්‍ර ක්‍රමයයි. මෙම ක්‍රමය මඟින් සැබෑ නිරීක්ෂණ සහ ආකෘතිය මගින් පුරෝකථනය කරන ලද අගයන් අතර සිරස් අපගමනයන්ගේ වර්ගවල එකතුව අවම කිරීම අරමුණු කරයි. \(i = 1, 2, …, n\) සඳහා යුගල \((x_i, y_i)\) වලින් සමන්විත නිරීක්ෂණ n ක් අපගමනය කර ඇතැයි සිතමු. අවම කළ යුතු ශ්‍රිතය වන්නේ:

\[ S(\beta_0, \beta_1) = \sum_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]

මෙම ශ්‍රිතය අවම කරන \(\beta_0\) සහ \(\beta_1\) සොයා ගැනීමට, අපි එක් එක් පරාමිතියට සාපේක්ෂව \(S(\beta_0, \beta_1)\) හි අර්ධ ව්‍යුත්පන්නයන් ගෙන මෙම ව්‍යුත්පන්නයන් ශුන්‍යයට සකසමු. ගණිතමය ගණනය කිරීම පහත පරිදි සරල කළ හැකිය:

\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]

\[ \beta_0 = \bar{y} – \beta_1 \bar{x} \]

මා:
– \(\bar{x}\) යනු \(X\) හි සාමාන්‍යයයි.
– \(\bar{y}\) යනු \(Y\) හි සාමාන්‍යයයි.

\(\beta_0\) සහ \(\beta_1\) පරාමිතීන් ලබා ගැනීමෙන් පසු, \(X\) හි සෑම අගයක් සඳහාම \(Y\) හි අගය පුරෝකථනය කිරීමට සරල රේඛීය ප්‍රතිගාමී ආකෘතියක් භාවිතා කළ හැකිය.

සරල රේඛීය ප්‍රතිගමනයේ උපකල්පන

වලංගු සහ විශ්වාසදායක ප්‍රතිඵල සඳහා, සරල රේඛීය ප්‍රතිගමනය කරුණු කිහිපයක් උපකල්පනය කරයි:
1. රේඛීයතාව: යැපෙන විචල්‍යය සහ ස්වාධීන විචල්‍යය අතර සම්බන්ධතාවය රේඛීය විය යුතුය.
2. ස්වාධීනත්වය: නිරීක්ෂණ එකිනෙකින් ස්වාධීන විය යුතුය.
3. සමජාතීයතාව: ස්වාධීන විචල්‍යයේ අගයන් පරාසය පුරා අවශේෂ විචල්‍යතාවය නියත විය යුතුය.
4. අවශේෂ සාමාන්‍යභාවය: අවශේෂ (දෝෂ) සාමාන්‍ය ව්‍යාප්තියක් අනුගමනය කළ යුතුය.

මෙම උපකල්පන සපුරා නොමැති නම්, සරල රේඛීය ප්‍රතිගාමී ආකෘතියක ප්‍රතිඵල විශ්වාස කළ නොහැකි අතර නිවැරදි අනාවැකි පළ කිරීමට නොහැකි විය හැකිය.

ප්‍රතිගාමී ආකෘති තක්සේරුව

සරල රේඛීය ප්‍රතිගාමී ආකෘතියක් කොතරම් හොඳින් පුරෝකථනය කර ඇත්දැයි තක්සේරු කිරීමට එක් ක්‍රමයක් නම් නිර්ණය කිරීමේ සංගුණකය (\(R^2\)) භාවිතා කිරීමයි. නිර්ණය කිරීමේ සංගුණකය මඟින් ස්වාධීන විචල්‍යවල විචල්‍යතාවයෙන් පැහැදිලි කළ හැකි යැපෙන විචල්‍යයේ විචල්‍යතාවයේ අනුපාතය පෙන්වයි.

\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]

මා:
– \(\hat{y}_i\) යනු \(Y\) හි පුරෝකථනය කරන ලද අගයයි.
– \(y_i\) යනු \(Y\) හි සත්‍ය අගයයි.
– \(\bar{y}\) යනු \(Y\) හි අගයන්හි සාමාන්‍යය වේ.

\(R^2\) අගය 0 සිට 1 දක්වා පරාසයක පවතී. \(R^2\) අගය 1 ට ආසන්න නම්, ආකෘතියට යැපෙන විචල්‍යයේ බොහෝ විචල්‍යතා පැහැදිලි කළ හැකි බව පෙන්නුම් කරයි.

ක්‍රමලේඛන භාෂාව තුළ ක්‍රියාත්මක කිරීම

සරල රේඛීය ප්‍රතිගමනය ක්‍රියාත්මක කිරීම සඳහා, අපට විවිධ සංඛ්‍යානමය මෘදුකාංග හෝ ක්‍රමලේඛන භාෂා භාවිතා කළ හැකිය. `scikit-learn` පුස්තකාලය භාවිතයෙන් Python හි ක්‍රියාත්මක කිරීමකට උදාහරණයක් පහත දැක්වේ:

"`පිඹුරා
අංක ලෙස npy ලෙස ආයාත කරන්න
mattlotlib.pyplot plt ලෙස ආයාත කරන්න
sklearn.linear_model ආනයනය LinearRegression වෙතින්
sklearn.metrics වෙතින් මධ්‍යන්‍ය_වර්ග_දෝෂය ආයාත කරන්න, r2_score

දත්ත
X = np.array([[1], [2], [3], [4], [5]]).වර්ගය(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).වර්ගය(np.float64)

ආදර්ශ
ආකෘතිය = රේඛීය ප්‍රතිගාමීත්වය ()
ආකෘතිය.ෆිට්(X, y)

අනාවැකිය
y_pred = model.predict (X)

සංගුණකය
බීටා_0 = ආකෘතිය.අන්තර්ගත කිරීම_
බීටා_1 = ආකෘතිය.coef_[0]

මුද්‍රණය කරන්න(f'අන්තර්ඡේදය: {beta_0}')
මුද්‍රණය කරන්න(f'බෑවුම: {beta_1}')
print(f'මධ්‍ය වර්ග දෝෂය: {මධ්‍ය_වර්ග_දෝෂය(y, y_pred)}')
print(f'නිර්ණ සංගුණකය (R^2): {r2_score(y, y_pred)}')

දත්ත සටහන සහ ප්‍රතිගාමී රේඛාව
plt.scatter(X, y, වර්ණය='නිල්')
plt.plot(X, y_pred, වර්ණය='රතු')
plt.xලේබලය('X')
plt.ylabel('Y')
plt.show ()
""

ඉහත උදාහරණයේ දී, අපි මුලින්ම අවශ්‍ය පුස්තකාල ආයාත කර, \(X\) සහ \(Y\) දත්ත නිර්වචනය කර, පසුව `scikit-learn` වෙතින් `LinearRegression` වස්තුව භාවිතා කර දත්ත වලට ආකෘතියක් සවි කරමු. ආකෘතිය සවි කළ පසු, අපි අනාවැකි පළ කර සංගුණක මෙන්ම මධ්‍යන්‍ය වර්ග දෝෂය සහ නිර්ණය කිරීමේ සංගුණකය ගණනය කරමු. අවසාන වශයෙන්, අපි දත්ත සහ ප්‍රතිගාමී රේඛාව සැලසුම් කරමු.

නිගමනය

සරල රේඛීය ප්‍රතිගමනය යනු ප්‍රමාණාත්මක විචල්‍ය දෙකක් අතර සම්බන්ධතාවය පැහැදිලි කිරීමට භාවිතා කරන ප්‍රබල සංඛ්‍යානමය විශ්ලේෂණ මෙවලමකි. රේඛීයතාව, ස්වාධීනත්වය, සමජාතීයතාව සහ සාමාන්‍යභාවය පිළිබඳ මූලික උපකල්පන කිහිපයක් සමඟින්, ස්වාධීන විචල්‍යයන්ගේ අගයන් මත පදනම්ව යැපෙන විචල්‍යයේ අගය අපට පුරෝකථනය කළ හැකිය. අවම වර්ග ක්‍රමය ප්‍රතිගාමී රේඛාවකට ගැළපීමට සහ ප්‍රශස්ත පරාමිතීන් තීරණය කිරීමට ඵලදායී ක්‍රමයක් සපයයි. නිර්ණය කිරීමේ සංගුණකය (R2) හරහා ආකෘති ඇගයීම අපගේ ආකෘතිය කෙතරම් හොඳින් ක්‍රියා කරයිද යන්න පිළිබඳ අවබෝධයක් ලබා දෙයි.

සරල රේඛීය ප්‍රතිගමනයට විචල්‍ය දෙකක් පමණක් හැසිරවිය හැකි වීම සහ සපුරාලිය යුතු උපකල්පන වැනි සීමාවන් තිබුණද, මෙම තාක්ෂණය සංඛ්‍යාලේඛන සහ දත්ත විශ්ලේෂණයේ වැදගත් පදනමක් ලෙස පවතින අතර, වඩාත් සංකීර්ණ ක්‍රම වෙත යාමට පෙර විචල්‍යයන් අතර සම්බන්ධතාවය තේරුම් ගැනීමේ පළමු පියවර ලෙස බොහෝ විට භාවිතා වේ.

අදහස අත්හැර