سادي لڪير ريگريشن تجزيو
سادي لڪير ريگريشن هڪ شمارياتي ٽيڪنڪ آهي جيڪا ٻن مقداري متغيرن جي وچ ۾ تعلق جو تجزيو ڪرڻ لاءِ استعمال ٿيندي آهي. جيڪو متغير اسان اڳڪٿي ڪرڻ جي ڪوشش ڪري رهيا آهيون ان کي منحصر يا جوابي متغير سڏيو ويندو آهي، جڏهن ته اڳڪٿي ڪرڻ لاءِ استعمال ٿيندڙ متغير کي آزاد يا اڳڪٿي ڪندڙ متغير سڏيو ويندو آهي. سادي لڪير ريگريشن ۾، اسان بهترين سڌي لڪير ڳولڻ جي ڪوشش ڪندا آهيون جيڪا انهن ٻن متغيرن جي وچ ۾ تعلق کي بيان ڪري ٿي.
سادي لڪير واري رجعت جا بنيادي تصور
سادي لڪير ريگريشن ان مفروضي تي ٻڌل آهي ته منحصر متغير \(Y\) ۽ آزاد متغير \(X\) جي وچ ۾ هڪ لڪير تعلق آهي. هڪ سادي لڪير ريگريشن ماڊل جي عام شڪل آهي:
\[ وائي = \بيٽا_0 + \بيٽا_1 ايڪس + \ايپسيلون \]
ڪٿي:
– \( Y \) منحصر متغير آهي.
- \( X \) آزاد متغير آهي.
– \( \beta_0 \) انٽرسيپٽ آهي، جيڪو \(Y\) جي قيمت آهي جڏهن \(X = 0\).
– \( \beta_1 \) ڍلون يا گريڊينٽ آهي، جيڪو \(X\) ۾ هر يونٽ جي تبديلي لاءِ \(Y\) ۾ سراسري تبديلي آهي.
– \( \epsilon \) هڪ غلطي يا باقي بچيل اصطلاح آهي جيڪو \(Y\) ۾ تبديلي کي ظاهر ڪري ٿو جيڪو \(X\) ذريعي بيان نٿو ڪري سگهجي.
سادي لڪير واري رجعت جو مقصد \(\beta_0\) ۽ \(\beta_1\) پيرا ميٽرز جو اندازو لڳائڻ آهي ته جيئن ماڊل کي \(X\) جي قدر سان لاڳاپيل \(Y\) جي قدر جي اڳڪٿي ڪرڻ لاءِ استعمال ڪري سگهجي.
گھٽ ۾ گھٽ چورس جو طريقو
هڪ سادي لڪير ريگريشن ماڊل کي فٽ ڪرڻ لاءِ سڀ کان وڌيڪ استعمال ٿيندڙ طريقن مان هڪ آهي گهٽ ۾ گهٽ چورس طريقو. هن طريقي جو مقصد اصل مشاهدن ۽ ماڊل پاران پيش ڪيل قدرن جي وچ ۾ عمودي انحراف جي چورس جي مجموعن کي گھٽ ڪرڻ آهي. فرض ڪريو ته اسان وٽ n مشاهدا آهن جيڪي جوڙا \((x_i, y_i)\) تي مشتمل آهن \(i = 1, 2, …, n\) لاءِ. گھٽ ۾ گھٽ ڪرڻ وارو ڪم آهي:
\[ ايس (\بيٽا_0، \بيٽا_1) = \سم_{آءِ=1}^{ن} (ي_آءِ - (\بيٽا_0 + \بيٽا_1 x_آءِ))^2 \]
هن فنڪشن کي گھٽ ڪرڻ لاءِ \(\beta_0\) ۽ \(\beta_1\) ڳولڻ لاءِ، اسان هر پيرا ميٽر جي حوالي سان \(S(\beta_0, \beta_1)\) جا جزوي نڪتل وٺون ٿا ۽ انهن نڪتل نڪتن کي صفر تي سيٽ ڪريون ٿا. رياضياتي حساب کي هن ريت آسان بڻائي سگهجي ٿو:
\[ \بيٽا_1 = \فريڪ{\سم_{i=1}^{n} (x_i – \بار{x})(y_i – \بار{y})}{\سم_{i=1}^{n} (x_i – \بار{x})^2} \]
\[ beta_0 = \bar{y} - \beta_1 \bar{x} \]
ڪٿي:
- \(\bar{x}\) \(X\) جو سراسري آهي
- \(\bar{y}\) \(Y\) جو سراسري آهي
پيرا ميٽرز \(\beta_0\) ۽ \(\beta_1\) حاصل ڪرڻ کان پوءِ، هڪ سادي لڪير ريگريشن ماڊل کي \(X\) جي هر قدر لاءِ \(Y\) جي قدر جي اڳڪٿي ڪرڻ لاءِ استعمال ڪري سگهجي ٿو.
سادي لڪير واري رجعت ۾ مفروضا
صحيح ۽ قابل اعتماد نتيجن لاءِ، سادي لڪير واري رجعت ڪيترن ئي شين کي فرض ڪري ٿي:
1. لڪيريت: منحصر متغير ۽ آزاد متغير جي وچ ۾ تعلق لڪيري هجڻ گهرجي.
2. آزادي: مشاهدا هڪ ٻئي کان آزاد هجڻ گهرجن.
3. هم جنس پرستي: باقي متغير آزاد متغير جي قدرن جي پوري حد ۾ مستقل هجڻ گهرجي.
4. باقيات جي عاميت: باقيات (غلطيون) کي عام ورڇ جي پيروي ڪرڻ گهرجي.
جيڪڏهن اهي مفروضا پورا نه ٿيا، ته هڪ سادي لڪير ريگريشن ماڊل جا نتيجا ناقابل اعتبار هوندا ۽ شايد صحيح اڳڪٿيون نه ڪري سگهندا.
ريگريشن ماڊل تشخيص
هڪ سادي لڪير ريگريشن ماڊل ڪيتري سٺي اڳڪٿي ڪئي آهي ان جو اندازو لڳائڻ جو هڪ طريقو اهو آهي ته تعين جي کوٽائي (\(R^2\)) کي استعمال ڪيو وڃي. تعين جو کوٽائي انحصار متغير ۾ متغير جي تناسب کي ڏيکاري ٿو جيڪو آزاد متغير ۾ متغير جي ذريعي وضاحت ڪري سگهجي ٿو.
\[ آر ^ 2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
ڪٿي:
– \(\hat{y}_i\) \(Y\) جي اڳڪٿي ڪيل قيمت آهي.
– \(y_i\) \(Y\) جو اصل قدر آهي.
– \(\bar{y}\) \(Y\) جي قدرن جو سراسري آهي.
\(R^2\) قدر 0 کان 1 تائين آهي. 1 جي ويجهو هڪ \(R^2\) قدر ظاهر ڪري ٿو ته ماڊل منحصر متغير ۾ گهڻي ڀاڱي تبديلي جي وضاحت ڪري سگهي ٿو.
پروگرامنگ ٻولي ۾ عمل درآمد
سادي لڪير ريگريشن کي لاڳو ڪرڻ لاءِ، اسان مختلف شمارياتي سافٽ ويئر يا پروگرامنگ ٻوليون استعمال ڪري سگھون ٿا. هيٺ ڏنل هڪ مثال آهي پٿون ۾ `scikit-learn` لائبريري استعمال ڪندي لاڳو ڪرڻ:
"پٿر"
numpy طور np درآمد ڪريو
matplotlib.pyplot کي plt طور درآمد ڪريو
sklearn.linear_model درآمد کان لڪير ريگريشن
sklearn.metrics کان درآمد mean_squared_error، r2_score
ڊيٽا
ايڪس = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5، 3.6، 3.5، 2.9، 5.5]).astype(np.float64)
ماڊل
ماڊل = لڪير ريگريشن ()
ماڊل.فٽ (X، y)
اڳڪٿي
y_pred = ماڊل.predict(X)
ڪوفيشينٽ
بيٽا_0 = ماڊل.انٽرسيپٽ_
بيٽا_1 = ماڊل.ڪوف_[0]
پرنٽ (f'انٽرسيپٽ: {beta_0}')
پرنٽ (f'سلوپ: {beta_1}')
پرنٽ (f'مين اسڪوائر غلطي: {mean_squared_error(y, y_pred)}')
پرنٽ (f'تعين جو ڪوفيشيٽ (R^2): {r2_score(y, y_pred)}')
ڊيٽا پلاٽ ۽ ريگريشن لائن
plt.scatter(X, y, رنگ = 'نيرو')
plt.plot(X, y_pred, رنگ = 'ڳاڙهو')
plt.xlabel('X')
plt.ylabel('Y')
plt.show()
“
مٿي ڏنل مثال ۾، اسان پهريان ضروري لائبريريون درآمد ڪريون ٿا، ڊيٽا \(X\) ۽ \(Y\) کي بيان ڪريون ٿا، ۽ پوءِ ماڊل کي ڊيٽا سان فٽ ڪرڻ لاءِ `scikit-learn` مان `LinearRegression` آبجيڪٽ استعمال ڪريون ٿا. هڪ ڀيرو ماڊل فٽ ٿي وڃي ٿو، اسان اڳڪٿيون ڪريون ٿا ۽ ڪوفيشينٽس جو حساب ڪريون ٿا، انهي سان گڏ اوسط اسڪوائر غلطي ۽ عزم جي ڪوفيشينٽس جو. آخرڪار، اسان ڊيٽا ۽ ريگريشن لائن کي پلاٽ ڪريون ٿا.
نتيجو
سادي لڪير ريگريشن هڪ طاقتور شمارياتي تجزيي جو اوزار آهي جيڪو ٻن مقداري متغيرن جي وچ ۾ تعلق کي بيان ڪرڻ لاءِ استعمال ڪيو ويندو آهي. لڪيريت، آزادي، هم جنس پرستي، ۽ نارملٽي بابت ڪجهه بنيادي مفروضن سان، اسان آزاد متغيرن جي قدرن جي بنياد تي منحصر متغير جي قدر جي اڳڪٿي ڪري سگهون ٿا. گهٽ ۾ گهٽ اسڪوائر طريقو ريگريشن لائن کي فٽ ڪرڻ ۽ بهترين پيرا ميٽرز کي طئي ڪرڻ جو هڪ مؤثر طريقو فراهم ڪري ٿو. تعين جي کوٽائي (R2) ذريعي ماڊل تشخيص اسان جي ماڊل جي ڪارڪردگي جي بصيرت فراهم ڪري ٿي.
جيتوڻيڪ سادي لڪير واري رجعت جون حدون آهن، جهڙوڪ صرف ٻن متغيرن کي سنڀالڻ جي قابل هجڻ ۽ اهي مفروضا جيڪي پورا ٿيڻ گهرجن، هي ٽيڪنڪ انگ اکر ۽ ڊيٽا جي تجزيي ۾ هڪ اهم بنياد رهي ٿي، ۽ اڪثر ڪري وڌيڪ پيچيده طريقن ڏانهن وڌڻ کان اڳ متغيرن جي وچ ۾ تعلق کي سمجهڻ ۾ پهرين قدم طور استعمال ڪئي ويندي آهي.