سادہ لکیری ریگریشن تجزیہ
سادہ لکیری رجعت ایک شماریاتی تکنیک ہے جو دو مقداری متغیرات کے درمیان تعلق کا تجزیہ کرنے کے لیے استعمال ہوتی ہے۔ ہم جس متغیر کی پیشین گوئی کرنے کی کوشش کر رہے ہیں اسے منحصر یا ردعمل متغیر کہا جاتا ہے، جبکہ پیش گوئی کرنے کے لیے استعمال ہونے والا متغیر آزاد یا پیشین گوئی کرنے والا متغیر کہلاتا ہے۔ سادہ لکیری رجعت میں، ہم بہترین سیدھی لکیر تلاش کرنے کی کوشش کرتے ہیں جو ان دو متغیرات کے درمیان تعلق کو بیان کرتی ہے۔
سادہ لکیری رجعت کے بنیادی تصورات
سادہ لکیری رجعت اس مفروضے پر مبنی ہے کہ منحصر متغیر \(Y\) اور آزاد متغیر \(X\) کے درمیان خطی تعلق ہے۔ ایک سادہ لکیری ریگریشن ماڈل کی عمومی شکل یہ ہے:
\[ Y = \beta_0 + \beta_1 X + \epsilon \]
کہاں:
- \( Y \) منحصر متغیر ہے۔
- \( X \) آزاد متغیر ہے۔
- \( \beta_0 \) انٹرسیپٹ ہے، جو \(Y\) کی قدر ہے جب \(X = 0\)۔
- \( \beta_1 \) ڈھال یا میلان ہے، جو \(X\) میں ہر یونٹ کی تبدیلی کے لیے \(Y\) میں اوسط تبدیلی ہے۔
- \( \epsilon \) وہ غلطی یا بقایا اصطلاح ہے جو \(Y\) میں تغیر کی نمائندگی کرتی ہے جس کی وضاحت \(X\) سے نہیں کی جا سکتی ہے۔
سادہ لکیری ریگریشن کا مقصد پیرامیٹرز \(\beta_0\) اور \(\beta_1\) کا تخمینہ لگانا ہے تاکہ ماڈل کو \(X\) کی قدر سے وابستہ \(Y\) کی قدر کا اندازہ لگانے کے لیے استعمال کیا جا سکے۔
کم سے کم چوکوں کا طریقہ
ایک سادہ لکیری ریگریشن ماڈل کو فٹ کرنے کے لیے سب سے زیادہ استعمال ہونے والے طریقوں میں سے ایک Least Squares طریقہ ہے۔ اس طریقہ کار کا مقصد اصل مشاہدات اور ماڈل کے ذریعہ پیش گوئی کی گئی اقدار کے درمیان عمودی انحراف کے مربعوں کے مجموعے کو کم کرنا ہے۔ فرض کریں کہ ہمارے پاس \(i = 1, 2, …, n\) کے لیے \(x_i, y_i)\) جوڑوں پر مشتمل n مشاہدات ہیں۔ فنکشن کو کم سے کم کرنا ہے:
\[ S(\beta_0, \beta_1) = \sum_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]
اس فنکشن کو کم کرنے والے \(\beta_0\) اور \(\beta_1\) کو تلاش کرنے کے لیے، ہم ہر پیرامیٹر کے حوالے سے \(S(\beta_0, \beta_1)\) کے جزوی مشتقات لیتے ہیں اور ان مشتقات کو صفر پر سیٹ کرتے ہیں۔ ریاضی کے حساب کتاب کو اس طرح آسان بنایا جا سکتا ہے:
\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]
\[ \beta_0 = \bar{y} - \beta_1 \bar{x} \]
کہاں:
- \(\bar{x}\) \(X\) کا اوسط ہے
- \(\bar{y}\) \(Y\) کا اوسط ہے
پیرامیٹرز \(\beta_0\) اور \(\beta_1\) حاصل کرنے کے بعد، \(X\) کی ہر قدر کے لیے \(Y\) کی قدر کا اندازہ لگانے کے لیے ایک سادہ لکیری ریگریشن ماڈل استعمال کیا جا سکتا ہے۔
سادہ لکیری رجعت میں مفروضے۔
درست اور قابل اعتماد نتائج کے لیے، سادہ لکیری رجعت کئی چیزوں کو فرض کرتی ہے:
1. لکیریٹی: منحصر متغیر اور آزاد متغیر کے درمیان تعلق خطی ہونا چاہیے۔
2. آزادی: مشاہدات کو ایک دوسرے سے آزاد ہونا چاہیے۔
3. Homoscedasticity: بقایا تغیرات کو آزاد متغیر کی اقدار کی پوری حد میں مستقل ہونا چاہیے۔
4. بقایا نارملٹی: بقایا (غلطیاں) کو ایک عام تقسیم کی پیروی کرنی چاہیے۔
اگر ان مفروضوں کو پورا نہیں کیا جاتا ہے تو، ایک سادہ لکیری ریگریشن ماڈل کے نتائج ناقابل اعتبار ہوں گے اور درست پیشین گوئیاں کرنے کے قابل نہیں ہوسکتے ہیں۔
ریگریشن ماڈل کی تشخیص
ایک سادہ لکیری ریگریشن ماڈل نے کتنی اچھی پیش گوئی کی ہے اس کا اندازہ لگانے کا ایک طریقہ یہ ہے کہ کوفیشینٹ آف ڈیٹرمینیشن (\(R^2\)) کا استعمال کیا جائے۔ تعیین کا گتانک منحصر متغیر میں تغیر کے تناسب کو ظاہر کرتا ہے جس کی وضاحت آزاد متغیر میں تغیر کے ذریعے کی جا سکتی ہے۔
\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]
کہاں:
- \(\hat{y}_i\) \(Y\) کی پیش گوئی کی گئی قدر ہے۔
- \(y_i\) \(Y\) کی اصل قدر ہے۔
- \(\bar{y}\) \(Y\) کی قدروں کا اوسط ہے۔
\(R^2\) قدر 0 سے 1 تک ہوتی ہے۔ \(R^2\) قدر 1 کے قریب ظاہر کرتی ہے کہ ماڈل منحصر متغیر میں زیادہ تر تغیرات کی وضاحت کر سکتا ہے۔
پروگرامنگ زبان میں نفاذ
سادہ لکیری رجعت کو نافذ کرنے کے لیے، ہم مختلف شماریاتی سافٹ ویئر یا پروگرامنگ زبانیں استعمال کر سکتے ہیں۔ ذیل میں 'scikit-learn' لائبریری کا استعمال کرتے ہوئے Python میں عمل درآمد کی ایک مثال ہے۔
'' ازگر
بطور این پی پی درآمد کریں
matplotlib.pyplot بطور plt درآمد کریں۔
sklearn.linear_model سے LinearRegression درآمد کریں۔
sklearn.metrics سے mean_squared_error، r2_score درآمد کریں۔
ڈیٹا
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([1.5, 3.6, 3.5, 2.9, 5.5]).astype(np.float64)
ماڈل
ماڈل = لکیری ریگریشن ()
model.fit (X, y)
پیشن گوئی
y_pred = model.predict (X)
عدد
beta_0 = model.intercept_
beta_1 = model.coef_[0]
پرنٹ (f'Intercept: {beta_0}')
پرنٹ (f'Slope: {beta_1}')
پرنٹ (f'Mean مربع غلطی: {mean_squared_error(y, y_pred)}')
پرنٹ(f'عدد تعیین (R^2): {r2_score(y, y_pred)}')
ڈیٹا پلاٹ اور ریگریشن لائن
plt.scatter(X, y, color='blue')
plt.plot(X, y_pred, color='red')
plt.xlabel('X')
plt.ylabel('Y')
plt.show ()
“۔
مندرجہ بالا مثال میں، ہم پہلے ضروری لائبریریاں درآمد کرتے ہیں، ڈیٹا \(X\) اور \(Y\) کی وضاحت کرتے ہیں، اور پھر ڈیٹا میں ماڈل فٹ کرنے کے لیے `scikit-learn` سے `LinearRegression` آبجیکٹ کا استعمال کرتے ہیں۔ ماڈل فٹ ہونے کے بعد، ہم پیشین گوئیاں کرتے ہیں اور گتانک کا حساب لگاتے ہیں، ساتھ ہی درمیانی مربع کی غلطی اور تعیین کے گتانک کا حساب لگاتے ہیں۔ آخر میں، ہم ڈیٹا اور ریگریشن لائن کو پلاٹ کرتے ہیں۔
نتیجہ اخذ کرنا
سادہ لکیری رجعت ایک طاقتور شماریاتی تجزیہ ٹول ہے جو دو مقداری متغیرات کے درمیان تعلق کی وضاحت کے لیے استعمال ہوتا ہے۔ خطوط، آزادی، ہم جنس پرستی، اور نارملٹی کے بارے میں کچھ بنیادی مفروضوں کے ساتھ، ہم آزاد متغیر کی قدروں کی بنیاد پر منحصر متغیر کی قدر کی پیش گوئی کر سکتے ہیں۔ Least Squares طریقہ ریگریشن لائن کو فٹ کرنے اور بہترین پیرامیٹرز کا تعین کرنے کا ایک مؤثر طریقہ فراہم کرتا ہے۔ عددی تعیین (R2) کے ذریعے ماڈل کی تشخیص اس بات کی بصیرت فراہم کرتی ہے کہ ہمارا ماڈل کتنی اچھی کارکردگی کا مظاہرہ کرتا ہے۔
اگرچہ سادہ لکیری رجعت کی حدود ہوتی ہیں، جیسے کہ صرف دو متغیرات کو ہینڈل کرنے کے قابل ہونا اور ان مفروضوں کو پورا کرنا ضروری ہے، لیکن یہ تکنیک اعداد و شمار اور ڈیٹا کے تجزیہ میں ایک اہم بنیاد بنی ہوئی ہے، اور زیادہ پیچیدہ طریقوں پر جانے سے پہلے متغیر کے درمیان تعلق کو سمجھنے کے لیے اکثر پہلے قدم کے طور پر استعمال ہوتی ہے۔