सरल रेखीय प्रतिगमन विश्लेषण

सरल रेखीय प्रतिगमन विश्लेषण

साधारण रेखीय प्रतिगमन दुई मात्रात्मक चरहरू बीचको सम्बन्धको विश्लेषण गर्न प्रयोग गरिने तथ्याङ्कीय प्रविधि हो। हामीले भविष्यवाणी गर्न खोजेको चरलाई निर्भर वा प्रतिक्रिया चर भनिन्छ, जबकि भविष्यवाणी गर्न प्रयोग गरिने चरलाई स्वतन्त्र वा भविष्यसूचक चर भनिन्छ। साधारण रेखीय प्रतिगमनमा, हामी यी दुई चरहरू बीचको सम्बन्धलाई वर्णन गर्ने उत्तम सीधा रेखा फेला पार्ने प्रयास गर्छौं।

साधारण रेखीय प्रतिगमनको आधारभूत अवधारणाहरू

साधारण रेखीय प्रतिगमन यस धारणामा आधारित छ कि आश्रित चर \(Y\) र स्वतन्त्र चर \(X\) बीच एक रेखीय सम्बन्ध छ। साधारण रेखीय प्रतिगमन मोडेलको सामान्य रूप हो:

\[ वाई = \बीटा_० + \बीटा_१ एक्स + \ईप्सिलन \]

कहाँ:
– \( Y \) निर्भर चर हो।
– \( X \) स्वतन्त्र चर हो।
– \( \beta_0 \) अवरोध हो, जुन \(Y\) को मान हो जब \(X = 0\) हुन्छ।
– \( \beta_1 \) भनेको ढलान वा ग्रेडियन्ट हो, जुन \(X\) मा प्रत्येक एकाइ परिवर्तनको लागि \(Y\) मा औसत परिवर्तन हो।
– \( \epsilon \) त्रुटि वा अवशिष्ट पद हो जसले \(Y\) मा रहेको परिवर्तनशीलतालाई प्रतिनिधित्व गर्दछ जुन \(X\) द्वारा व्याख्या गर्न सकिँदैन।

साधारण रेखीय प्रतिगमनको लक्ष्य भनेको \(\beta_0\) र \(\beta_1\) प्यारामिटरहरू अनुमान गर्नु हो ताकि मोडेललाई \(X\) को मानसँग सम्बन्धित \(Y\) को मान भविष्यवाणी गर्न प्रयोग गर्न सकियोस्।

सबैभन्दा कम वर्ग विधि

साधारण रेखीय प्रतिगमन मोडेल फिट गर्नको लागि सबैभन्दा धेरै प्रयोग हुने विधिहरू मध्ये एक Least Squares विधि हो। यो विधिले वास्तविक अवलोकनहरू र मोडेलद्वारा अनुमानित मानहरू बीचको ठाडो विचलनहरूको वर्गहरूको योगफललाई न्यूनतम गर्ने लक्ष्य राख्छ। मानौं हामीसँग \(i = 1, 2, …, n\ को लागि जोडीहरू \((x_i, y_i)\) मिलेर बनेको n अवलोकनहरू छन्। न्यूनतम गर्नुपर्ने प्रकार्य यो हो:

\[ S(\beta_0, \beta_1) = \योग_{i=1}^{n} (y_i – (\beta_0 + \beta_1 x_i))^2 \]

पढ्नुहोस्  शहरी योजनामा ​​तथ्याङ्क

यो प्रकार्यलाई न्यूनतम गर्ने \(\beta_0\) र \(\beta_1\) फेला पार्न, हामी प्रत्येक प्यारामिटरको सन्दर्भमा \(S(\beta_0, \beta_1)\) को आंशिक डेरिभेटिभहरू लिन्छौं र यी डेरिभेटिभहरूलाई शून्यमा सेट गर्छौं। गणितीय गणनालाई निम्नानुसार सरलीकृत गर्न सकिन्छ:

\[ \beta_1 = \frac{\sum_{i=1}^{n} (x_i – \bar{x})(y_i – \bar{y})}{\sum_{i=1}^{n} (x_i – \bar{x})^2} \]

\[ \ beta_0 = \bar{y} - \beta_1 \bar{x} \]

कहाँ:
– \(\bar{x}\) \(X\) को औसत हो
– \(\bar{y}\) \(Y\) को औसत हो

\(\beta_0\) र \(\beta_1\) प्यारामिटरहरू प्राप्त गरेपछि, \(X\) को प्रत्येक मानको लागि \(Y\) को मान भविष्यवाणी गर्न एउटा साधारण रेखीय प्रतिगमन मोडेल प्रयोग गर्न सकिन्छ।

साधारण रेखीय प्रतिगमनमा अनुमानहरू

मान्य र भरपर्दो नतिजाहरूको लागि, साधारण रेखीय प्रतिगमनले धेरै कुराहरू मान्दछ:
१. रेखीयता: आश्रित चर र स्वतन्त्र चर बीचको सम्बन्ध रेखीय हुनुपर्छ।
२. स्वतन्त्रता: अवलोकनहरू एकअर्काबाट स्वतन्त्र हुनुपर्छ।
३. समरूपता: अवशिष्ट परिवर्तनशीलता स्वतन्त्र चरको मानहरूको दायरामा स्थिर हुनुपर्छ।
४. अवशिष्ट सामान्यता: अवशिष्टहरू (त्रुटिहरू) ले सामान्य वितरण पालना गर्नुपर्छ।

यदि यी धारणाहरू पूरा भएनन् भने, साधारण रेखीय प्रतिगमन मोडेलको नतिजा अविश्वसनीय हुनेछ र सही भविष्यवाणी गर्न सक्षम नहुन सक्छ।

प्रतिगमन मोडेल मूल्याङ्कन

साधारण रेखीय प्रतिगमन मोडेलले कति राम्रोसँग भविष्यवाणी गरेको छ भनेर मूल्याङ्कन गर्ने एउटा तरिका भनेको निर्धारणको गुणांक (\(R^2\)) प्रयोग गर्नु हो। निर्धारणको गुणांकले निर्भर चरमा परिवर्तनशीलताको अनुपात देखाउँछ जुन स्वतन्त्र चरहरूमा परिवर्तनशीलताद्वारा व्याख्या गर्न सकिन्छ।

\[ R^2 = \frac{\sum_{i=1}^{n} (\hat{y}_i – \bar{y})^2}{\sum_{i=1}^{n} (y_i – \bar{y})^2} \]

कहाँ:
– \(\hat{y}_i\) \(Y\) को अनुमानित मान हो।
– \(y_i\) \(Y\) को वास्तविक मान हो।
– \(\bar{y}\) \(Y\) को मानहरूको औसत हो।

\(R^2\) मान ० देखि १ सम्म हुन्छ। १ को नजिकको \(R^2\) मानले मोडेलले निर्भर चरमा रहेको धेरैजसो परिवर्तनशीलतालाई व्याख्या गर्न सक्छ भन्ने संकेत गर्छ।

पढ्नुहोस्  तथ्याङ्कमा मान ह्विटनी परीक्षण

प्रोग्रामिङ भाषामा कार्यान्वयन

साधारण रेखीय प्रतिगमन कार्यान्वयन गर्न, हामी विभिन्न तथ्याङ्कीय सफ्टवेयर वा प्रोग्रामिङ भाषाहरू प्रयोग गर्न सक्छौं। तल `scikit-learn` पुस्तकालय प्रयोग गरेर पाइथनमा कार्यान्वयनको उदाहरण दिइएको छ:

'' अजगर
np को रूपमा numpy आयात गर्नुहोस्
matplotlib.pyplot लाई plt को रूपमा आयात गर्नुहोस्
sklearn.linear_model आयात LinearRegression बाट
sklearn.metrics आयात mean_squared_error, r2_score बाट

तथ्याङ्क
X = np.array([[1], [2], [3], [4], [5]]).astype(np.float64)
y = np.array([१.५, ३.६, ३.५, २.९, ५.५]).astype(np.float64)

मोडेल
मोडेल = रेखीय रिग्रेसन()
मोडेल.फिट(X, y)

भविष्यवाणी
y_pred = मोडेल.predict(X)

गुणांक
बिटा_० = मोडेल.इन्टरसेप्ट_
बिटा_१ = मोडेल.कोफ_[०]

प्रिन्ट(f'अवरोध: {beta_0}')
प्रिन्ट(f'ढलान: {beta_1}')
print(f'मीन स्क्वायर त्रुटि: {मीन_स्क्वायर_त्रुटि(y, y_pred)}')
print(f'निर्धारणको गुणांक (R^2): {r2_score(y, y_pred)}')

डेटा प्लट र रिग्रेसन लाइन
plt.scatter(X, y, रङ = 'नीलो')
plt.plot(X, y_pred, रङ = 'रातो')
plt.xlabel('X')
plt.ylabel('Y')
plt.show() लाई
"'

माथिको उदाहरणमा, हामी पहिले आवश्यक पुस्तकालयहरू आयात गर्छौं, डेटा \(X\) र \(Y\) परिभाषित गर्छौं, र त्यसपछि डेटामा मोडेल फिट गर्न `scikit-learn` बाट `LinearRegression` वस्तु प्रयोग गर्छौं। मोडेल फिट भएपछि, हामी भविष्यवाणी गर्छौं र गुणांकहरू गणना गर्छौं, साथै औसत वर्ग त्रुटि र निर्धारणको गुणांक पनि। अन्तमा, हामी डेटा र प्रतिगमन रेखा प्लट गर्छौं।

केसिम्पुलन

साधारण रेखीय प्रतिगमन दुई मात्रात्मक चरहरू बीचको सम्बन्ध व्याख्या गर्न प्रयोग गरिने एक शक्तिशाली सांख्यिकीय विश्लेषण उपकरण हो। रेखीयता, स्वतन्त्रता, समलैंगिकता र सामान्यताको बारेमा केही आधारभूत धारणाहरूको साथ, हामी स्वतन्त्र चरहरूको मानहरूको आधारमा निर्भर चरको मान भविष्यवाणी गर्न सक्छौं। Least Squares विधिले प्रतिगमन रेखा फिट गर्न र इष्टतम प्यारामिटरहरू निर्धारण गर्न प्रभावकारी तरिका प्रदान गर्दछ। निर्धारण गुणांक (R2) मार्फत मोडेल मूल्याङ्कनले हाम्रो मोडेलले कति राम्रो प्रदर्शन गर्छ भन्ने बारे अन्तर्दृष्टि प्रदान गर्दछ।

यद्यपि साधारण रेखीय प्रतिगमनमा सीमितताहरू छन्, जस्तै केवल दुई चरहरू ह्यान्डल गर्न सक्षम हुनु र पूरा गर्नुपर्ने धारणाहरू, यो प्रविधि तथ्याङ्क र डेटा विश्लेषणमा एक महत्त्वपूर्ण आधार बनेको छ, र प्रायः थप जटिल विधिहरूमा जानु अघि चरहरू बीचको सम्बन्ध बुझ्नको लागि पहिलो चरणको रूपमा प्रयोग गरिन्छ।

टिप्पणी छोड्नुहोस्