सांख्यिकी में रैखिक प्रतिगमन

सांख्यिकी में रैखिक प्रतिगमन

रैखिक प्रतिगमन डेटा विश्लेषण में सबसे मूलभूत और व्यापक रूप से उपयोग की जाने वाली सांख्यिकीय तकनीकों में से एक है। यह हमें स्वतंत्र (या भविष्यसूचक) और आश्रित (या प्रतिक्रिया) चरों के बीच संबंध को समझने और उसका प्रतिरूप बनाने में मदद करता है। रैखिक प्रतिगमन अपनी सरलता और सुगमता के कारण अर्थशास्त्र, जीव विज्ञान, इंजीनियरिंग, सामाजिक विज्ञान आदि विभिन्न क्षेत्रों में लोकप्रिय है।

लीनियर रिग्रेशन का परिचय

लीनियर रिग्रेशन का उद्देश्य दो या दो से अधिक चरों के बीच रैखिक संबंध ज्ञात करना है। इसके सरलतम रूप—सरल लीनियर रिग्रेशन—में हम एक स्वतंत्र चर और एक आश्रित चर के बीच के संबंध को एक सीधी रेखा के रूप में प्रतिरूपित करते हैं। सरल लीनियर रिग्रेशन का मूल गणितीय समीकरण इस प्रकार है:

[ Y = β_0 + β_1X + Ωepsilon \]

कहाँ:
– Y आश्रित या प्रतिक्रिया चर है।
– $X$ स्वतंत्र या भविष्यसूचक चर है।
– $β_0$$ अवरोधन बिंदु है (वह बिंदु जहां प्रतिगमन रेखा वाई-अक्ष को काटती है)।
– $β_1$$ प्रतिगमन रेखा का ढलान (झुकाव) है।
– \$ \epsilon \$$ त्रुटि (अवशेष) है जो सर्वोत्तम फिट रेखा से डेटा के विचलन का वर्णन करती है।

मल्टीपल लीनियर रिग्रेशन में, हम इस अवधारणा को एक से अधिक स्वतंत्र चर को संभालने के लिए विस्तारित करते हैं, जैसा कि नीचे दिया गया है:

[ Y = β_0 + β_1X_1 + β_2X_2 + … + β_nX_n + Ωpsilon \]

यहां, $X_1, X_2, …, X_n$$ स्वतंत्र चर हैं, और $beta_1, beta_2, …, beta_n$$ प्रतिगमन गुणांक हैं जो आश्रित चर पर प्रत्येक स्वतंत्र चर के प्रभाव को मापते हैं।

पैरामीटर अनुमान

लीनियर रिग्रेशन में पैरामीटर का अनुमान आमतौर पर ऑर्डिनरी लीस्ट स्क्वेयर्स (ओएलएस) विधि का उपयोग करके लगाया जाता है। यह विधि अनुमानित और वास्तविक मानों के बीच अंतर के वर्गों के योग को न्यूनतम करती है। गणितीय रूप से, ओएलएस विधि उन गुणांकों को ज्ञात करती है जो निम्नलिखित फ़ंक्शन को न्यूनतम करते हैं:

\[ \sum_{i=1}^{n} (Y_i – (\beta_0 + \beta_1X_{i1} + \beta_2X_{i2} + … + \beta_nX_{in}))^2 \]

यह न्यूनीकरण प्रक्रिया उन गुणांकों को उत्पन्न करती है जो उपलब्ध डेटा के लिए सबसे उपयुक्त होते हैं, जिससे एक प्रतिगमन रेखा प्राप्त होती है जो कुल वर्ग त्रुटि को न्यूनतम करती है।

रेखीय प्रतिगमन की मान्यताएँ

परिणामों के उचित उपयोग और विश्वसनीयता के लिए, रैखिक प्रतिगमन की कई मान्यताएँ हैं जिन्हें पूरा किया जाना चाहिए:
1. रैखिकता: स्वतंत्र और आश्रित चरों के बीच संबंध रैखिक होता है।
2. स्वतंत्रता: अवशिष्ट (त्रुटियाँ) एक दूसरे से स्वतंत्र हैं।
3. समरूपता: स्वतंत्र चर के सभी मानों के लिए अवशिष्ट विचरण स्थिर रहता है।
4. सामान्यता: अवशिष्ट सामान्य वितरण का पालन करते हैं।

यदि इन मान्यताओं का उल्लंघन होता है, तो प्रतिगमन परिणाम अमान्य और भ्रामक हो सकते हैं। इसलिए, निष्कर्ष निकालने से पहले प्रतिगमन निदान के माध्यम से इन मान्यताओं को सत्यापित करना महत्वपूर्ण है।

उपयोग और अनुप्रयोग

सरलता और बहुमुखी प्रतिभा के कारण लीनियर रिग्रेशन का व्यापक रूप से उपयोग किया जाता है। विभिन्न क्षेत्रों में इसके अनुप्रयोगों के कुछ उदाहरण यहाँ दिए गए हैं:
1. अर्थशास्त्र: वस्तुओं की कीमत को उत्पादन लागत, बाजार मांग और अन्य कारकों से जोड़ना।
2. वित्त: जोखिम या आर्थिक कारकों के आधार पर स्टॉक रिटर्न का मॉडलिंग करना।
3. जीवविज्ञान: यह किसी विशेष दवा की खुराक और उसकी प्रभावशीलता के स्तर के बीच संबंध का अध्ययन करता है।
4. सामाजिक: शिक्षा और आय के बीच संबंध का विश्लेषण करना।

इसके अतिरिक्त, रैखिक प्रतिगमन का उपयोग अक्सर डेटा पूर्वानुमान या भविष्यवाणी में किया जाता है। ऐतिहासिक डेटा में रुझानों का विश्लेषण करके, रैखिक प्रतिगमन का उपयोग भविष्य के मूल्यों की भविष्यवाणी करने के लिए किया जा सकता है।

मॉडल मूल्यांकन

लीनियर रिग्रेशन मॉडल का मूल्यांकन यह सुनिश्चित करने के लिए किया जाता है कि मॉडल पर्याप्त है और डेटा को पर्याप्त रूप से समझाता है। इस मॉडल मूल्यांकन में अक्सर कई मापदंडों का उपयोग किया जाता है, जिनमें शामिल हैं:
– आर-स्क्वायर (R²): यह आश्रित चर में कुल परिवर्तनशीलता के उस अनुपात को मापता है जिसे प्रतिगमन मॉडल द्वारा समझाया गया है। R² का मान 0 और 1 के बीच होता है, जिसमें उच्च मान एक बेहतर मॉडल को दर्शाता है।
– समायोजित आर-स्क्वेर्ड: उपयोग किए गए स्वतंत्र चरों की संख्या के आधार पर आर-स्क्वेर्ड को सही करता है, एफ-सांख्यिकी का उपयोग अक्सर मॉडल की समग्र सार्थकता निर्धारित करने के लिए किया जाता है।
– माध्य वर्ग त्रुटि (एमएसई): वास्तविक और अनुमानित मानों के बीच वर्ग अंतर का औसत।

निदान और सत्यापन

किसी रिग्रेशन मॉडल का उपयोग भविष्यवाणी या आगे के निर्णय लेने के लिए करने से पहले, रिग्रेशन डायग्नोस्टिक्स करना महत्वपूर्ण है। कुछ सामान्य डायग्नोस्टिक तकनीकें इस प्रकार हैं:
1. अवशिष्ट प्लॉट: रैखिकता और समरूपता का आकलन करें।
2. QQ प्लॉट: अवशिष्टों की सामान्यता का मूल्यांकन करें।
3. डरबिन-वॉटसन परीक्षण: अवशिष्ट स्वसहसंबंध का परीक्षण करता है।
4. विचरण मुद्रास्फीति कारक (वीआईएफ): स्वतंत्र चरों के बीच बहुसंरेखता की पहचान करना।

इन डायग्नोस्टिक्स के उपयोग से संभावित समस्याओं की पहचान करने में मदद मिलती है और उपयोगकर्ताओं को आवश्यक समायोजन या डेटा रूपांतरण करने की अनुमति मिलती है।

समस्याएं और सीमाएं

लीनियर रिग्रेशन एक शक्तिशाली उपकरण होने के बावजूद, इसकी कुछ सीमाएँ भी हैं। कुछ सामान्य सीमाएँ इस प्रकार हैं:
– बहुसंरेखता: यह तब होती है जब स्वतंत्र चर एक दूसरे के साथ अत्यधिक सहसंबंधित होते हैं। इससे गुणांक अनुमानों में अस्थिरता और व्याख्याओं में भ्रम उत्पन्न हो सकता है।
– आउटलायर्स: अत्यधिक डेटा मान प्रतिगमन परिणामों को विकृत कर सकते हैं।
– गैर-रैखिकता: यदि चरों के बीच संबंध गैर-रैखिक है, तो रैखिक प्रतिगमन कम उपयुक्त हो सकता है। कुछ मामलों में गैर-रैखिक मॉडल अधिक उपयुक्त हो सकता है।
– विषमत्वमापन: अवशिष्ट परिवर्तनशीलता में परिवर्तन से गुणांक अनुमान अप्रभावी हो सकते हैं।

निष्कर्ष

डेटा विश्लेषण में रैखिक प्रतिगमन एक महत्वपूर्ण सांख्यिकीय तकनीक है। रैखिक प्रतिगमन का उपयोग करके, हम एक या अधिक स्वतंत्र चर और एक आश्रित चर के बीच संबंध को समझ सकते हैं और उसका प्रतिरूप बना सकते हैं। यद्यपि रैखिक प्रतिगमन एक सरल और आसानी से समझने योग्य उपकरण है, फिर भी वैध परिणामों को सुनिश्चित करने के लिए अंतर्निहित मान्यताओं की जाँच करना और प्रतिगमन निदान करना महत्वपूर्ण है। कुछ सीमाओं के बावजूद, सही दृष्टिकोण और समायोजन के साथ, रैखिक प्रतिगमन विभिन्न क्षेत्रों में कई व्यावहारिक अनुप्रयोगों में एक बहुत ही उपयोगी विधि बनी हुई है।

एक टिप्पणी छोड़ें

यह साइट स्पैम को कम करने के लिए Akismet का उपयोग करती है। जानें कि आपके कमेंट डेटा को कैसे प्रोसेस किया जाता है।