निर्धारण गुणांक पर चर्चा के लिए एक प्रश्न का उदाहरण
निर्धारण गुणांक (R²) प्रतिगमन विश्लेषण में एक महत्वपूर्ण पैरामीटर है, जो यह दर्शाता है कि प्रतिगमन मॉडल डेटा की वास्तविक परिवर्तनशीलता को कितनी अच्छी तरह से समझाता है। इस लेख में, हम एक विस्तृत उदाहरण और चर्चा के माध्यम से निर्धारण गुणांक की अवधारणा को समझाएंगे।
निर्धारण गुणांक की मूल अवधारणा
निर्धारण गुणांक या \( R^2 \) को 0 से 1 के पैमाने पर मापा जाता है, जहाँ:
– \( R^2 = 0 \) यह दर्शाता है कि प्रतिगमन मॉडल डेटा की परिवर्तनशीलता को बिल्कुल भी स्पष्ट करने में सक्षम नहीं है।
– \( R^2 = 1 \) दर्शाता है कि प्रतिगमन मॉडल डेटा की सभी परिवर्तनशीलता को पूरी तरह से समझाने में सक्षम है।
निर्धारण गुणांक की गणना करने का मूल सूत्र इस प्रकार है:
[ R^2 = 1 – SSR{SST} \]
कहाँ:
– एसएसआर (स्क्वायर्ड रेसिडुअल्स का योग) मॉडल द्वारा अनुमानित मूल्यों और वास्तविक मूल्यों के बीच के अंतर के वर्गों का योग है।
– एसएसटी (वर्गों का कुल योग) वास्तविक मूल्य और वास्तविक मूल्यों के औसत के बीच के अंतरों के वर्गों के योग का योग है।
समस्याओं का उदाहरण
आइए, निर्धारण गुणांक की गणना को और अधिक गहराई से समझने के लिए एक उदाहरण समस्या पर चर्चा करें।
समस्या का उदाहरण:
मान लीजिए हमारे पास 10 छात्रों के अध्ययन के घंटों (X) और परीक्षा अंकों (Y) से संबंधित डेटा है:
| विद्यार्थी | अध्ययन के घंटे (X) | परीक्षा अंक (Y) |
|——-|——————–|——————–|
| 1 | 2 | 58 |
| 2 | 3 | 64 |
| 3 | 4 | 70 |
| 4 | 5 | 85 |
| 5 | 2 | 57 |
| 6 | 3 | 68 |
| 7 | 4 | 72 |
| 8 | 5 | 90 |
| 9 | 3 | 62 |
| 10 | 4 | 78 |
हम एक सरल रैखिक प्रतिगमन मॉडल बनाएंगे जिसमें अध्ययन के घंटों (X) के आधार पर परीक्षा के अंकों (Y) का अनुमान लगाया जाएगा।
विचार-विमर्श
1. एक सरल रैखिक प्रतिगमन मॉडल का निर्माण
एक सरल रैखिक प्रतिगमन मॉडल का स्वरूप इस प्रकार है:
[ Y = a + bX \]
कहाँ:
– \( Y \) अनुमानित परीक्षा स्कोर है।
– \( X \) अध्ययन के घंटों की संख्या है।
– \( a \) अंतःखंड है (वाई अक्ष पर प्रतिच्छेदन बिंदु जब X = 0)।
– \( b \) ढलान (प्रतिगमन रेखा का झुकाव) है।
पैरामीटर \( a \) और \( b \) की गणना करने के लिए, हम निम्नलिखित सूत्र का उपयोग करते हैं:
[ b = \frac{n(\sum{XY}) – (\sum{X})(\sum{Y})}{n(\sum{X^2}) – (\sum{X})^2} \]
[ a = \frac{\sum{Y} – b(\sum{X})}{n} \]
जहां \( n \) डेटा की संख्या है (इस मामले में n = 10)।
तालिका से हम गणना कर सकते हैं:
– \(\sum{X} = 36\)
– \(\sum{Y} = 704\)
– \(\sum{X^2} = 140\)
– \(\sum{Y^2} = 50428\)
– \(\sum{XY} = 2576\)
आइए पहले b की गणना करें:
\[ b = \frac{10(2576) – (36)(704)}{10(140) – (36)^2} \]
\[ b = \frac{25760 – 25344}{1400 – 1296} \]
[ b = 416{104} \]
\[ b = 4 \]
फिर, हम a की गणना करते हैं:
[ a = \frac{704 – 4(36)}{10} \]
[ a = 704 – 144{10} \]
[ a = 560{10} \]
\[ ए = 56 \]
अतः, हमें प्राप्त होने वाला रैखिक प्रतिगमन मॉडल इस प्रकार है:
[ Y = 56 + 4X \]
2. अनुमानित मान (Y') की गणना करें।
इसके बाद, हम प्रत्येक X के लिए अनुमानित मान Y' की गणना करते हैं:
छात्र | अध्ययन के घंटे (X) | परीक्षा अंक (Y) | अनुमानित अंक (Y') |
|——-|——————–|——————–|————————-|
| 1 | 2 | 58 | \( 56 + 4(2) = 64 \) |
| 2 | 3 | 64 | \( 56 + 4(3) = 68 \) |
| 3 | 4 | 70 | \( 56 + 4(4) = 72 \) |
| 4 | 5 | 85 | \( 56 + 4(5) = 76 \) |
| 5 | 2 | 57 | \( 56 + 4(2) = 64 \) |
| 6 | 3 | 68 | \( 56 + 4(3) = 68 \) |
| 7 | 4 | 72 | \( 56 + 4(4) = 72 \) |
| 8 | 5 | 90 | \( 56 + 4(5) = 76 \) |
| 9 | 3 | 62 | \( 56 + 4(3) = 68 \) |
| 10 | 4 | 78 | \( 56 + 4(4) = 72 \) |
3. एसएसआर और एसएसटी की गणना
इसके बाद, हम SSR और SST की गणना करके \( R^2 \) प्राप्त करते हैं।
एसएसआर:
[ एसएसआर = योग{(वाई - वाई')^2} \]
[ SSR = (58 – 64)^2 + (64 – 68)^2 + (70 – 72)^2 + (85 – 76)^2 + (57 – 64)^2 + (68 – 68)^2 + (72 – 72)^2 + (90 – 76)^2 + (62 – 68)^2 + (78 – 72)^2 \]
[ एसएसआर = 36 + 16 + 4 + 81 + 49 + 0 + 0 + 196 + 36 + 36 \]
[ एसएसआर = 454 ]
एसएसटी:
\[ एसएसटी = \योग{(वाई - \बार{वाई})^2} \]
कहाँ:
[ \bar{Y} = \frac{\sum{Y}}{n} = \frac{704}{10} = 70.4 \]
[ SST = (58 – 70.4)^2 + (64 – 70.4)^2 + (70 – 70.4)^2 + (85 – 70.4)^2 + (57 – 70.4)^2 + (68 – 70.4)^2 + (72 – 70.4)^2 + (90 – 70.4)^2 + (62 – 70.4)^2 + (78 – 70.4)^2 \]
[ SST = 153.76 + 40.96 + 0.16 + 213.16 + 178.56 + 5.76 + 2.56 + 384.16 + 70.56 + 57.76 \]
[ एसएसटी = 1107.44 \]
4. निर्धारण गुणांक (R²) की गणना करना:
[ R^2 = 1 – SSR{SST} \]
[ R^2 = 1 – \frac{454}{1107.44} \]
[ R^2 = 1 – 0.41 \]
[ R^2 = 0.59 \]
निष्कर्ष
उपरोक्त गणना से हमें निर्धारण गुणांक (R² = 0.59) प्राप्त हुआ। इससे पता चलता है कि हमारे द्वारा निर्मित रैखिक प्रतिगमन मॉडल अध्ययन के घंटों के आधार पर परीक्षा अंकों में होने वाली भिन्नता के लगभग 59% की व्याख्या कर सकता है। शेष 41% भिन्नता मॉडल में शामिल न किए गए अन्य कारकों के कारण हो सकती है।
ऊपर दिए गए चरणों और गणनाओं को समझने से हम यह जान सकते हैं कि प्रतिगमन मॉडल डेटा की वास्तविक परिवर्तनशीलता को कितनी अच्छी तरह से समझाता है, इसका आकलन करने में निर्धारण गुणांक कितना महत्वपूर्ण है। यह सांख्यिकीय विश्लेषण और डेटा मॉडलिंग में एक बहुत ही उपयोगी उपकरण है।