डेटा को वर्ग अंतरालों में कैसे समूहित करें

डेटा को वर्ग अंतरालों में कैसे समूहित करें

डेटा को वर्ग अंतरालों में समूहित करना वर्णनात्मक सांख्यिकी का एक महत्वपूर्ण चरण है। इसका उद्देश्य बड़ी मात्रा में कच्चे डेटा को सरल बनाना है ताकि इसे पढ़ना, विश्लेषण करना और आवृत्ति वितरण तालिकाओं या हिस्टोग्राम में प्रस्तुत करना आसान हो जाए। जब ​​डेटा बहुत विविध और बिखरा हुआ होता है, तो पैटर्न को पहचानना अक्सर मुश्किल होता है। वर्ग अंतराल डेटा को विशिष्ट मान समूहों में व्यवस्थित करते हैं, जिससे हमें डेटा वितरण, सबसे अधिक बार आने वाले मानों और यहां तक ​​कि केंद्रीय प्रवृत्ति को भी अधिक स्पष्ट रूप से समझने में मदद मिलती है।

इस लेख में वर्ग अंतरालों के अर्थ, उनकी आवश्यकता कब होती है, साथ ही अनुप्रयोग उदाहरणों सहित डेटा को वर्ग अंतरालों में समूहित करने के व्यावहारिक चरणों पर चर्चा की गई है।

1. वर्ग अंतरालों को समझना

एक वर्ग अंतराल आवृत्ति वितरण में डेटा को समूहित करने के लिए उपयोग की जाने वाली मानों की एक सीमा है। प्रत्येक अंतराल की आमतौर पर एक निचली और एक ऊपरी सीमा होती है। उदाहरण के लिए, अंतराल 10-19 यह दर्शाता है कि 10 और 19 के बीच के मानों वाला सभी डेटा उस वर्ग में आता है।

आवृत्ति वितरण सारणी में, वर्ग अंतराल समान मानों के लिए "कंटेनर" का काम करते हैं। इससे डेटा अलग-अलग मानों को सूचीबद्ध करने की तुलना में अधिक संक्षिप्त हो जाता है। वर्ग अंतराल हिस्टोग्राम और आवृत्ति बहुभुज जैसे ग्राफ़ बनाने का आधार भी बनते हैं।

2. डेटा को समूहीकृत करने की आवश्यकता कब होती है?

सभी डेटा को वर्ग अंतरालों में विभाजित करना आवश्यक नहीं है। समूहीकरण आमतौर पर तब आवश्यक होता है जब:

1. बड़ी मात्रा में डेटा, उदाहरण के लिए 30 या 50 से अधिक अवलोकन।
2. डेटा रेंज विस्तृत है, इसलिए मान बिखरे हुए हैं और उन्हें पढ़ना मुश्किल है।
3. हम वितरण पैटर्न देखना चाहते हैं, उदाहरण के लिए यह पता लगाने के लिए कि डेटा सामान्य है, तिरछा है, या उसमें दोहरे शिखर हैं।
4. डेटा को हिस्टोग्राम के रूप में प्रस्तुत किया जाएगा, क्योंकि हिस्टोग्राम के लिए अंतराल वर्गों की आवश्यकता होती है।

यदि डेटा कम है (उदाहरण के लिए 10 मान), तो अक्सर अंतराल के बिना एक ही आवृत्ति तालिका पर्याप्त होती है।

3. डेटा को वर्ग अंतरालों में समूहित करने के चरण

वर्ग अंतराल बनाने के लिए सबसे अधिक उपयोग किए जाने वाले चरण निम्नलिखित हैं।

चरण 1: न्यूनतम और अधिकतम डेटा निर्धारित करें

सबसे पहले, डेटा के सबसे छोटे (न्यूनतम) और सबसे बड़े (अधिकतम) मानों की पहचान करें।

– न्यूनतम मान = \( x_{\min} \)
– अधिकतम मान = \( x_{\max} \)

इस मान का उपयोग डेटा की सीमा की गणना करने के लिए किया जाएगा।

चरण 2: रेंज की गणना करें

रेंज अधिकतम और न्यूनतम मानों के बीच का अंतर है:

\[
R = x_{\max} – x_{\min}
\]

रेंज से डेटा वितरण की चौड़ाई का अंदाजा मिलता है।

चरण 3: कक्षाओं की संख्या (k) निर्धारित करें

कक्षाओं की संख्या कई तरीकों से निर्धारित की जा सकती है। सबसे लोकप्रिय तरीका स्टर्जेस के नियम का उपयोग करना है:

\[
k = 1 + 3{,}3 \log_{10}(n)
\]

जहां \( n \) डेटा की मात्रा है।

गणना के परिणामों को आमतौर पर निकटतम पूर्ण संख्या (या उससे अधिक) तक पूर्णांकित किया जाता है ताकि कक्षाओं की संख्या बहुत कम न हो।

स्टर्जेस के अलावा, एक आम तरीका यह है कि आप अपनी डिस्प्ले आवश्यकताओं और सैंपल साइज़ के आधार पर 5 से 12 के बीच क्लास साइज़ चुनें। हालांकि, स्टर्जेस छोटे डेटा सेट के लिए काफी अच्छा है।

चरण 4: क्लास की चौड़ाई की गणना करें (i)

वर्ग अंतराल की लंबाई वर्ग चौड़ाई होती है। इसका सूत्र है:

\[
i = \frac{R}{k}
\]

क्योंकि क्लास की चौड़ाई का उपयोग आसान होना चाहिए, इसलिए उन्हें आमतौर पर एक सरल संख्या (जैसे, डेटा के संदर्भ के आधार पर 5, 10, 2, या 0,5) में राउंड ऑफ किया जाता है। यह राउंडिंग इसलिए महत्वपूर्ण है ताकि अंतराल आसानी से पढ़े जा सकें और भ्रम से बचा जा सके।

यदि राउंडिंग के परिणामों के कारण सभी डेटा को समायोजित करना संभव न हो, तो क्लास की चौड़ाई को थोड़ा बढ़ाया जा सकता है।

चरण 5: वर्ग सीमाओं का निर्धारण करें

सबसे पहले न्यूनतम मान को प्रथम श्रेणी की निचली सीमा मानकर शुरुआत करें। फिर अधिकतम मान को समाहित करने तक क्रमिक अंतराल बनाएं।

उदाहरण के लिए, यदि न्यूनतम मान 32 है और क्लास की चौड़ाई 5 है, तो क्लास बनाई जा सकती है:

- 32-36
- 37-41
- 42-46
- वगैरह।

महत्वपूर्ण: सुनिश्चित करें कि कक्षाओं के बीच कोई अंतराल या अतिक्रम न हो। सभी डेटा मान ठीक एक ही कक्षा में आने चाहिए।

चरण 6: (वैकल्पिक) क्लास बाउंड्री बनाएं

यदि डेटा पूर्णांक हैं (जैसे, परीक्षा अंक), तो वर्ग को सतत बनाने के लिए अक्सर वर्ग सीमाएँ बनाई जाती हैं। यह ऊपरी सीमा में 0,5 जोड़कर और निचली सीमा से 0,5 घटाकर किया जाता है।

उदाहरण के लिए, वर्ग 32-36 के लिए, वर्ग सीमा इस प्रकार हो जाती है:
- 31,5-36,5

यह हिस्टोग्राम के लिए उपयोगी है ताकि बार बिना किसी अंतराल के आपस में जुड़ सकें।

चरण 7: प्रत्येक वर्ग की आवृत्ति की गणना करें

एक बार वर्ग अंतराल निर्धारित हो जाने के बाद, गिनें कि प्रत्येक अंतराल में कितने डेटा बिंदु आते हैं। परिणाम आवृत्ति कॉलम (f) में लिखे जाते हैं।

बड़े डेटा के लिए, तेजी से काम करने और त्रुटियों को कम करने के लिए टैली विधि का उपयोग करें।

चरण 8: आवृत्ति वितरण सारणी बनाएं

न्यूनतम आवृत्ति वितरण तालिका में निम्नलिखित शामिल हैं:

- कक्षा अन्तराल
आवृत्ति (एफ)

आप इसमें अन्य कॉलम भी जोड़ सकते हैं, जैसे:

– वर्ग (xi) का मध्यबिंदु
– संचयी आवृत्ति
– सापेक्ष आवृत्ति (प्रतिशत)

4. डेटा समूहीकरण का उदाहरण

उदाहरण के लिए, 40 छात्रों के परीक्षा अंकों का डेटा उपलब्ध है, जिसमें न्यूनतम अंक 42 और अधिकतम अंक 94 हैं।

1. न्यूनतम = 42, अधिकतम = 94
2. रेंज:
\[
R = 94 – 42 = 52
\]
3. कक्षाओं की संख्या (स्टर्जेस):
\[
k = 1 + 3{,}3 \log(40)
लगभग 1 + 3{,}3(1{,}602)
लगभग 6,29
\]
कुल मिलाकर 6 या 7 कक्षाएं हैं। हमने अधिक जानकारी के लिए 7 कक्षाएं चुनी हैं।
4. क्लास की चौड़ाई:
\[
i = \frac{52}{7} \approx 7{,}43
\]
8 तक पूर्णांकित।
5. 42 से शुरू होने वाले अंतराल बनाएं जिनकी चौड़ाई 8 हो:
- 42-49
- 50-57
- 58-65
- 66-73
- 74-81
- 82-89
- 90-97

अंतिम अंतराल 97 तक पहुंच गया, इसलिए 94 का अधिकतम मान अभी भी समायोजित किया जा सकता था।

6. इसके बाद, डेटा के आधार पर प्रत्येक अंतराल की आवृत्ति की गणना करें (उदाहरण के लिए, एक रेखा का उपयोग करके)। अंतिम तालिका यह दर्शाएगी कि कितने छात्र अंकों की एक निश्चित सीमा के अंतर्गत आते हैं, जिससे हमें प्रदर्शन का त्वरित मूल्यांकन करने में सहायता मिलेगी।

5. कक्षा अंतराल को अधिक प्रभावी बनाने के लिए सुझाव

1. तालिकाओं की तुलना को आसान बनाने के लिए एकसमान क्लास चौड़ाई का उपयोग करें।
2. बहुत अधिक कक्षाएं न रखें, क्योंकि इससे तालिका लंबी और पढ़ने में मुश्किल हो जाएगी।
3. कक्षाओं की संख्या बहुत कम न रखें, क्योंकि इससे महत्वपूर्ण जानकारी "खो" सकती है और वितरण बहुत अनियमित लग सकता है।
4. डेटा के संदर्भ के अनुसार वर्ग की चौड़ाई को राउंड करें। तापमान के लिए, 1 या 0,5 उपयुक्त हो सकता है; परीक्षा अंकों के लिए, आमतौर पर 5 या 10 उपयुक्त होता है।
5. यह सुनिश्चित करने के लिए क्लास की सीमाओं की दोबारा जांच करें कि सभी डेटा बिना किसी छूटे हुए मान के दर्ज किया गया है।

निष्कर्ष

डेटा को वर्ग अंतरालों में समूहित करना डेटा को सरल बनाने और वितरण को स्पष्ट रूप से प्रदर्शित करने की एक महत्वपूर्ण तकनीक है। इसमें न्यूनतम और अधिकतम मानों का निर्धारण, परास की गणना, वर्गों की संख्या का निर्धारण (अक्सर स्टर्जेस के नियम का उपयोग करके), वर्ग चौड़ाई की गणना, अंतरालों का निर्माण और फिर प्रत्येक वर्ग की आवृत्ति की गणना शामिल है। सही वर्ग अंतरालों के साथ, जटिल कच्चे डेटा को तालिकाओं या ग्राफ़ में आसानी से समझने योग्य जानकारी में परिवर्तित किया जा सकता है।

यदि आप चाहें, तो मैं कच्चे डेटा (मानों की सूची) के साथ एक पूर्ण उदाहरण भी बना सकता हूं और फिर हिस्टोग्राम के साथ एक आवृत्ति वितरण तालिका संकलित कर सकता हूं।

एक टिप्पणी छोड़ें