फैलावटका उपायहरू: डेटामा परिवर्तनशीलता बुझ्ने
तथ्याङ्क र डेटा विश्लेषणमा, सही र सान्दर्भिक निष्कर्षहरू बनाउनको लागि डेटाको वितरण र भिन्नता बुझ्नु महत्त्वपूर्ण छ। डेटामा भिन्नतालाई वर्णन गर्न प्रयोग गरिने एउटा प्रमुख अवधारणा "विसारको मापन" हो। यस लेखले फैलावटका विभिन्न मापनहरू, तिनीहरू किन महत्त्वपूर्ण छन्, तिनीहरूलाई कसरी गणना गर्ने, र डेटा विश्लेषणको सन्दर्भमा तिनीहरूको व्याख्याको बारेमा छलफल गर्नेछ।
फैलावटको मापन के हो?
फैलावटका मापनहरू भनेको सेटमा रहेको डेटा केन्द्रीय मानबाट कति हदसम्म फैलिएको वा फैलिएको छ भनेर वर्णन गर्न प्रयोग गरिने मेट्रिक्स हुन्। यो केन्द्रीय मान सामान्यतया मध्य वा मध्य जस्ता केन्द्रीय प्रवृत्तिका मापनहरू प्रयोग गरेर मापन गरिन्छ। फैलावटका मापनहरूले डेटाको दायरा, भिन्नता र स्थिरतामा अन्तर्दृष्टि प्रदान गर्दछ।
स्प्रेड साइज किन महत्त्वपूर्ण छ?
१. परिवर्तनशीलता बुझ्ने:
परिवर्तनशीलता कुनै पनि डेटाको अभिन्न अंग हो। डेटा कति फरक हुन्छ भनेर बुझेर, हामी त्यो डेटाको अन्तर्निहित गतिशीलता बुझ्न सक्छौं।
२. बाहिरी पक्षहरू पहिचान गर्नुहोस्:
डेटा वितरणले आउटलियरहरू (बाँकी डेटाबाट टाढा रहेका चरम मानहरू) पहिचान गर्न मद्दत गर्न सक्छ, जुन थप विश्लेषणको लागि महत्त्वपूर्ण हुन सक्छ वा त्रुटि डेटा हुन सक्छ।
३. डेटासेट तुलना:
फैलावटको मापनले दुई वा बढी डेटा सेटहरू बीच तुलना गर्न अनुमति दिन्छ। उदाहरणका लागि, दुई डेटा सेटहरूमा समान औसत तर फरक भिन्नता वा फैलावट हुन सक्छ।
४. अनुमानित तथ्याङ्क:
धेरै अनुमानित सांख्यिकीय विधिहरूलाई वैध र महत्त्वपूर्ण निष्कर्ष निकाल्न डेटाको वितरणको राम्रो बुझाइ आवश्यक पर्दछ।
स्प्रेड साइजका प्रकारहरू
तथ्याङ्कीय डेटा विश्लेषणमा सामान्यतया प्रयोग हुने फैलावटका धेरै उपायहरू छन्:
१. दायरा
दायरा फैलावटको सबैभन्दा सरल मापन हो र यसलाई डेटा सेटमा अधिकतम र न्यूनतम मानहरू बीचको भिन्नताको रूपमा गणना गरिन्छ।
\[ \text{दायरा} = \text{अधिकतम मान} – \text{न्यूनतम मान} \]
गणना गर्न सजिलो भए तापनि, दायराले दुई डेटा बिन्दुहरूलाई मात्र विचार गर्छ र न्यूनतम र अधिकतम मानहरू बीच डेटाको वितरणलाई प्रतिबिम्बित गर्दैन।
४. इन्टरक्वार्टाइल रेन्ज (IQR)
IQR दायरा भन्दा फैलावटको बढी बलियो मापन हो किनभने यो आउटलियरहरूबाट प्रभावित हुँदैन। यसले ७५ औं प्रतिशतक (Q3) बाट २५ औं प्रतिशतक (Q1) घटाएर डेटाको मध्य दायरा गणना गर्दछ।
\[ \text{IQR} = Q3 – Q1 \]
औसतमा ध्यान केन्द्रित गरेर, IQR ले अन्तर्निहित डेटाको वितरणको राम्रो तस्वीर प्रदान गर्दछ।
२. भिन्नता
भिन्नताले डेटा सेटमा रहेको प्रत्येक मान औसतबाट कति टाढा छ भनेर मापन गर्छ। यो प्रत्येक मानको औसतबाट भिन्नताहरूको वर्गहरू योग गरेर, त्यसपछि डेटा तत्वहरूको संख्या (जनसंख्याको लागि) वा तत्वहरूको संख्या घटाएर एक (नमूनाको लागि) ले भाग गरेर गणना गरिन्छ।
जनसंख्याको लागि (\(\sigma^2\)):
\[ \सिग्मा^२ = \फ्राक{\योगफल (X_i – \mu)^२}{N} \]
नमूनाको लागि (\(s^2\)):
\[ s^2 = \frac{\योगफल (X_i – \ओभरलाइन{X})^2}{n-1} \]
भिन्नताले डेटाको स्थिरताको बारेमा जानकारी प्रदान गर्दछ; यद्यपि, भिन्नताले वर्ग एकाइहरू प्रयोग गर्ने भएकोले, यसलाई प्रत्यक्ष रूपमा व्याख्या गर्न गाह्रो हुन सक्छ।
४. मानक विचलन
मानक विचलन भिन्नताको वर्गमूल हो र मूल डेटा जस्तै एकाइहरूमा हुन्छ, जसले गर्दा यसलाई व्याख्या गर्न सजिलो हुन्छ।
जनसंख्याको लागि (\(\सिग्मा\)):
\[ \सिग्मा = \sqrt{\सिग्मा^2} = \sqrt{\frac{\योगफल (X_i – \mu)^2}{N}} \]
नमुनाको लागि (\(s\)):
\[ s = \sqrt{s^2} = \sqrt{\frac{\योगफल (X_i – \ओभरलाइन{X})^2}{n-1}} \]
मानक विचलन फैलावटको सबैभन्दा सामान्य रूपमा प्रयोग हुने उपायहरू मध्ये एक हो किनभने यो व्याख्या गर्न सजिलो छ र विभिन्न सांख्यिकीय विश्लेषणहरूमा बारम्बार प्रयोग गरिन्छ।
५. भिन्नताको गुणांक (CV)
CV भनेको मानक विचलनको औसत अनुपातको रूपमा व्यक्त गरिएको र प्रायः प्रतिशतको रूपमा व्यक्त गरिएको सापेक्षिक फैलावटको मापन हो।
\[ \पाठ{CV} = \frac{s}{\ओभरलाइन{X}} \गुणा १००% \]
विभिन्न माध्यमहरू प्रयोग गरेर डेटा सेटहरू बीचको परिवर्तनशीलता तुलना गर्न CV धेरै उपयोगी छ।
कसरी गणना र व्याख्या गर्ने
कोन्तोह पेरहिटुङ्गन
निम्न डेटा उदाहरणको साथ चित्रण गरौं:
\[ \{१५, २०, २५, ३५, ४५, ५५, ६५, ७५, ८५, ९५\} \]
१. दायरा:
\[ \text{दायरा} = ९५ – १५ = ८० \]
२. इन्टरक्वार्टाइल रेन्ज (IQR):
डेटा क्रमबद्ध गरेपछि, हामी Q1 र Q3 चतुर्थकहरू फेला पार्न सक्छौं। यस अवस्थामा, Q1 २५ हो र Q3 ७५ हो।
\[ \text{IQR} = ७५ – २५ = ५० \]
१. भिन्नता र मानक विचलन:
डेटाको माध्य (\(\overline{X}\)) ५१.५ छ। त्यसपछि हामी भिन्नता र मानक विचलन गणना गर्छौं।
\[ \text{भिन्नता (s^2)} = \frac{1}{n-1} \योगफल (X_i – \ओभरलाइन{X})^2 = 816.11 \]
\[ \text{मानक विचलन (हरू)} = \sqrt{816.11} = 28.57 \]
४. भिन्नताको गुणांक (CV):
\[ \पाठ{CV} = \frac{28.57}{51.5} \गुणा १००% \लगभग ५५.४८% \]
यहाँबाट, हामी व्याख्या गर्न सक्छौं कि मानक विचलन २८.५७ हो, जबकि CV ले देखाउँछ कि मानक विचलन मूल डेटाको औसतको लगभग ५५.४८% हो।
केसिम्पुलन
फैलावटका मापनहरू तथ्याङ्कीय डेटा विश्लेषणका आवश्यक घटकहरू हुन् किनभने तिनीहरूले केन्द्रीय मान वरिपरि डेटाको परिवर्तनशीलता र प्रसारमा अन्तर्दृष्टि प्रदान गर्छन्। फैलावटका सामान्यतया प्रयोग हुने मापनहरूमा दायरा, अन्तरचतुर्थक दायरा, भिन्नता, मानक विचलन, र भिन्नताको गुणांक समावेश छन्। यी प्रत्येक मापनका विशिष्ट प्रयोगहरू छन् र डेटाको सन्दर्भ र विश्लेषणको उद्देश्यमा निर्भर गर्दै बहुमूल्य अन्तर्दृष्टि प्रदान गर्न सक्छन्। फैलावटका मापनहरूलाई उचित रूपमा बुझेर र प्रयोग गरेर, हामी विभिन्न अनुसन्धान क्षेत्रहरू र डेटा विज्ञान अनुप्रयोगहरूमा थप सूचित र सही निर्णयहरू गर्न सक्छौं।