मानक विचलन प्रयोग गरेर डेटा वितरण विश्लेषण

मानक विचलन प्रयोग गरेर डेटा वितरण विश्लेषण

तथ्याङ्कमा, डेटा सेटको "केन्द्र" बुझ्नु मात्र पर्याप्त छैन। डेटाका दुई सेटहरूको एउटै औसत हुन सक्छ, तर तिनीहरूको फैलावटको डिग्रीको कारणले तिनीहरूका विशेषताहरू उल्लेखनीय रूपमा फरक हुन्छन्। यो त्यहीं हो जहाँ डेटा फैलावटको अवधारणा महत्त्वपूर्ण हुन्छ। शिक्षा र अर्थशास्त्रदेखि स्वास्थ्य र डेटा विज्ञानसम्म विभिन्न क्षेत्रहरूमा फैलावटको सबैभन्दा लोकप्रिय, बलियो र बारम्बार प्रयोग हुने उपायहरू मध्ये एक मानक विचलन हो। यस लेखले यसको केन्द्र मानबाट डेटा कसरी फैलिएको छ भनेर विश्लेषण गर्न मानक विचलनको अवधारणा, गणना, व्याख्या र प्रयोगको बारेमा छलफल गर्दछ।

१. डेटा वितरणको विश्लेषण किन आवश्यक छ?

कल्पना गर्नुहोस् दुई कक्षाको गणित परीक्षाको औसत स्कोर ८० छ। कक्षा A मा, लगभग सबै विद्यार्थीहरूले ७८ र ८२ को बीचमा स्कोर गरे। कक्षा B मा, केही विद्यार्थीहरूले ५० र केहीले १०० स्कोर गरे। औसत समान छन्, तर दुई कक्षाको परिस्थिति स्पष्ट रूपमा फरक छ। कक्षा A ले निरन्तर प्रदर्शन देखाउँछ, जबकि कक्षा B ले उल्लेखनीय असमानता देखाउँछ।

वितरणको विश्लेषण गरेर, हामी गर्न सक्छौं:
- घटनाको स्थिरता वा भिन्नताको मूल्याङ्कन गर्नुहोस्।
- जोखिम मापन (जस्तै लगानी प्रतिफलमा भिन्नता)।
- प्रक्रिया स्थिरता (जस्तै उत्पादन गुणस्तर) तुलना गर्ने।
- सम्भावित विसंगतिहरू वा चरम डेटा पत्ता लगाउनुहोस्।

यस उद्देश्यको लागि मानक विचलन प्राथमिक उपकरण हो किनभने यसले डेटा औसतबाट कति टाढा फैलिएको छ भनेर मापन गर्दछ।

२. मानक विचलनको परिभाषा

मानक विचलन भनेको भिन्नताको वर्गमूल हो। भिन्नताले डेटा र औसत बीचको भिन्नताको वर्गहरूको औसत मापन गर्छ भने, मानक विचलनले मापनका एकाइहरूलाई तिनीहरूको मूल स्केलमा फर्काउँछ (जस्तै, परीक्षण स्कोर, किलोग्राम, रुपिया, आदि)। यसले मानक विचलनलाई व्याख्या गर्न सजिलो बनाउँछ।

सहजै:
– सानो मानक विचलन → सङ्कलन गरिएको डेटा औसतको नजिक छ (अधिक एकरूप)।
– ठूलो मानक विचलन → डेटा औसतबाट टाढा फैलिएको छ (अधिक विविध)।

पढ्नुहोस्  सबैभन्दा कम वर्ग विधि

३. मानक विचलन सूत्र: जनसंख्या बनाम नमूना

तथ्याङ्कमा, हामी जनसंख्या र नमूनाहरूको लागि मानक विचलन गणना गर्ने बीच भिन्नता छुट्याउँछौं।

क) जनसंख्या मानक विचलन (σ)
यदि विश्लेषण गरिँदै गरेको डेटा जनसंख्याका सबै सदस्यहरू हुन् भने, सूत्र यो हो:

\[
\सिग्मा = \sqrt{\frac{\योगफल (x_i – \mu)^2}{N}}
\]

जानकारी:
– \(x_i\) = i-औं डेटा मान
– \(\mu\) = जनसंख्याको औसत
– \(N\) = जनसंख्या तथ्याङ्कको संख्या

ख) नमूना मानक विचलन (हरू)
यदि विश्लेषण गरिँदै गरेको डेटा जनसंख्या (नमूना) को मात्र भाग हो भने, सूत्र यो हो:

\[
s = \sqrt{\frac{\योगफल (x_i – \bar{x})^2}{n-1}}
\]

जानकारी:
– \(\bar{x}\) = नमूना औसत
– \(n\) = नमुना डेटाको संख्या
– \(n-1\) लाई स्वतन्त्रताको डिग्री (बेसेलको सुधार) भनिन्छ, जसलाई भिन्नता/मानक विचलन अनुमान निष्पक्ष होस् भनेर प्रयोग गरिन्छ।

दैनिक अभ्यासमा, हामीसँग हुने डेटा सामान्यतया नमूनाको रूपमा हुन्छ, त्यसैले सूत्र \(n-1\) धेरै प्रयोग गरिन्छ।

४. मानक विचलन गणना गर्ने चरणहरू

प्रक्रिया बुझ्नको लागि, नमूना मानक विचलन गणना गर्ने सामान्य चरणहरू यहाँ दिइएका छन्:

१. औसत (\(\bar{x}\)) गणना गर्नुहोस्।
२. प्रत्येक डेटा र औसत (\(x_i – \bar{x}\)) बीचको भिन्नता गणना गर्नुहोस्।
३. भिन्नता \((x_i – \bar{x})^2\) को वर्ग लगाउनुहोस्।
४. सबै वर्गहरू जोड्नुहोस्।
५. नमूना भिन्नता प्राप्त गर्न \(n-1\) ले भाग गर्नुहोस्।
६. मानक विचलन (हरू) प्राप्त गर्न परिणामको वर्गमूल निकाल्नुहोस्।

सरल उदाहरण
मानौं डेटा मानहरू छन्: ७०, ७५, ८०, ८५, ९० (n = ५)

– औसत: \(\bar{x} = (७०+७५+८०+८५+९०)/५ = ८०\)
- भिन्नता: -१०, -५, ०, ५, १०
- वर्ग भिन्नता: १००, २५, ०, २५, १००
- वर्गहरूको संख्या: २५०
– नमुना भिन्नता: \(२५०/(५-१)=६२.५\)
– मानक विचलन: \(s=\sqrt{62,5}\लगभग ७.९१\)

सरल व्याख्या: मानहरू ८० को औसतबाट औसतमा लगभग ७.९१ अंकले विचलित हुन्छन्।

५. डेटा विश्लेषणमा मानक विचलनको व्याख्या

मानक विचलन एक्लै हुँदैन; यसको अर्थ सन्दर्भमा निर्भर गर्दछ। यद्यपि, केही सामान्य दिशानिर्देशहरू उपयोगी हुन सक्छन्:

पढ्नुहोस्  विज्ञानमा तथ्याङ्कको महत्त्व

- यदि मानक विचलन ० को नजिक छ भने, डेटा औसत वरिपरि अत्यधिक केन्द्रित हुन्छ।
- यदि मानक विचलन ठूलो छ भने, डेटा बढी परिवर्तनशील हुन्छ, जसले गैर-एकरूपतालाई जनाउँछ।

मानक विचलन पनि प्रायः निम्नका लागि प्रयोग गरिन्छ:
- दुई समूहहरूको तुलना गर्दै: उदाहरणका लागि एउटै औसत भएका तर फरक मानक विचलन भएका दुई वर्गहरू।
- प्रक्रिया स्थिरताको मूल्याङ्कन: उत्पादनको आकारको सानो मानक विचलनको साथ कारखाना उत्पादनको अर्थ अधिक सुसंगत गुणस्तर हो।
- अस्थिरता मापन: वित्तमा, स्टक प्रतिफलको मानक विचलन प्रायः जोखिम सूचकको रूपमा प्रयोग गरिन्छ।

६. मानक विचलन र सामान्य वितरण बीचको सम्बन्ध

सामान्य वितरण पछ्याउने डेटामा, मानक विचलनको अनुभवजन्य नियम मार्फत धेरै बलियो व्याख्या हुन्छ:

– लगभग ९९.७% डेटा \(\bar{x} \pm 1s\) दायरामा छ।
– लगभग ९९.७% डेटा \(\bar{x} \pm 2s\) दायरामा छ।
– लगभग ९९.७% डेटा \(\bar{x} \pm 3s\) दायरामा छ।

यो नियम औसत वरिपरि कति डेटा "सामान्य" छ भनेर अनुमान गर्न उपयोगी छ र चरम मानहरू पत्ता लगाउन सजिलो बनाउँछ। यद्यपि, यो याद राख्नु महत्त्वपूर्ण छ कि यो नियम केवल तब मात्र सही हुन्छ जब डेटा वास्तवमा सामान्यको नजिक छ।

७. मानक विचलन बनाम फैलावटका अन्य मापनहरू

यद्यपि मानक विचलन धेरै लोकप्रिय छ, फैलावटका अन्य उपायहरू पनि महत्त्वपूर्ण छन्:

– दायरा: अधिकतम र न्यूनतम मानहरू बीचको भिन्नता। सरल तर बाहिरी वस्तुहरूप्रति धेरै संवेदनशील।
– IQR (अन्तरचतुर्थक दायरा): चतुर्थक १ र चतुर्थक ३ बीचको दायरा। मानक विचलन भन्दा आउटलियरहरूको लागि बढी प्रतिरोधी।
– MAD (मध्यम निरपेक्ष विचलन): धेरै आउटलियरहरू भएको डेटाको लागि उपयुक्त, मध्यकमा आधारित एक बलियो मापन।

डेटा अपेक्षाकृत "स्वच्छ" हुँदा र वितरण धेरै जोडिएको नभएमा मानक विचलन उच्च हुन्छ। यदि डेटामा धेरै आउटलियरहरू छन् भने, मानक विचलन ठूलो हुन सक्छ र डेटाको बहुमतको कम प्रतिनिधित्व गर्न सक्छ।

पढ्नुहोस्  तथ्याङ्कमा Z स्कोर सूत्र

८. मानक विचलनका फाइदा र सीमाहरू

केलेबिहान
- सबै डेटा प्रयोग गर्दछ (चरम मानहरू मात्र होइन)।
- यसको बलियो सैद्धान्तिक आधार छ र यो प्रायः धेरै उन्नत तथ्याङ्कीय विधिहरूमा प्रयोग गरिन्छ।
- एकाइहरू मूल डेटा जस्तै भएकाले व्याख्या गर्न सजिलो।

सीमाहरू
- बाहिरी वस्तुहरूप्रति धेरै संवेदनशील किनभने यसले भिन्नताको वर्ग समावेश गर्दछ।
- "ठूलो" वा "सानो" को व्याख्या स्केल र सन्दर्भमा निर्भर गर्दछ।
– अत्यधिक गैर-सामान्य वितरणहरूमा, मानक विचलन कम प्रतिनिधित्व गर्ने हुन सक्छ।

५. पेनटअप

डेटासेटको विशेषताहरू बुझ्नको लागि डेटा फैलावटको विश्लेषण गर्नु एक महत्त्वपूर्ण चरण हो। मानक विचलनले डेटा औसतबाट कति टाढा फैलिन्छ भन्ने स्पष्ट मापन प्रदान गर्दछ, जसले हामीलाई प्रक्रिया वा घटनाको स्थिरता, जोखिम र गुणस्तरको मूल्याङ्कन गर्न मद्दत गर्दछ। यसलाई कसरी गणना र व्याख्या गर्ने भनेर बुझेर, हामी शैक्षिक अनुसन्धान, कार्यसम्पादन मूल्याङ्कन, गुणस्तर नियन्त्रण, वा व्यापार विश्लेषणमा, थप सूचित निर्णयहरू गर्न सक्छौं।

अन्ततः, मानक विचलन केवल एउटा संख्या मात्र होइन, बरु डेटामा निहित अनिश्चितता र भिन्नताको एउटा महत्त्वपूर्ण सारांश हो। थप बलियो विश्लेषणको लागि, वितरणको थप पूर्ण र सटीक तस्वीर प्रदान गर्न मानक विचलनलाई अन्य मापनहरू - जस्तै मध्यक, IQR, वा डेटा दृश्यीकरण - सँग संयोजनमा प्रयोग गर्नुपर्छ।

टिप्पणी छोड्नुहोस्