तथ्याङ्कमा आउटलायर भनेको के हो?

तथ्याङ्कमा आउटलायर भनेको के हो?

तथ्याङ्कमा, उपभोक्ता व्यवहार, परीक्षण नतिजा, बिरामी स्वास्थ्य, उत्पादन गुणस्तर, र आर्थिक प्रवृत्तिहरू पनि: घटनाहरू बुझ्नको लागि डेटा प्राथमिक कच्चा पदार्थ हो। यद्यपि, सबै डेटा बिन्दुहरू बहुमत जस्तै "व्यवहार" गर्दैनन्। कहिलेकाहीँ हामी एक वा बढी मानहरू भेट्छौं जुन बाँकी डेटा सेट भन्दा उल्लेखनीय रूपमा फरक देखिन्छ। यी आउटलायरहरूलाई आउटलायर भनेर चिनिन्छ। आउटलायरहरूलाई बुझ्नु महत्त्वपूर्ण छ किनभने तिनीहरूले विश्लेषणात्मक निष्कर्षहरू परिवर्तन गर्न सक्छन्, भविष्यवाणी गर्ने मोडेलहरूलाई प्रभाव पार्न सक्छन्, र अनुसन्धान गर्न लायक महत्त्वपूर्ण घटनाहरूलाई पनि संकेत गर्न सक्छन्।

आउटलियर्स बुझ्दै

सरल भाषामा भन्नुपर्दा, आउटलायर भनेको अवलोकन वा डेटा मान हो जुन अधिकांश डेटा भन्दा उल्लेखनीय रूपमा फरक हुन्छ। आउटलायरहरू सामान्य ढाँचा भन्दा उच्च (अत्यन्त उच्च) वा कम (अत्यन्त कम) हुन सक्छन्। उदाहरणका लागि, यदि अधिकांश विद्यार्थीहरूको परीक्षा स्कोर ६०-९० दायरामा पर्छ, र ५ वा १०० को एकल स्कोर उल्लेखनीय रूपमा विचलित हुन्छ भने, त्यो स्कोरलाई आउटलायरको रूपमा शंका गर्नुपर्छ।

यो कुरामा जोड दिनु महत्त्वपूर्ण छ: आउटलायरको अर्थ सधैं "त्रुटि" हुँदैन। आउटलायरले डेटा सेटको तुलनामा मान असामान्य छ भनेर मात्र संकेत गर्छ। आउटलायरहरू इनपुट त्रुटिहरू, दोषपूर्ण मापन उपकरणहरूबाट उत्पन्न हुन सक्छन्, वा दुर्लभ तर महत्त्वपूर्ण वास्तविक-विश्व घटनाहरू प्रतिबिम्बित गर्न सक्छन्।

सरल उदाहरण

१० जनाको मासिक आम्दानीको तथ्याङ्क (मिलियन रुपैयाँमा) कल्पना गर्नुहोस्:
5, 5, 6, 6, 6, 7, 7, 7, 8, 50

यहाँ, ५० नम्बर अरूको तुलनामा स्पष्ट रूपमा देखिन्छ। के ५० त्रुटि हो? यो गलत पढाइ हुन सक्छ (यो ५.० हुनुपर्छ), तर यो सही पनि हुन सक्छ किनभने व्यक्ति ठूलो व्यवसाय मालिक हो। दुवै अवस्थामा, ५० एक बाहिरी अंश नै रहन्छ - फरक कुरा के हो भने हामीले यसलाई विश्लेषणमा कसरी व्यवहार गर्छौं।

किन बाहिरी कुराहरू देखा पर्छन्?

बाहिरी वस्तुहरू देखा पर्नुका धेरै सामान्य कारणहरू छन्:

१. मापन वा उपकरण त्रुटि
उदाहरणका लागि, तापक्रम सेन्सरले कहिलेकाहीं हस्तक्षेपको कारणले चरम मानहरू पढ्न सक्छ।

२. डेटा रेकर्ड गर्ने वा इनपुट गर्ने क्रममा त्रुटिहरू
क्लासिक उदाहरणहरू: १०० को सट्टा १००० टाइप गर्नु, वा गलत एकाइहरू (सेमी बनाम मीटर)।

३. प्राकृतिक भिन्नता
वास्तविक संसारमा, दुर्लभ तर यथार्थपरक घटनाहरू हुन्छन्: ठूलो पदोन्नतिको कारण बिक्रीमा वृद्धि, बिरामीलाई औषधिप्रति असामान्य प्रतिक्रिया, वा खेलाडीले चरम रेकर्ड कायम गर्ने।

४. प्रक्रिया वा अवस्थाहरूमा परिवर्तनहरू
उदाहरणका लागि, कुनै कारखानाले कुनै निश्चित दिन मेसिन बिग्रने अनुभव गर्छ, जसले गर्दा दोषपूर्ण उत्पादनहरूको संख्यामा उल्लेखनीय वृद्धि हुन्छ।

५. मिश्रित जनसंख्या
एउटा डेटासेटमा धेरै फरक समूहहरू संयुक्त हुन सक्छन्। उदाहरणका लागि, माध्यमिक विद्यालय र कलेजका विद्यार्थीहरूको उचाइ मिश्रित हुन्छ; केही "चरम" मानहरू विसंगतिहरूको कारणले होइन, तर समूहहरू साँच्चै फरक भएको कारणले देखा पर्न सक्छन्।

तथ्याङ्कीय विश्लेषणमा आउटलियर्सको प्रभाव

आउटलियरहरू महत्त्वपूर्ण छन् किनभने तिनीहरूले विश्लेषणको नतिजालाई उल्लेखनीय रूपमा असर गर्न सक्छन्, विशेष गरी चरम मानहरूप्रति संवेदनशील विधिहरूमा।

१. औसत (औसत) लाई असर गर्छ
चरम मानहरूद्वारा औसत सजिलै "तानिन" सकिन्छ। माथिको आय उदाहरणमा, औसत ५० को मानले उल्लेखनीय रूपमा बढाइनेछ, यद्यपि बहुमत ५-८ को आसपास छ।

२. मानक विचलन र भिन्नतालाई असर गर्छ
भिन्नता गणनामा औसतबाट वर्ग भिन्नताहरू समावेश भएको हुनाले, आउटलियरहरूले भिन्नता र मानक विचलनलाई बढाउन सक्छन्, जसले गर्दा डेटा वास्तवमा भन्दा बढी "फैलिएको" देखिन्छ।

३. विचलित पार्ने रिग्रेसन र मेसिन लर्निङ मोडेलहरू
रेखीय प्रतिगमनमा, आउटलायरहरूले प्रतिगमन रेखालाई स्क्यु गर्न सक्छन्, जसले गर्दा अधिकांश डेटाको लागि भविष्यवाणीहरू खराब हुन्छन्। केही एल्गोरिदमहरूमा, आउटलायरहरूले मोडेललाई ओभरफिट गर्न वा प्रशिक्षण प्यारामिटरहरूलाई असर गर्न सक्छन्।

४. प्रभाव परिकल्पना परीक्षण
आउटलियरहरूले सामान्यता र भिन्नताको एकरूपताको धारणाहरू उल्लङ्घन गर्न सक्छन् जुन प्रायः प्यारामेट्रिक परीक्षणहरूमा प्रयोग गरिन्छ, जसले गर्दा तथ्याङ्कीय निष्कर्षहरू पक्षपाती हुन्छन्।

यद्यपि, बाहिरी व्यक्तिहरू पनि महत्त्वपूर्ण संकेतहरू हुन सक्छन्। ठगी पत्ता लगाउने क्रममा, बाहिरी लेनदेनहरू ठ्याक्कै हामीले खोज्न चाहेको कुरा हो। स्वास्थ्य सेवामा, प्रयोगशालाका नतिजाहरूमा उल्लेखनीय रूपमा फरकपनले गम्भीर चिकित्सा अवस्थालाई संकेत गर्न सक्छ।

बाहिरी व्यक्तिहरू कसरी पत्ता लगाउने

कुनै पनि "सही" विधि छैन। बाह्य पत्ता लगाउने काम प्रायः सन्दर्भ, डेटा प्रकार र विश्लेषण उद्देश्यहरूमा निर्भर गर्दछ। यहाँ केही सामान्य विधिहरू छन्:

१. दृश्यावलोकन: बक्सप्लट र स्क्याटरप्लट
– बक्सप्लटहरू आउटलियरहरू पत्ता लगाउन धेरै लोकप्रिय छन्। बक्सप्लटमा, आउटलियरहरूलाई सामान्यतया व्हिस्कर बक्स बाहिर पर्ने बिन्दुहरूको रूपमा चिन्ह लगाइन्छ।
- स्क्याटरप्लटहरूले दुई चरहरू बीचको सम्बन्धमा बाहिरी कुराहरू हेर्न मद्दत गर्दछ, उदाहरणका लागि तौल बनाम उचाइ।

दृश्यावलोकन पहिलो चरणको रूपमा उपयोगी छ किनकि यो छिटो र सहज छ।

२. IQR (इन्टरक्वार्टाइल रेन्ज) विधि
IQR विधि प्रायः एकल-चर डेटा (अविचल) को लागि प्रयोग गरिन्छ।
- Q1 (चतुर्थक १) र Q3 (चतुर्थक ३) गणना गर्नुहोस्
– IQR = Q3 − Q1
– तल्लो सीमा = Q1 − १.५ × IQR
– माथिल्लो सीमा = Q3 + १.५ × IQR

यी सीमाहरू बाहिरका मानहरूलाई सामान्यतया बाहिरी मानिन्छ। यो विधि अपेक्षाकृत बलियो छ किनभने यो चरम मानहरूबाट धेरै प्रभावित हुँदैन।

३. Z-स्कोर (औसत र मानक विचलनमा आधारित)
Z-स्कोरले मानक विचलन एकाइहरूमा मान औसतबाट कति टाढा छ भनेर मापन गर्छ।
– z = (x − औसत) / sd
|z| > ३ (कहिलेकाहीं > २.५) भएका मानहरूलाई प्रायः बाहिरी मानिन्छ।

कमजोरी: यदि डेटामा पहिले नै ठूला आउटलियरहरू छन् भने, माध्य र sd प्रभावित हुन्छन् जसले गर्दा पत्ता लगाउने क्षमता कम सटीक हुन सक्छ।

४. मोडेल-आधारित र बहुभिन्न विधिहरू
बहु-चर डेटाको लागि, आउटलियरहरू सधैं एउटा स्तम्भमा मात्र देखिँदैनन्, तर धेरै चरहरूको संयोजनमा देखिन्छन्।
– महालनोबिस दूरी प्रायः बहुभिन्न आउटलियरहरू पत्ता लगाउन प्रयोग गरिन्छ।
– मेसिन लर्निङमा, आइसोलेसन फरेस्ट, लोकल आउटलियर फ्याक्टर (LOF), वा वन-क्लास SVM जस्ता दृष्टिकोणहरू छन्।

यो विधि ठूला र जटिल डेटासेटहरूको लागि उपयुक्त छ, उदाहरणका लागि वित्तीय लेनदेन विसंगति पत्ता लगाउने।

यदि तपाईंले बाहिरी कुरा फेला पार्नुभयो भने के गर्ने?

उत्तम कार्य भनेको तिनीहरूलाई मेटाउनु मात्र होइन। सामान्यतया, बाह्य ह्यान्डलिङ प्रक्रियामा धेरै चरणहरू समावेश हुन्छन्:

१. डेटा प्रमाणिकरण
- गलत इनपुट, दोहोरिएको, वा गलत एकाइहरूको लागि जाँच गर्नुहोस्।
- मूल डेटा स्रोतसँग तुलना गर्नुहोस् (जस्तै फारमहरू, सेन्सर लगहरू, वा म्यानुअल रेकर्डहरू)।

२. सन्दर्भ बुझ्नुहोस्
– के डोमेनमा चरम मानहरू अर्थपूर्ण छन्?
- उदाहरणका लागि, मानव शरीरको तापक्रम ५० डिग्री सेल्सियस लगभग निश्चित रूपमा गलत हो; तर ५ करोडको आम्दानी उचित हुन सक्छ।

३. विश्लेषणको उद्देश्य निर्धारण गर्नुहोस्
- यदि लक्ष्य "सामान्य" व्यवहार बुझ्नु हो भने, बाहिरी व्यक्तिहरूलाई हावी हुनबाट रोक्नको लागि तिनीहरूलाई ह्यान्डल गर्नुपर्ने हुन सक्छ।
- यदि लक्ष्य दुर्लभ घटनाहरू (धोखाधडी, मेसिन विफलता) फेला पार्नु हो भने, आउटलियरहरू मुख्य फोकस हुन्।

४. ह्यान्डलिङ रणनीति छनौट गर्नुहोस्
केही सामान्य विकल्पहरू:
- हटाउने: यदि आउटलायर त्रुटि प्रमाणित भयो र प्रतिनिधित्व गर्दैन भने गरिन्छ।
- डेटा रूपान्तरण: उदाहरणका लागि स्क्युड डेटाको लागि लग रूपान्तरण।
- विन्सोराइजिङ / क्यापिङ: चरम मानहरूलाई निश्चित प्रतिशतकहरूमा सीमित गर्ने (जस्तै p1 र p99)।
- बलियो विधिहरू प्रयोग गर्नुहोस्: मध्य, IQR, बलियो प्रतिगमन, वा आउटलायर-प्रतिरोधी मोडेलहरू।
- छुट्टै विश्लेषण: कहिलेकाहीँ विशेष केसको रूपमा बाहिरीहरूलाई विश्लेषण गर्नु बढी उपयुक्त हुन्छ।

महत्त्वपूर्ण कुरा, निर्णयहरू दस्तावेजीकरण गरिनुपर्छ ताकि विश्लेषण पारदर्शी र जवाफदेही होस्।

बाहिरी कुराहरू: समस्या वा मूल्यवान जानकारी?

आउटलियरहरूलाई प्रायः "शोर" मानिन्छ किनभने तिनीहरूले तथ्याङ्कीय सारांशहरू विकृत गर्न सक्छन्। यद्यपि, धेरै अवस्थामा, आउटलियरहरू नयाँ अन्तर्दृष्टिको प्रवेशद्वार हुन्: प्रिमियम ग्राहक खण्डको अस्तित्व, ध्यान आवश्यक पर्ने बिरामी अवस्था, उत्पादन प्रक्रियामा नयाँ चरण, वा सम्भावित धोखाधडी। त्यसकारण, आउटलियरहरूलाई स्वचालित रूपमा खारेज नगरी अनुसन्धान गर्न आवश्यक पर्ने कुराको रूपमा व्यवहार गर्नुपर्छ।

केसिम्पुलन

तथ्याङ्कमा आउटलायर भनेको डेटाको सामान्य ढाँचाबाट उल्लेखनीय रूपमा विचलित हुने मान हो। आउटलायरहरू त्रुटिहरू, प्राकृतिक भिन्नता, प्रक्रिया परिवर्तनहरू, वा डेटासेट भित्र समूह भिन्नताहरूको कारणले उत्पन्न हुन सक्छन्। तिनीहरूको प्रभाव औसत, भिन्नता, तथ्याङ्कीय परीक्षणहरू, र भविष्यवाणी गर्ने मोडेलहरूमा महत्त्वपूर्ण हुन सक्छ। आउटलायर पत्ता लगाउने कार्य दृश्यावलोकन, IQR विधिहरू, z-स्कोरहरू, र बहुभिन्न दृष्टिकोणहरू र मेसिन लर्निङ मार्फत पनि प्राप्त गर्न सकिन्छ। ह्यान्डलिङले सन्दर्भ र उद्देश्यहरूलाई विचार गर्नुपर्छ: प्रमाणीकरण गर्ने, कारणहरू बुझ्ने, र त्यसपछि मानहरू हटाउने, रूपान्तरण गर्ने, सीमित गर्ने, वा बलियो विधिहरू प्रयोग गर्ने जस्ता रणनीति छनौट गर्ने।

उचित बुझाइको साथ, आउटलियरहरू केवल "विजोड संख्याहरू" होइनन्, बरु तथ्याङ्कीय अभ्यासका महत्त्वपूर्ण तत्वहरू हुन् जसले डेटा-संचालित विश्लेषण र निर्णयहरूको गुणस्तर सुधार गर्न सक्छन्।

टिप्पणी छोड्नुहोस्