तथ्याङ्कमा ज्याकनाइफ विधि

तथ्याङ्कमा ज्याकनाइफ विधि

ज्याकनाइफ विधि तथ्याङ्कमा एक महत्त्वपूर्ण पुन: नमूनाकरण प्रविधि हो, विशेष गरी अनुमानको अनिश्चितता मापन गर्न। ज्याकनाइफ प्रायः अनुमानकर्ताको पूर्वाग्रह र भिन्नता अनुमान गर्न, साथै मानक त्रुटि जस्ता सटीक मापनहरू निर्माण गर्न प्रयोग गरिन्छ। यो प्रविधि अपेक्षाकृत सरल छ, अत्यधिक कडा वितरण धारणाहरू आवश्यक पर्दैन, र शास्त्रीय तथ्याङ्कदेखि आधुनिक डेटा विश्लेषणसम्म, समस्याहरूको विस्तृत दायरामा लागू गर्न सकिन्छ।

पृष्ठभूमि र आधारभूत विचारहरू

ज्याकनाइफ मौरिस क्वेनोइलले प्रस्तुत गरेका थिए र पछि जोन टुकीले यसलाई लोकप्रिय बनाए। "ज्याकनाइफ" नाम बहुमुखी पकेटनाइफबाट प्रेरित छ, किनकि यो विधि लचिलो छ र विभिन्न सन्दर्भहरूमा प्रयोग गर्न सकिन्छ। आधारभूत विचार यो हो: यदि हामीसँग आकार n को नमूना छ भने, हामी एक पटकमा एउटा अवलोकन हटाएर धेरै "डमी नमूनाहरू" सिर्जना गर्छौं, र त्यसपछि प्रत्येक नमूनामा अनुमानकर्ता पुन: गणना गर्छौं। एउटा अवलोकन हटाउँदा अनुमानकर्ता कसरी परिवर्तन हुन्छ भनेर अवलोकन गरेर, हामी डेटामा भिन्नतामा अनुमानकर्ताको स्थिरतामा अन्तर्दृष्टि प्राप्त गर्छौं।

उदाहरणका लागि, मानौं हामीसँग डेटा \(x_1, x_2, \dots, x_n\) छ र हामी अनुमानक \( \hat{\theta}=t(x_1,\dots,x_n)\) प्रयोग गरेर प्यारामिटर \(\theta\) अनुमान गर्न चाहन्छौं। jackknife मा, हामी आकार \(n-1\) को n उपनमूना बनाउँछौं, अर्थात् \(i\)th उपनमूना जसले \(x_i\) मेटाउँछ। त्यसपछि हामी गणना गर्छौं:

\[
\टोपी{\थेटा}_{(i)} = t(x_1,\थोप्लो,x_{i-1},x_{i+1},\थोप्लो,x_n)
\]

मान \(\hat{\theta}_{(i)}\) लाई लीभ-वन-आउट अनुमान भनिन्छ।

ज्याकनाइफ विधि चरणहरू

प्रक्रियागत रूपमा, ज्याकनाइफलाई निम्न चरणहरूमा व्याख्या गर्न सकिन्छ:

१. पूर्ण डेटामा अनुमानक गणना गर्नुहोस्
सम्पूर्ण नमूनामा \(\hat{\theta}\) गणना गर्नुहोस्।

२. n leave-one-out उपनमूनाहरू सिर्जना गर्नुहोस्
प्रत्येक \(i = 1,2,\dots,n\) को लागि, अवलोकन \(x_i\) हटाउनुहोस् र अनुमानक \(\hat{\theta}_{(i)}\) गणना गर्नुहोस्।

३. ज्याकनाइफ अनुमानकको औसत गणना गर्नुहोस्
औसत एक जनालाई छोड्ने:
\[
\बार{\थेटा}_{(\cdot)} = \frac{1}{n}\योग_{i=1}^n \टोपी{\थेटा}_{(i)}
\]

४. अनुमान भिन्नता (वा मानक त्रुटि)
ज्याकनाइफ भिन्नता सामान्यतया निम्न द्वारा गणना गरिन्छ:
\[
\widehat{\mathrm{Var}}_{J}(\hat{\theta}) = \frac{n-1}{n}\sum_{i=1}^n \left(\hat{\theta}_{(i)} – \bar{\theta}_{(\cdot)}\right)^2
\]
मानक त्रुटि भनेको भिन्नताको वर्गमूल हो।

पढ्नुहोस्  स्क्युनेस र कर्टोसिस बुझ्दै

५. पूर्वाग्रह अनुमान र पूर्वाग्रह सुधार (वैकल्पिक)
ज्याकनाइफले निम्न माध्यमबाट पनि पूर्वाग्रह अनुमान गर्न सक्छ:
\[
\widehat{\mathrm{Bias}}_{J}(\hat{\theta}) = (n-1)\left(\bar{\theta}_{(\cdot)} - ​​\hat{\theta}\right)
\]
पूर्वाग्रह सुधार निम्न तरिकाले गर्न सकिन्छ:
\[
\hat{\theta}_{J} = \hat{\theta} - \widehat{\mathrm{Bias}}_{J}(\hat{\theta})
\]
व्याख्या: यदि छोड्ने-एक-आउट औसत पूर्ण अनुमानकबाट व्यवस्थित रूपमा फरक छ भने, त्यहाँ पूर्वाग्रहको संकेत छ जुन सच्याउन सकिन्छ।

सहज उदाहरण: नमूना माध्य

ज्याकनाइफलाई सहज रूपमा बुझ्नको लागि, नमूना औसत अनुमानकलाई विचार गर्नुहोस्:

\[
\टोपी{\mu} = \frac{1}{n}\योग_{i=1}^n x_i
\]

यदि हामीले एउटा अवलोकन \(x_i\) हटायौं भने, माध्य बन्छ:

\[
\टोपी{\mu}_{(i)} = \frac{1}{n-1}\योग_{j\ne i} x_j
\]

औसतको सन्दर्भमा, ज्याकनाइफले ठूलो "आश्चर्य" प्रदान गर्दैन किनभने औसत स्थिर छ र पूर्वाग्रह सानो छ (धेरै सन्दर्भहरूमा)। यद्यपि, अधिक जटिल अनुमानकहरूको लागि - जस्तै मध्यक, एक विशेष प्रतिगमन गुणांक, एक सहसम्बन्ध, वा एक गैर-रेखीय तथ्याङ्क - एकल डेटा बिन्दु हटाउँदा हुने परिवर्तनले अनुमानकको संवेदनशीलता प्रकट गर्न सक्छ र यसको मानक त्रुटिको उपयोगी अनुमान उत्पादन गर्न सक्छ।

स्यूडोभ्यालु: ज्याकनाइफमा एउटा महत्त्वपूर्ण अवधारणा

केही छलफलहरूमा, ज्याकनाइफले प्रत्येक अवलोकनको लागि छद्ममान प्रस्तुत गर्दछ:

\[
\theta_i^{ } = n\टोपी{\थेटा} – (n-1)\टोपी{\थेटा}_{(i)}
\]

त्यसपछि ज्याकनाइफ अनुमानकलाई छद्ममानहरूको औसतको रूपमा लेख्न सकिन्छ:

\[
\टोपी{\थेटा}_{J} = \फ्राक{1}{n}\योग_{i=1}^n \थेटा_i^{ }
\]

छद्ममान दृष्टिकोणले प्रत्येक अवलोकनले अन्तिम अनुमानमा कसरी "योगदान" दिन्छ र पूर्वाग्रह विश्लेषणलाई सहज बनाउँछ भनेर व्याख्या गर्न मद्दत गर्दछ।

ज्याकनाइफ र बुटस्ट्र्याप बीचको सम्बन्ध

ज्याकनाइफलाई प्रायः बुटस्ट्र्यापसँग तुलना गरिन्छ, किनकि दुवै पुन: नमूना बनाउने विधिहरू हुन्। यद्यपि, त्यहाँ महत्त्वपूर्ण भिन्नताहरू छन्:

– ज्याकनाइफले एउटा डेटा हटाएर सबस्याम्पलिंग प्रयोग गर्दछ (एक-बाहिर छोड्नुहोस्)। प्रतिकृतिहरूको संख्या निर्धारणात्मक छ: ठ्याक्कै n।
- बुटस्ट्र्यापिङले प्रतिस्थापनको साथ पुन: नमुना सिर्जना गर्दछ, सामान्यतया धेरै पटक (जस्तै १००० वा १०,००० पटक), यसरी अनुमानकको अनुभवजन्य वितरणको अनुमान प्रदान गर्दछ।

सामान्यतया, बुटस्ट्र्याप जटिल समस्याहरूको लागि बढी लचिलो र प्रायः बढी सटीक हुन्छ, तर ज्याकनाइफ सरल र कम्प्युटेसनली कम महँगो हुन्छ। ठूला डेटासेटहरूमा, ज्याकनाइफ नराम्रो मानक त्रुटिहरू प्राप्त गर्नको लागि द्रुत विकल्प हुन सक्छ, विशेष गरी जब अनुमानक गणना महँगो हुन्छ तर अझै पनि n पटक सम्भव हुन्छ।

पढ्नुहोस्  तथ्याङ्कमा बुटस्ट्र्याप विधि

ज्याकनाइफ विधिका फाइदाहरू

ज्याकनाइफका केही फाइदाहरू समावेश छन्:

१. सरल र कार्यान्वयन गर्न सजिलो
एकछिन छोड्ने अवधारणा सहज छ, र भिन्नता सूत्र सीधा छ।

२. थोरै वितरण अनुमानहरू
ज्याकनाइफलाई सधैं सामान्यताको धारणा वा विशेष वितरण आकारको आवश्यकता पर्दैन।

३. निश्चित गणनाहरूको लागि कुशल
किनभने यसलाई अनुमानक गणनाको n गुणा मात्र आवश्यक पर्दछ, ज्याकनाइफ प्रायः बुटस्ट्र्यापिङ भन्दा हलुका हुन्छ जसलाई हजारौं प्रतिकृतिहरू आवश्यक पर्दछ।

४. पूर्वाग्रह अनुमानको लागि उपयोगी
विशेष गरी गैर-रेखीय अनुमानकहरूमा जुन सामान्यतया विश्लेषणात्मक रूपमा गणना गर्न सजिलो हुँदैन।

सीमितता र ध्यान दिनुपर्ने कुराहरू

शक्तिशाली भए पनि, ज्याकनाइफका सीमितताहरू छन्:

१. धेरै सहज अनुमानकर्ताहरूको लागि कम सटीक
उदाहरणका लागि, केही अवस्थाहरूमा मध्यक वा क्वान्टाइलहरू, वा चरम मानहरूमा निर्भर तथ्याङ्कहरू, ज्याकनाइफले कहिलेकाहीं भिन्नताको कम सटीक अनुमान प्रदान गर्दछ।

२. निर्भरता भएका डेटाका लागि सधैं उपयुक्त हुँदैन
समय श्रृंखला वा स्थानिय डेटामा, अवलोकनहरू स्वतन्त्र हुँदैनन्। एउटा बिन्दु हटाउनाले निर्भरता संरचना तोड्न सक्छ। यस्ता केसहरूको लागि, ब्लक ज्याकनाइफ (एक पटकमा डेटाको एक ब्लक हटाउने) जस्ता भिन्नताहरू प्रयोग गरिन्छ।

३. उच्च-प्रभाव अवलोकनहरू प्रति संवेदनशील
यदि त्यहाँ आउटलियर्स वा "लिभरेज्ड" डेटा छ भने, लीभ-वन-आउट अनुमान एकदमै परिवर्तन हुन सक्छ। यो सधैं कमजोरी होइन - वास्तवमा, यो एक महत्त्वपूर्ण संकेत हुन सक्छ - तर परिणामस्वरूप भिन्नता ठूलो हुन सक्छ र सावधानीपूर्वक व्याख्या आवश्यक पर्दछ।

४. धेरै ठूलो n मा स्केलेबिलिटी
बुटस्ट्र्यापिङ भन्दा सस्तो भए पनि, ज्याकनाइफलाई अझै पनि n अनुमानक मूल्याङ्कन आवश्यक पर्दछ। यदि n लाखौंमा छ र अनुमानकहरू महँगा छन् भने, यो समस्याग्रस्त हुन सक्छ।

भिन्नताहरू: डिलिट-डी ज्याकनाइफ र ब्लक ज्याकनाइफ

एकछिन छोड्ने बाहेक, त्यहाँ भिन्नताहरू छन्:

– Delete-d jackknife: प्रति प्रतिकृतिमा d अवलोकनहरू मेटाउँछ (केवल १ को सट्टा)। यसले निश्चित परिस्थितिहरूमा शुद्धता सुधार गर्न सक्छ, विशेष गरी गैर-सहज अनुमानकर्ताहरूको लागि।
- ब्लक ज्याकनाइफ: धेरै आसन्न अवलोकनहरू भएको ब्लक हटाउँछ, जुन स्वत: सहसम्बन्ध भएको डेटाको लागि उपयुक्त हुन्छ (जस्तै दैनिक, साप्ताहिक, वा स्थानिय डेटा)।

पढ्नुहोस्  अन्तर्राष्ट्रिय सम्बन्धमा तथ्याङ्कको महत्त्व

d वा ब्लक साइजको छनोट डेटा संरचना र अनुमान लक्ष्यमा निर्भर गर्दछ।

व्यवहारमा ज्याकनाइफको प्रयोग

ज्याकनाइफ विभिन्न क्षेत्रहरूमा प्रयोग गरिन्छ:

- बायोस्ट्याटिस्टिक्स र महामारी विज्ञान: विश्लेषणात्मक सूत्रहरू गाह्रो हुँदा जोखिम मापन वा मोडेल प्यारामिटरहरूको लागि मानक त्रुटिहरूको अनुमान गर्ने।
- अर्थमिति: प्यारामिटर स्थिरताको मूल्याङ्कन, विशेष गरी सीमित नमूनाहरूमा।
– कम्प्युटर विज्ञान र मेसिन लर्निङ: एक-एक-बाहिर रहने अवधारणा क्रस-प्रमाणीकरणसँग नजिकबाट सम्बन्धित छ, यद्यपि लक्ष्यहरू फरक छन् (भविष्यवाणी प्रमाणीकरण बनाम प्यारामिटर शुद्धता अनुमान)।
- पारिस्थितिकी र सर्वेक्षणहरू: विविधता वा निश्चित सूचकांकहरूको अनुमान र जटिल तथ्याङ्कहरूको अनिश्चितता।

बन्द

ज्याकनाइफ विधि एक क्लासिक पुन: नमूना बनाउने प्रविधि हो जुन आज पनि सान्दर्भिक छ। एउटा साधारण विचार प्रयोग गरेर - एउटा अवलोकन छोडेर र अनुमानकर्ताको पुन: गणना गर्दै - ज्याकनाइफले जटिल गणितीय गणना बिना भिन्नता, मानक त्रुटि र पूर्वाग्रहको अनुमान प्रदान गर्न सक्छ। यद्यपि, यसको प्रयोगको लागि अनुमानकर्ताको प्रकृति, नमूना आकार, र डेटाको निर्भरता संरचनालाई विचार गर्न आवश्यक छ। व्यवहारमा, ज्याकनाइफ प्रायः द्रुत र पारदर्शी विकल्प हो, वा बुटस्ट्र्यापिङ जस्ता थप बलियो पुन: नमूना बनाउने विधिहरू प्रयोग गर्ने पूरक हो।

यदि तपाईं चाहनुहुन्छ भने, म एउटा सानो संख्यात्मक गणना उदाहरण पनि थप्न सक्छु (जस्तै सहसम्बन्ध वा प्रतिगमनको लागि) वा अनुप्रयोग स्पष्ट पार्न R/Python मा jackknife कार्यान्वयन समावेश गर्न सक्छु।

टिप्पणी छोड्नुहोस्