तथ्याङ्कमा प्रमुख घटक विश्लेषण

तथ्याङ्कमा प्रमुख घटक विश्लेषण

पेन्डाहुलुआन

प्रिन्सिपल कम्पोनेन्ट एनालिसिस (PCA) डेटासेटको आवश्यक विशेषताहरूलाई कायम राख्दै डेटाको आयाम कम गर्न प्रयोग गरिने एक तथ्याङ्कीय प्रविधि हो। यो ढाँचा पहिचान, छवि प्रशोधन, र जीनोमिक डेटा विश्लेषण जस्ता क्षेत्रहरूमा व्यापक रूपमा प्रयोग गरिन्छ, जहाँ ठूलो डेटा भोल्युमले व्याख्या र प्रशोधनलाई जटिल बनाउन सक्छ। PCA ले महत्त्वपूर्ण जानकारी नगुमाई डेटालाई सरल बनाउन मद्दत गर्दछ, यसलाई आधुनिक डेटा विश्लेषणमा अत्यधिक उपयोगी उपकरण बनाउँछ।

PCA को आधारभूत सिद्धान्त

PCA को आधारभूत सिद्धान्त भनेको डेटालाई निर्देशांकहरूको नयाँ सेटमा रूपान्तरण गर्नु हो, जहाँ डेटामा अधिकतम परिवर्तनशीलता पहिलो घटकद्वारा, दोस्रो उच्चतम परिवर्तनशीलता दोस्रो घटकद्वारा, र यस्तै अन्य कुराहरू कैद गरिन्छ। यी घटकहरूलाई प्रमुख घटक भनिन्छ। प्रक्रियामा धेरै प्रमुख चरणहरू समावेश छन्:

१. डेटा मानकीकरण: फरक-फरक डेटामा प्रायः फरक-फरक स्केल हुन्छन्, जसले PCA नतिजाहरूलाई असर गर्न सक्छ। त्यसकारण, डेटालाई सामान्यतया माध्य घटाएर र मानक विचलनले भाग गरेर मानकीकृत गरिन्छ।

२. सहप्रसरण म्याट्रिक्स: अर्को चरण भनेको मानकीकृत डेटाको सहप्रसरण म्याट्रिक्स गणना गर्नु हो। यो म्याट्रिक्सले दुई चरहरू कसरी एकसाथ परिवर्तन हुन्छन् भनेर बुझ्न मद्दत गर्दछ।

३. इगेनभ्यालु र इगेनभेक्टर: सहप्रसरण म्याट्रिक्सको इगेनभ्यालु र इगेनभेक्टर गणना गरिन्छ। इगेनभेक्टरले प्रमुख घटकहरूको दिशा निर्धारण गर्छ, जबकि इगेनभ्यालुले तिनीहरूको महत्त्व निर्धारण गर्छ।

४. कम्पोनेन्ट क्रमबद्धता: प्रमुख कम्पोनेन्टहरूलाई तिनीहरूको इगेनभ्यालु अनुसार, सबैभन्दा ठूलोदेखि सानोसम्म क्रमबद्ध गरिन्छ। प्रमुख कम्पोनेन्ट चयन सामान्यतया इगेनभ्यालुहरूमा आधारित हुन्छ, थप विश्लेषणको लागि ठूला इगेनभ्यालु भएका कम्पोनेन्टहरू चयन गरिन्छ।

५. डेटा रूपान्तरण: मूल डेटालाई थप विश्लेषणको लागि प्रमुख घटक स्थानमा रूपान्तरण गरिन्छ।

PCA मा चरणहरू

१. तथ्याङ्क सङ्कलन

PCA मा पहिलो चरण भनेको सान्दर्भिक डेटा सङ्कलन गर्नु हो। विश्लेषणले अर्थपूर्ण परिणामहरू दिनको लागि यो डेटा पर्याप्त ठूलो हुनुपर्छ। उदाहरणका लागि, स्वास्थ्य सेवा आवेदनको लागि, उचाइ, तौल, रक्तचाप, आदि जस्ता बिरामी डेटा सङ्कलन गर्न सकिन्छ।

२. डेटा मानकीकरण

डेटा सङ्कलन गरिसकेपछि, त्यस भित्रको प्रत्येक विशेषता (स्तम्भ) लाई मानकीकृत गर्नुपर्छ। मानकीकरणको पछाडिको तर्क भनेको प्रत्येक विशेषताले यसको मूल स्केललाई ध्यान नदिई PCA मा समान रूपमा योगदान पुर्‍याउँछ भन्ने कुरा सुनिश्चित गर्नु हो। प्रत्येक विशेषताबाट माध्य घटाएर र त्यसपछि मानक विचलनद्वारा भाग गरेर मानकीकरण प्राप्त गरिन्छ।

सूत्रीकरण:
\[ Z = \frac{X - \mu}{\sigma} \]
जहाँ \(X\) मूल विशेषता मान हो, \(\mu\) विशेषता मध्य हो, र \(\sigma\) विशेषता मानक विचलन हो।

३. सहप्रसरण म्याट्रिक्स सिर्जना गर्दै

अर्को चरण भनेको मानकीकृत डेटाबाट सहप्रसरण म्याट्रिक्स सिर्जना गर्नु हो। सहप्रसरण म्याट्रिक्स भनेको वर्ग म्याट्रिक्स हो जसले विशेषताहरूको परिवर्तनशीलता र तिनीहरू बीचको सम्बन्धलाई प्रतिनिधित्व गर्दछ।

सूत्रीकरण:
\[ Cov(X, Y) = E[(X – E[X])(Y – E[Y])] \]
जहाँ \(E\) अपेक्षा वा औसत हो।

४. इगेनभ्यालु र इगेनभेक्टरहरूको गणना गर्दै

एकपटक सहप्रसरण म्याट्रिक्स सिर्जना भएपछि, अर्को चरण भनेको इगेनभ्यालुहरू र इगेनभ्यालुहरू गणना गर्नु हो। इगेनभ्यालुहरू र इगेनभ्यालुहरू PCA को मेरुदण्ड हुन् किनभने तिनीहरूले प्रमुख घटकहरूको दिशा र महत्त्व निर्धारण गर्छन्। ठूलो इगेनभ्यालुले सम्बन्धित इगेनभ्यालुद्वारा दिइएको दिशामा बढी भिन्नतालाई संकेत गर्दछ।

५. इजिनभ्यालुको आधारमा कम्पोनेन्टहरू क्रमबद्ध गर्ने

प्रमुख घटकहरूलाई तिनीहरूको इगेनभ्यालु अनुसार सबैभन्दा ठूलोदेखि सानोसम्म क्रमबद्ध गरिएको छ। सबैभन्दा ठूलो इगेनभ्यालु भएको प्रमुख घटकले डेटामा परिवर्तनशीलतामा सबैभन्दा बढी योगदान पुर्‍याउँछ।

६. राख्नु पर्ने कम्पोनेन्टहरूको संख्या चयन गर्ने

सबै प्रमुख घटकहरू राख्नु आवश्यक छैन। घटक चयन इजिन मानहरूमा आधारित हुन्छ। एउटा सामान्य दृष्टिकोण 'सञ्चित व्याख्या गरिएको भिन्नता' हो, जसले डेटामा कुल भिन्नताको कति अनुपात प्रमुख घटकहरूद्वारा व्याख्या गरिएको छ भनेर संकेत गर्दछ।

३. डेटा रूपान्तरण

अन्तिम चरण भनेको मूल डेटालाई चयन गरिएको प्रमुख घटक स्पेसको निर्देशांकमा रूपान्तरण गर्नु हो। यस प्रमुख घटक स्पेसमा रहेका मानहरू नयाँ विशेषताहरू बन्छन् जसलाई थप विश्लेषण गर्न सकिन्छ।

PCA अनुप्रयोगहरू

वर्गीकरण र ढाँचा पहिचान

वर्गीकरण र ढाँचा पहिचानमा PCA व्यापक रूपमा प्रयोग गरिन्छ। डेटाको आयाम घटाएर, PCA ले वर्गीकरण प्रक्रियालाई अझ प्रभावकारी बनाउँछ र कम्प्युटेशनल जटिलता कम गर्छ। उदाहरणका लागि, अनुहार पहिचानमा, PCA ले छविहरूमा अनुहारहरूको आयाम घटाउँछ ताकि कम्प्युटरहरूले तिनीहरूलाई छिटो पहिचान गर्न सकून्।

छवि प्रशोधन

PCA ले महत्त्वपूर्ण विवरणहरू नगुमाईकन छविको आकार घटाउन सक्छ। यो प्रविधि छविहरूबाट सुविधाहरू निकाल्न पनि प्रयोग गरिन्छ जुन वस्तु पहिचान, किनारा पत्ता लगाउने, र छवि विभाजन जस्ता विभिन्न अनुप्रयोगहरूमा प्रयोग गर्न सकिन्छ।

जीनोम डेटा विश्लेषण

जीवविज्ञानमा, जीनोमिक डेटा प्रायः धेरै ठूलो र जटिल हुन्छ। पीसीए जीनोमिक डेटाको आयाम कम गर्न प्रयोग गरिन्छ, जसले गर्दा डेटा भित्रका ढाँचाहरू र सहसम्बन्धहरू पत्ता लगाउन र विश्लेषण गर्न सजिलो हुन्छ। यो विशेष गरी आनुवंशिक अनुसन्धान र औषधि विकासमा उपयोगी छ।

वित्त र अर्थशास्त्र

PCA पोर्टफोलियो जोखिम विश्लेषण र स्टक मूल्य भविष्यवाणीमा प्रयोग गरिन्छ। वित्तीय डेटाको आयाम घटाएर, विश्लेषणले बजारलाई महत्त्वपूर्ण रूपमा प्रभाव पार्ने कारकहरूमा बढी ध्यान केन्द्रित गर्न सक्छ।

केसिम्पुलन

प्रिन्सिपल कम्पोनेन्ट एनालिसिस (PCA) तथ्याङ्क र मेसिन लर्निङमा एक शक्तिशाली प्रविधि हो। महत्त्वपूर्ण जानकारी नगुमाई डेटाको आयाम घटाएर, PCA ले अझ कुशल र व्याख्यात्मक विश्लेषण सक्षम बनाउँछ। PCA शक्तिशाली भए तापनि, यसको सीमितताहरू बुझ्नु महत्त्वपूर्ण छ: यो तब मात्र प्रभावकारी हुन्छ जब डेटा रेखीय रूपमा संरचित हुन्छ। PCA र यसको सम्भावित अनुप्रयोगहरू बुझ्नाले हामीलाई ठूला, जटिल डेटासेटहरूबाट गहिरो अन्तर्दृष्टिहरू निकाल्न अनुमति दिन्छ, जसले यसलाई आधुनिक डेटा विश्लेषणमा एक आवश्यक उपकरण बनाउँछ।

टिप्पणी छोड्नुहोस्