სტატისტიკაში ძირითადი კომპონენტების ანალიზი

სტატისტიკაში ძირითადი კომპონენტების ანალიზი

პენდაჰულუანი

ძირითადი კომპონენტების ანალიზი (PCA) არის სტატისტიკური ტექნიკა, რომელიც გამოიყენება მონაცემთა განზომილებების შესამცირებლად, მონაცემთა ნაკრების ძირითადი მახასიათებლების შენარჩუნებით. ის ფართოდ გამოიყენება ისეთ სფეროებში, როგორიცაა ნიმუშების ამოცნობა, გამოსახულების დამუშავება და გენომური მონაცემების ანალიზი, სადაც მონაცემთა დიდმა მოცულობამ შეიძლება გაართულოს ინტერპრეტაცია და დამუშავება. PCA ხელს უწყობს მონაცემების გამარტივებას მნიშვნელოვანი ინფორმაციის დაკარგვის გარეშე, რაც მას თანამედროვე მონაცემთა ანალიზში უაღრესად სასარგებლო ინსტრუმენტად აქცევს.

PCA-ს ძირითადი თეორია

PCA-ს ძირითადი პრინციპია მონაცემების გარდაქმნა კოორდინატების ახალ ნაკრებად, სადაც მონაცემებში მაქსიმალური ცვალებადობა აღირიცხება პირველი კომპონენტის მიერ, მეორე ყველაზე მაღალი ცვალებადობა - მეორე კომპონენტის მიერ და ა.შ. ამ კომპონენტებს მთავარი კომპონენტები ეწოდება. პროცესი მოიცავს რამდენიმე ძირითად ეტაპს:

1. მონაცემთა სტანდარტიზაცია: სხვადასხვა მონაცემებს ხშირად განსხვავებული შკალები აქვთ, რამაც შეიძლება გავლენა მოახდინოს PCA შედეგებზე. ამიტომ, მონაცემები, როგორც წესი, სტანდარტიზებულია საშუალო მნიშვნელობის გამოკლებით და სტანდარტულ გადახრაზე გაყოფით.

2. კოვარიაციის მატრიცა: შემდეგი ნაბიჯი სტანდარტიზებული მონაცემების კოვარიაციის მატრიცის გამოთვლაა. ეს მატრიცა გვეხმარება იმის გაგებაში, თუ როგორ იცვლება ორი ცვლადი ერთად.

3. საკუთარი მნიშვნელობა და საკუთარი ვექტორი: გამოითვლება კოვარიაციული მატრიცის საკუთარი მნიშვნელობა და საკუთარი ვექტორი. საკუთარი ვექტორი განსაზღვრავს მთავარი კომპონენტების მიმართულებას, ხოლო საკუთარი მნიშვნელობა - მათ მნიშვნელობას.

4. კომპონენტების დახარისხება: ძირითადი კომპონენტები დახარისხებულია მათი საკუთარი მნიშვნელობების მიხედვით, უდიდესიდან უმცირესამდე. ძირითადი კომპონენტების შერჩევა, როგორც წესი, საკუთარი მნიშვნელობების მიხედვით ხდება, ხოლო უფრო დიდი საკუთარი მნიშვნელობების მქონე კომპონენტები შემდგომი ანალიზისთვის შეირჩევა.

5. მონაცემთა ტრანსფორმაცია: შემდეგ საწყისი მონაცემები გარდაიქმნება ძირითადი კომპონენტების სივრცეში შემდგომი ანალიზისთვის.

PCA-ს ნაბიჯები

1. მონაცემების შეგროვება

პროსტატის ადამიანური ქცევის ანალიზის (PCA) პირველი ნაბიჯი შესაბამისი მონაცემების შეგროვებაა. ეს მონაცემები საკმარისად დიდი უნდა იყოს, რათა ანალიზმა მნიშვნელოვანი შედეგები მოგვცეს. მაგალითად, ჯანდაცვის სფეროში გამოყენებისთვის შეიძლება შეგროვდეს პაციენტის მონაცემები, როგორიცაა სიმაღლე, წონა, არტერიული წნევა და ა.შ.

წაიკითხეთ  გაყიდვების მონაცემების ანალიზი აღწერითი სტატისტიკის გამოყენებით

2. მონაცემთა სტანდარტიზაცია

მონაცემების შეგროვების შემდეგ, მასში შემავალი თითოეული მახასიათებელი (სვეტი) უნდა იყოს სტანდარტიზებული. სტანდარტიზაციის მიზანია იმის უზრუნველყოფა, რომ თითოეული მახასიათებელი თანაბრად შეიტანოს წვლილი PCA-ში, მისი საწყისი მასშტაბის მიუხედავად. სტანდარტიზაცია მიიღწევა თითოეული მახასიათებლის საშუალო მნიშვნელობის გამოკლებით და შემდეგ მისი სტანდარტულ გადახრაზე გაყოფით.

ფორმულა:
\[ Z = \frac{X – \mu}{\sigma} \]
სადაც \(X\) არის საწყისი მახასიათებლის მნიშვნელობა, \(\mu\) არის მახასიათებლის საშუალო მნიშვნელობა და \(sigma\) არის მახასიათებლის სტანდარტული გადახრა.

3. კოვარიაციის მატრიცის შექმნა

შემდეგი ნაბიჯი სტანდარტიზებული მონაცემებიდან კოვარიაციის მატრიცის შექმნაა. კოვარიაციის მატრიცა არის კვადრატული მატრიცა, რომელიც წარმოადგენს მახასიათებლების ცვალებადობას და მათ შორის ურთიერთობებს.

ფორმულა:
\[ Cov(X, Y) = E[(X – E[X])(Y – E[Y])] \]
სადაც \(E\) არის მოლოდინი ან საშუალო.

4. საკუთარი მნიშვნელობებისა და საკუთარი ვექტორების გამოთვლა

კოვარიაციის მატრიცის შექმნის შემდეგ, შემდეგი ნაბიჯი საკუთარი მნიშვნელობებისა და ვექტორების გამოთვლაა. საკუთარი ვექტორები და საკუთარი მნიშვნელობები PCA-ს ხერხემალს წარმოადგენს, რადგან ისინი განსაზღვრავენ ძირითადი კომპონენტების მიმართულებას და მნიშვნელობას. უფრო დიდი საკუთარი მნიშვნელობა მიუთითებს შესაბამისი საკუთარი ვექტორის მიერ მოცემული მიმართულებით მეტ ვარიაციაზე.

5. კომპონენტების დახარისხება საკუთარი მნიშვნელობების მიხედვით

ძირითადი კომპონენტები დალაგებულია მათი საკუთარი მნიშვნელობების მიხედვით, უდიდესიდან უმცირესამდე. მონაცემთა ცვალებადობაში ყველაზე დიდ წვლილს შეიტანს ის ძირითადი კომპონენტი, რომელსაც აქვს ყველაზე დიდი საკუთარი მნიშვნელობა.

6. შესანახი კომპონენტების რაოდენობის შერჩევა

ყველა მთავარი კომპონენტის შენარჩუნება საჭირო არ არის. კომპონენტების შერჩევა საკუთარ მნიშვნელობებს ეფუძნება. ერთ-ერთი გავრცელებული მიდგომაა „კუმულაციური ახსნილი ვარიაცია“, რომელიც მიუთითებს, თუ მონაცემებში მთლიანი ვარიაციის რა პროპორცია აიხსნება მთავარი კომპონენტების რაოდენობით.

7. მონაცემთა ტრანსფორმაცია

საბოლოო ნაბიჯი არის ორიგინალური მონაცემების გარდაქმნა არჩეული მთავარი კომპონენტების სივრცის კოორდინატებად. ამ მთავარი კომპონენტების სივრცეში არსებული მნიშვნელობები ხდება ახალი ატრიბუტები, რომელთა შემდგომი ანალიზი შესაძლებელია.

წაიკითხეთ  ფაქტორული ანალიზი სტატისტიკაში

PCA აპლიკაციები

კლასიფიკაცია და ნიმუშების ამოცნობა

სახის ამოცნობის მეთოდი (PCA) ფართოდ გამოიყენება კლასიფიკაციისა და შაბლონების ამოცნობის სფეროში. მონაცემთა განზომილებების შემცირებით, PCA კლასიფიკაციის პროცესს უფრო ეფექტურს ხდის და ამცირებს გამოთვლით სირთულეს. მაგალითად, სახის ამოცნობის შემთხვევაში, PCA ამცირებს სახეების განზომილებას სურათებში, რათა კომპიუტერებმა უფრო სწრაფად ამოიცნონ ისინი.

სურათის დამუშავება

PCA-ს შეუძლია შეამციროს გამოსახულების ზომა მნიშვნელოვანი დეტალების დაკარგვის გარეშე. ეს ტექნიკა ასევე გამოიყენება სურათებიდან ისეთი მახასიათებლების ამოსაღებად, რომელთა გამოყენება შესაძლებელია სხვადასხვა აპლიკაციებში, როგორიცაა ობიექტის ამოცნობა, კიდეების აღმოჩენა და გამოსახულების სეგმენტაცია.

გენომის მონაცემთა ანალიზი

ბიოლოგიაში გენომური მონაცემები ხშირად ძალიან დიდი და კომპლექსურია. PCA გამოიყენება გენომური მონაცემების განზომილებების შესამცირებლად, რაც აადვილებს მონაცემებში არსებული კანონზომიერებებისა და კორელაციების აღმოჩენას და ანალიზს. ეს განსაკუთრებით სასარგებლოა გენეტიკურ კვლევასა და წამლების შემუშავებაში.

ფინანსები და ეკონომიკა

PCA გამოიყენება პორტფელის რისკის ანალიზსა და აქციების ფასების პროგნოზირებაში. ფინანსური მონაცემების განზომილების შემცირებით, ანალიზს შეუძლია უფრო მეტად ფოკუსირება მოახდინოს იმ ფაქტორებზე, რომლებიც მნიშვნელოვნად მოქმედებს ბაზარზე.

დასკვნა

ძირითადი კომპონენტების ანალიზი (PCA) სტატისტიკასა და მანქანურ სწავლებაში ძლიერი ტექნიკაა. მონაცემების განზომილებების შემცირებით მნიშვნელოვანი ინფორმაციის დაკარგვის გარეშე, PCA უფრო ეფექტურ და ინტერპრეტაციულ ანალიზს იძლევა. მიუხედავად იმისა, რომ PCA ძლიერია, მნიშვნელოვანია მისი შეზღუდვების გაგება: ის მხოლოდ მაშინ არის ეფექტური, როდესაც მონაცემები წრფივად არის სტრუქტურირებული. PCA-სა და მისი პოტენციური გამოყენების გაგება საშუალებას გვაძლევს, უფრო ღრმა ინფორმაცია მივიღოთ დიდი, რთული მონაცემთა ნაკრებებიდან, რაც მას თანამედროვე მონაცემთა ანალიზის აუცილებელ ინსტრუმენტად აქცევს.

დატოვეთ კომენტარი