Статистикадағы негізгі компоненттік талдау
Пендахулуан
Негізгі компоненттік талдау (PCA) - деректер жиынтығының негізгі сипаттамаларын сақтай отырып, деректердің өлшемділігін азайту үшін қолданылатын статистикалық әдіс. Ол үлгіні тану, кескіндерді өңдеу және геномдық деректерді талдау сияқты салаларда кеңінен қолданылады, мұнда үлкен деректер көлемі түсіндіруді және өңдеуді қиындатуы мүмкін. PCA деректерді маңызды ақпаратты жоғалтпай жеңілдетуге көмектеседі, бұл оны қазіргі заманғы деректерді талдауда өте пайдалы құрал етеді.
PCA негізгі теориясы
PCA негізгі принципі - деректерді жаңа координаттар жиынына түрлендіру, мұнда деректердегі максималды өзгергіштік бірінші компонентпен, екінші ең жоғары өзгергіштік екінші компонентпен және т.б. белгіленеді. Бұл компоненттер негізгі компоненттер деп аталады. Процесс бірнеше негізгі қадамдарды қамтиды:
1. Деректерді стандарттау: Әртүрлі деректердің масштабтары әртүрлі болады, бұл PCA нәтижелеріне әсер етуі мүмкін. Сондықтан, деректер әдетте орташа мәнді алып тастау және стандартты ауытқуға бөлу арқылы стандартталады.
2. Ковариациялық матрица: Келесі қадам - стандартталған деректердің ковариациялық матрицасын есептеу. Бұл матрица екі айнымалының бірге қалай өзгеретінін түсінуге көмектеседі.
3. Меншікті мән және меншікті вектор: Ковариация матрицасының меншікті мәні мен меншікті векторы есептеледі. Меншікті вектор негізгі компоненттердің бағытын анықтайды, ал меншікті мән олардың маңыздылығын анықтайды.
4. Компоненттерді сұрыптау: Негізгі компоненттер өздерінің меншікті мәндеріне сәйкес, ең үлкенінен ең кішісіне қарай сұрыпталады. Негізгі компонентті таңдау әдетте меншікті мәндерге негізделеді, әрі қарай талдау үшін меншікті мәндері үлкенірек компоненттер таңдалады.
5. Деректерді түрлендіру: Бастапқы деректер одан әрі талдау үшін негізгі компоненттік кеңістікке түрлендіріледі.
PCA-дағы қадамдар
1. Деректерді жинау
PCA-дағы алғашқы қадам - тиісті деректерді жинау. Бұл деректер талдаудың маңызды нәтижелер беруі үшін жеткілікті үлкен болуы керек. Мысалы, денсаулық сақтау қолданбасы үшін пациенттің бойы, салмағы, қан қысымы және т.б. сияқты деректерін жинауға болады.
2. Деректерді стандарттау
Деректер жиналғаннан кейін, оның ішіндегі әрбір ерекшелік (баған) стандартталуы керек. Стандарттаудың негізгі мақсаты - әрбір ерекшеліктің бастапқы масштабына қарамастан, PCA-ға тең үлес қосуын қамтамасыз ету. Стандарттауға әрбір ерекшеліктен орташа мәнді алып тастап, содан кейін оны стандартты ауытқуға бөлу арқылы қол жеткізіледі.
Формулировкасы:
\[ Z = \frac{X – \mu}{\sigma} \]
Мұндағы \(X\) бастапқы қасиет мәні, \(\mu\) қасиеттің орташа мәні, ал \(\sigma\) қасиеттің стандартты ауытқуы.
3. Ковариация матрицасын құру
Келесі қадам - стандартталған деректерден ковариациялық матрицаны құру. Ковариациялық матрица - бұл белгілердің өзгергіштігін және олардың арасындағы байланысты көрсететін шаршы матрица.
Формулировкасы:
\[ Cov(X, Y) = E[(X – E[X])(Y – E[Y])] \]
мұндағы \(E\) - күтілетін мән немесе орташа мән.
4. Меншікті мәндерді және меншікті векторларды есептеу
Ковариациялық матрица жасалғаннан кейін, келесі қадам меншікті мәндер мен меншікті векторларды есептеу болып табылады. Меншікті векторлар мен меншікті мәндер PCA негізі болып табылады, себебі олар негізгі компоненттердің бағыты мен маңыздылығын анықтайды. Үлкен меншікті мән сәйкес меншікті вектор берген бағытта көбірек дисперсияны көрсетеді.
5. Меншікті мәндерге негізделген компоненттерді сұрыптау
Негізгі компоненттер өздерінің меншікті мәндері бойынша ең үлкенінен ең кішісіне қарай сұрыпталады. Ең үлкен меншікті мәні бар негізгі компонент деректердің өзгергіштігіне ең көп үлес қосады.
6. Сақталатын компоненттер санын таңдау
Барлық негізгі компоненттерді сақтау қажет емес. Компоненттерді таңдау меншікті мәндерге негізделген. Бір кең таралған тәсіл - «Кумулятивті түсіндірілген дисперсия», ол деректердегі жалпы дисперсияның қандай үлесі бірқатар негізгі компоненттермен түсіндірілетінін көрсетеді.
7. Деректерді түрлендіру
Соңғы қадам - бастапқы деректерді таңдалған негізгі компонент кеңістігінің координаттарына түрлендіру. Бұл негізгі компонент кеңістігіндегі мәндер әрі қарай талдауға болатын жаңа атрибуттарға айналады.
PCA қолданбалары
Жіктеу және үлгіні тану
PCA жіктеуде және үлгіні тануда кеңінен қолданылады. Деректердің өлшемділігін азайту арқылы PCA жіктеу процесін тиімдірек етеді және есептеу күрделілігін азайтады. Мысалы, бет-әлпетті тануда PCA кескіндердегі беттердің өлшемділігін азайтады, осылайша компьютерлер оларды тезірек тани алады.
Кескінді өңдеу
PCA маңызды мәліметтерді жоғалтпай кескін өлшемін кішірейте алады. Бұл әдіс сонымен қатар кескіндерден нысандарды тану, жиектерді анықтау және кескін сегментациясы сияқты әртүрлі қолданбаларда қолдануға болатын ерекшеліктерді алу үшін де қолданылады.
Геном деректерін талдау
Биологияда геномдық деректер көбінесе өте үлкен және күрделі болады. PCA геномдық деректердің өлшемділігін азайту үшін қолданылады, бұл деректердегі заңдылықтар мен корреляцияларды анықтауды және талдауды жеңілдетеді. Бұл әсіресе генетикалық зерттеулер мен дәрілік заттарды әзірлеуде пайдалы.
Қаржы және экономика
PCA портфельдік тәуекелді талдауда және акция бағасын болжауда қолданылады. Қаржылық деректердің өлшемділігін азайту арқылы талдау нарыққа айтарлықтай әсер ететін факторларға көбірек назар аудара алады.
Қорытынды
Негізгі компоненттік талдау (PCA) статистика мен машиналық оқытудағы қуатты әдіс болып табылады. Деректердің өлшемділігін маңызды ақпаратты жоғалтпай азайту арқылы PCA тиімдірек және түсіндірмелі талдауға мүмкіндік береді. PCA қуатты болғанымен, оның шектеулерін түсіну маңызды: ол деректер сызықтық құрылымдалған кезде ғана тиімді болады. PCA және оның әлеуетті қолданылуын түсіну бізге үлкен, күрделі деректер жиынтықтарынан тереңірек түсініктер алуға мүмкіндік береді, бұл оны қазіргі заманғы деректерді талдауда маңызды құрал етеді.