Канонска корелација анализа

Канонска корелација анализа

Пендахулуан
Во многу студии, истражувачите често се среќаваат со ситуации каде што постојат два сета променливи, секој составен од неколку индикатори. На пример, во областа на образованието, може да имаме сет променливи за факторите на учење (мотивација, часови на учење, семејна поддршка, пристап до интернет) и сет променливи за резултатите од учењето (оценки по математика, оценки по јазик, оценки по природни науки и просечни оценки). Важното прашање не е едноставно „дали мотивацијата е поврзана со оценките по математика?“, туку „колку е силна целокупната врска помеѓу сет фактори на учење и сет резултати од учење?“. За да се одговори на вакви прашања, Канонската корелација (CCA) е еден од најрелевантните мултиваријантни статистички методи.

Канонската корелација е развиена за мерење и објаснување на врската помеѓу два сета променливи истовремено. Со други зборови, CCA го проширува концептот на едноставна корелација (помеѓу две променливи) на корелација помеѓу две линеарни комбинации од два сета променливи. Оваа статија ги дискутира основните концепти, цели, чекори на анализа, толкување и предности и ограничувања на CCA.

Основен концепт на канонска корелација
Обичната корелација (на пр. Пирсонова корелација) ја мери јачината на линеарната врска помеѓу две променливи, да речеме X и Y. CCA го генерализира овој концепт со формирање на две нови променливи како линеарни комбинации:

– Првата канонска променлива за множеството X:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– Прва канонска променлива за множеството Y:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q

Коефициентите a и b се избираат така што корелацијата помеѓу U и V е максимална. Оваа максимална корелација се нарекува прва канонска корелација. Откако ќе се добие првиот пар, CCA може да формира последователни парови на променливи (втора, трета и така натаму) кои се ортогонални (некорелирани) со претходниот пар.

Бројот на можни канонски парови на варијабли е min(p, q), што е најмалиот број на варијабли помеѓу двата множества.

Намена и употреба
CCA се користи кога целите на истражувањето се:

1. Измерете ја јачината на поврзаноста помеѓу два сета променливи како целина.
2. Идентификувајте ја најповрзаната комбинација на променливи во множеството X и множеството Y.
3. Намалете ги димензиите на повеќеваријантните односи на неколку парови променливи што се полесни за толкување.
4. Истражување на шеми во податоците: кои променливи претежно го објаснуваат односот помеѓу двата домени.

Пример контекст на апликација:
– Психологија: односот помеѓу збирот на „црти на личноста“ и збирот на „индикатори за ментално здравје“.
– Економија: односот помеѓу множеството „макро индикатори“ и множеството „индикатори на пазарот на трудот“.
– Здравствена наука: односот помеѓу збир на „животни навики“ и збир на „клинички параметри“.

Претпоставки и барања за податоци
Како и многу повеќеваријантни методи, CCA има голем број претпоставки што треба да се земат предвид за резултатите да бидат стабилни и интерпретабилни:

1. Линеарна врска: CCA ја опфаќа линеарната врска помеѓу множествата. Ако врската е нелинеарна, канонската корелација може да ја потцени јачината на врската.
2. Мултиваријантна нормалност: Идеално, променливите следат мултиваријантна нормална распределба, особено за тестирање на значајност. Сепак, во пракса, CCA често се користи истражувачки дури и кога податоците не се целосно нормални.
3. Не постои екстремна мултиколинеарност во секој сет: високо корелираните променливи можат да ги направат проценките на коефициентите нестабилни.
4. Соодветна големина на примерокот: општо правило е минимум 10-20 набљудувања по променлива, иако контекстот на истражувањето може да бара повеќе.

Покрај тоа, варијаблите треба да бидат на споредлива или стандардизирана скала (z-score), така што коефициентите полесно се споредуваат.

Чекори на анализа на канонска корелација
Општо земено, фазите на спроведување на CCA вклучуваат:

1. Определете два сета променливи
Погрижете се променливите да се групираат врз основа на теорија или концептуална рамка, а не само врз основа на обиди и грешки.

2. Проверка на податоци
Вклучувајќи недостасувачки податоци (недостасувачки вредности), отстапувања, тестови за нормалност и корелации во рамките на секој сет (за откривање на мултиколинеарност).

3. Проценка на канонски варијабли
Генерира варијабилни парови U₁–V₁, U₂–V₂ и така натаму.

4. Пресметување на канонската корелација
Корелацијата помеѓу U_k и V_k за секој k-ти пар.

5. Тест за значајност
Тестира дали добиената канонска корелација е статистички различна од нула. Најчесто користени тестови се Вилксовата ламбда, Пилаиовата трага (почесто во MANOVA), Хотелинговата трага и Ројовиот најголем корен. Во CCA, Вилксовата ламбда е често претпочитаниот избор.

6. Интерпретација на резултатите
Вклучува проценка на големината на корелацијата, оптоварувањата, тежините и варијабилните придонеси.

Како да се чита и толкува CCA излезот
CCA излезот обично вклучува неколку важни компоненти:

1. Канонски корелации
Оваа вредност ја означува јачината на врската помеѓу променливите U и V во одреден пар. На пример, прва канонска корелација од 0,80 укажува на силна линеарна врска помеѓу комбинацијата на променливи X и комбинацијата на променливи Y во првата димензија.

Често се наведува и канонскиот R², квадратот на канонската корелација. Ако r = 0,80, тогаш R² = 0,64, што значи дека приближно 64% ​​од варијацијата во канонската варијабла Y може да се објасни со канонската варијабла X (и обратно) на таа димензија, во смисла на односот помеѓу варијабите, а не помеѓу оригиналните варијабли.

2. Канонски тежини (Канонски тежини / коефициенти)
Тежините се коефициентите a и b што ги формираат променливите U и V. Сепак, тежините често се чувствителни на мултиколинеарност, така што суштинската интерпретација обично не се потпира само на тежините.

3. Канонски оптоварувања (Канонски оптоварувања / Коефициенти на структурата)
Оптоварувањето е корелацијата помеѓу оригиналната променлива и нејзината канонска променлива. На пример, оптоварувањето на X₂ на U₁ од 0,70 значи дека X₂ силно придонесува за првата канонска димензија на страната од множеството X. Оптоварувањата се генерално постабилни и полесни за толкување од тежините.

4. Вкрстени оптоварувања
Вкрстеното оптоварување е корелација помеѓу променливите од еден сет со канонски променливи од друг сет (на пр., корелацијата на X₁ со V₁). Ова помага да се разбере кои променливи се најтесно поврзани со димензиите на вкрстената врска помеѓу множествата.

5. Индекс на вишок
Индексот на редундантност покажува колку од варијансата на оригиналните променливи во еден сет може да се објасни со канонските променливи од друг сет. Ова е важно бидејќи високата канонска корелација не мора нужно да укажува на висока објаснувачка моќ за оригиналните променливи. Редундантноста често се користи за проценка на практичната вредност (не само статистичка значајност).

Едноставна илустрација
Да претпоставиме дека една студија го испитува односот помеѓу:

– Поставете X (услови за работа): X₁ = работно оптоварување, X₂ = поддршка од надзорникот, X₃ = флексибилност на работното време
– Поставете Y (благосостојба): Y₁ = стрес, Y₂ = задоволство од работата, Y₃ = квалитет на спиење

CCA може да пронајде значајна прва канонска корелација од r = 0,75. Оптоварувањата покажуваат дека работното оптоварување и поддршката од надзорникот најсилно го формираат U₁, додека стресот и задоволството од работата најсилно го формираат V₁. Суштинско толкување: главната димензија на односот помеѓу работните услови и благосостојбата е комбинацијата од „притисок на работата наспроти поддршка“ што е тесно поврзано со „стрес и задоволство“.

Предности на канонската корелација
1. Сеопфатно: го опфаќа односот помеѓу два сета променливи одеднаш.
2. Намалување на ризикот од повторено тестирање: во споредба со извршување на многу корелации еден по еден, што ја зголемува можноста за грешка од тип I.
3. Помага да се пронајдат латентни структури: открива димензии на врски кои не се видливи од униваријантната анализа.

Ограничувања и предизвици
1. Интерпретацијата може да биде комплексна: многу компоненти (тежини, оптоварувања, редундантности) мора да се гледаат заедно.
2. Чувствителни на мултиколинеарност и мали примероци: можат да произведат нестабилни коефициенти.
3. Линеарни по природа: нелинеарните врски не се евидентираат освен ако не се изврши трансформација или друг пристап.
4. Потребна е теоретска основа: без јасна концептуална рамка, толкувањето на канонските димензии е склоно кон шпекулативно.

Затворање
Канонската корелација е моќен метод со повеќе варијации за разбирање на врската помеѓу два сета променливи истовремено. Со конструирање на канонски променливи што ги максимизираат корелациите меѓу вкрстените сетови, CCA им овозможува на истражувачите да видат посеопфатни шеми на врски отколку едноставната корелација или единечната регресија. Сепак, нејзината употреба бара внимание на претпоставките, квалитетот на податоците и соодветни стратегии за толкување (особено со акцент на вчитувањата, вкрстените вчитувања и редундантноста). Во истражувањата што вклучуваат повеќе индикатори низ две примарни домени, CCA може да биде моќна алатка за истражување и сумирање на сложени врски во значајни димензии.

Tinggalkan коментар