Каноничен корелационен анализ
Пендахулуан
В много изследвания изследователите често се сблъскват със ситуации, в които има два набора от променливи, всеки от които се състои от няколко показателя. Например, в областта на образованието може да имаме набор от променливи за учебните фактори (мотивация, учебни часове, семейна подкрепа, достъп до интернет) и набор от променливи за учебните резултати (оценки по математика, оценки по езици, оценки по природни науки и средни оценки). Важният въпрос не е просто „свързана ли е мотивацията с оценките по математика?“, а по-скоро „колко силна е общата връзка между набора от учебни фактори и набора от учебни резултати?“. За да се отговори на подобни въпроси, Каноничният корелационен анализ (ККА) е един от най-подходящите многовариантни статистически методи.
Каноничният корелационен анализ е разработен, за да измерва и обяснява връзката между два набора от променливи едновременно. С други думи, CCA разширява концепцията за проста корелация (между две променливи) до корелация между две линейни комбинации от два набора от променливи. Тази статия разглежда основните понятия, цели, стъпки на анализ, интерпретация, както и предимствата и ограниченията на CCA.
Основна концепция за канонична корелация
Обикновената корелация (напр. корелация на Пиърсън) измерва силата на линейната връзка между две променливи, например X и Y. CCA обобщава тази концепция, като образува две нови променливи като линейни комбинации:
– Първата канонична променлива за множеството X:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– Първа канонична променлива за множеството Y:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q
Коефициентите a и b са избрани така, че корелацията между U и V да е максимална. Тази максимална корелация се нарича първа канонична корелация. След като първата двойка бъде получена, CCA може да формира следващи двойки променливи (втора, трета и т.н.), които са ортогонални (некорелирани) на предишната двойка.
Броят на възможните канонични двойки променливи е min(p, q), което е най-малкият брой променливи между двата множества.
Предназначение и употреба
CCA се използва, когато целите на изследването са:
1. Измерете силата на връзката между два набора от променливи като цяло.
2. Определете най-свързаната комбинация от променливи в множество X и множество Y.
3. Намалете измеренията на многовариантните зависимости до няколко двойки променливи, които са по-лесни за интерпретация.
4. Изследване на модели в данните: кои променливи преобладаващо обясняват връзката между двете области.
Примерен контекст на приложението:
– Психология: връзката между набора от „личностни черти“ и набора от „индикатори за психично здраве“.
– Икономика: връзката между набора от „макроиндикатори“ и набора от „индикатори на пазара на труда“.
– Здравни науки: връзката между набор от „житейски навици“ и набор от „клинични параметри“.
Предположения и изисквания за данни
Подобно на много многовариантни методи, CCA има редица допускания, които трябва да се вземат предвид, за да бъдат резултатите стабилни и интерпретируеми:
1. Линейна зависимост: CCA улавя линейната зависимост между множествата. Ако зависимостта е нелинейна, каноничната корелация може да подцени силата на зависимостта.
2. Многовариантна нормалност: В идеалния случай променливите следват многовариантно нормално разпределение, особено за тестване на значимост. На практика обаче CCA често се използва изследователски, дори когато данните не са напълно нормални.
3. Няма екстремна мултиколинеарност във всеки набор: силно корелираните променливи могат да направят оценките на коефициентите нестабилни.
4. Адекватен размер на извадката: общоприето правило е минимум 10–20 наблюдения на променлива, въпреки че изследователският контекст може да изисква повече.
Освен това, променливите трябва да са в сравнима или стандартизирана скала (z-оценка), така че коефициентите да са по-лесни за сравнение.
Стъпки на каноничния корелационен анализ
Като цяло, етапите на провеждане на CCA включват:
1. Определете два набора от променливи
Уверете се, че променливите са групирани въз основа на теория или концептуална рамка, а не само на метода проба-грешка.
2. Проверка на данните
Включително липсващи данни (липсващи стойности), отклонения, тестове за нормалност и корелации във всеки набор (за откриване на мултиколинеарност).
3. Оценяване на канонични променливи
Генерира двойки променливи U₁–V₁, U₂–V₂ и т.н.
4. Изчисляване на каноничната корелация
Корелацията между U_k и V_k за всяка k-та двойка.
5. Тест за значимост
Тества дали получената канонична корелация е статистически различна от нула. Често използваните тестове са ламбда на Уилкс, следа на Пилай (по-често в MANOVA), следа на Хотелинг и най-голям корен на Рой. В CCA ламбда на Уилкс често е предпочитаният избор.
6. Интерпретация на резултатите
Включва оценка на величината на корелация, натоварванията, теглата и променливите приноси.
Как да четем и интерпретираме изхода на CCA
Резултатът от CCA обикновено включва няколко важни компонента:
1. Канонични корелации
Тази стойност показва силата на връзката между променливите U и V в дадена двойка. Например, първа канонична корелация от 0,80 показва силна линейна връзка между комбинацията от променливи X и комбинацията от променливи Y в първото измерение.
Каноничният R², квадратът на каноничната корелация, също често се посочва. Ако r = 0,80, тогава R² = 0,64, което означава, че приблизително 64% от вариацията в каноничната променлива Y може да се обясни с каноничната променлива X (и обратно) в това измерение, в смисъл на връзката между променливите, а не между оригиналните променливи.
2. Канонични тегла (Канонични тегла / Коефициенти)
Теглата са коефициентите a и b, които формират променливите U и V. Теглата обаче често са чувствителни към мултиколинеарност, така че съществената интерпретация обикновено не се основава единствено на тегла.
3. Канонични натоварвания (Канонични натоварвания / Коефициенти на конструкцията)
Натоварването е корелацията между оригиналната променлива и нейната канонична вариация. Например, натоварване на X₂ върху U₁ от 0,70 означава, че X₂ допринася силно за първото канонично измерение от страната на множеството X. Натоварванията обикновено са по-стабилни и по-лесни за интерпретация от теглата.
4. Кръстосани товари
Кръстосаното натоварване е корелацията между променливи от един набор с канонични променливи от друг набор (напр. корелацията на X₁ с V₁). Това помага да се разбере кои променливи са най-тясно свързани с измеренията на взаимовръзката между наборите.
5. Индекс на излишък
Индексът на излишък показва каква част от дисперсията на оригиналните променливи в един набор може да бъде обяснена с каноничните променливи от друг набор. Това е важно, защото високата канонична корелация не означава непременно висока обяснителна сила за оригиналните променливи. Излишъкът често се използва за оценка на практическата стойност (не само на статистическата значимост).
Проста илюстрация
Да предположим, че едно проучване разглежда връзката между:
– Множество X (условия на труд): X₁ = работно натоварване, X₂ = подкрепа на ръководителя, X₃ = гъвкаво работно време
– Задайте Y (благополучие): Y₁ = стрес, Y₂ = удовлетвореност от работата, Y₃ = качество на съня
CCA може да открие значима първа канонична корелация от r = 0,75. Натоварванията показват, че работното натоварване и подкрепата от ръководителя най-силно формират U₁, докато стресът и удовлетворението от работата най-силно формират V₁. Съществителната интерпретация: основното измерение на връзката между условията на труд и благополучието е комбинацията от „работно напрежение срещу подкрепа“, която е тясно свързана със „стрес и удовлетворение“.
Предимства на каноничния корелационен анализ
1. Изчерпателна: обхваща връзката между два набора от променливи едновременно.
2. Намалете риска от многократно тестване: в сравнение с извършването на много корелации една по една, което увеличава вероятността от грешка от тип I.
3. Помага за откриването на латентни структури: разкрива измерения на взаимовръзките, които не са видими от еднофакторния анализ.
Ограничения и предизвикателства
1. Интерпретацията може да бъде сложна: много компоненти (тегла, натоварвания, излишъци) трябва да се разглеждат заедно.
2. Чувствителен към мултиколинеарност и малки размери на извадките: може да доведе до нестабилни коефициенти.
3. Линейни по природа: нелинейните зависимости не се улавят, освен ако не се извърши трансформация или друг подход.
4. Изисква теоретична основа: без ясна концептуална рамка, интерпретацията на каноничните измерения е склонна към спекулации.
Затваряне
Каноничният корелационен анализ (CCA) е мощен многовариантен метод за едновременно разбиране на връзката между два набора от променливи. Чрез конструиране на канонични променливи, които максимизират кръстосаните корелации, CCA позволява на изследователите да видят по-цялостни модели на връзки, отколкото простата корелация или единичната регресия. Използването му обаче изисква внимание към допусканията, качеството на данните и подходящи стратегии за интерпретация (особено с акцент върху натоварванията, кръстосаните натоварвания и излишъка). В изследвания, включващи множество показатели в две основни области, CCA може да бъде мощен инструмент за изследване и обобщаване на сложни връзки в смислени измерения.