Kanonisk korrelationsanalys
Pendahuluan
I många studier stöter forskare ofta på situationer där det finns två uppsättningar variabler, som var och en består av flera indikatorer. Inom utbildningsområdet kan vi till exempel ha en uppsättning variabler om inlärningsfaktorer (motivation, studietimmar, familjestöd, internetåtkomst) och en uppsättning variabler om läranderesultat (matematikbetyg, språkbetyg, naturvetenskapliga betyg och betygsgenomsnitt). Den viktiga frågan är inte bara "är motivation relaterad till mattebetyg?" utan snarare "hur starkt är det övergripande sambandet mellan uppsättningen inlärningsfaktorer och uppsättningen läranderesultat?" För att besvara frågor som denna är kanonisk korrelationsanalys (CCA) en av de mest relevanta multivariata statistiska metoderna.
Kanonisk korrelationsanalys utvecklades för att mäta och förklara sambandet mellan två uppsättningar variabler samtidigt. Med andra ord utvidgar CCA konceptet enkel korrelation (mellan två variabler) till en korrelation mellan två linjära kombinationer av två uppsättningar variabler. Denna artikel diskuterar de grundläggande koncepten, målen, analysstegen, tolkningen samt fördelarna och begränsningarna med CCA.
Grundläggande koncept för kanonisk korrelation
Ordinär korrelation (t.ex. Pearson-korrelation) mäter styrkan i det linjära sambandet mellan två variabler, till exempel X och Y. CCA generaliserar detta koncept genom att bilda två nya variabler som linjära kombinationer:
– Den första kanoniska variaten för mängden X:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– Första kanoniska variabeln för mängden Y:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q
Koefficienterna a och b väljs så att korrelationen mellan U och V är maximal. Denna maximala korrelation kallas den första kanoniska korrelationen. När det första paret har erhållits kan CCA bilda efterföljande par av variabler (andra, tredje och så vidare) som är ortogonala (okorrelerade) till det föregående paret.
Antalet möjliga kanoniska variabelpar är min(p, q), vilket är det minsta antalet variabler mellan de två uppsättningarna.
Syfte och användning
CCA används när forskningsmålen är:
1. Mät styrkan i sambandet mellan två uppsättningar variabler som helhet.
2. Identifiera den mest relaterade kombinationen av variabler i mängden X och mängden Y.
3. Reducera dimensionerna av multivariata samband till flera par av variabler som är lättare att tolka.
4. Utforskning av mönster i data: vilka variabler förklarar huvudsakligen sambandet mellan de två domänerna.
Exempel på applikationskontext:
– Psykologi: förhållandet mellan uppsättningen ”personlighetsdrag” och uppsättningen ”indikatorer för psykisk hälsa”.
– Ekonomi: förhållandet mellan uppsättningen ”makroindikatorer” och uppsättningen ”arbetsmarknadsindikatorer”.
– Hälsovetenskap: sambandet mellan en uppsättning ”livsvanor” och en uppsättning ”kliniska parametrar”.
Dataantaganden och krav
Liksom många multivariata metoder har CCA ett antal antaganden som måste beaktas för att resultaten ska vara stabila och tolkningsbara:
1. Linjärt samband: CCA fångar det linjära sambandet mellan mängder. Om sambandet är icke-linjärt kan den kanoniska korrelationen underskatta sambandets styrka.
2. Multivariat normalitet: Idealiskt sett följer variabler en multivariat normalfördelning, särskilt för signifikanstestning. I praktiken används dock CCA ofta explorativt även när data inte är helt normala.
3. Det finns ingen extrem multikollinearitet i varje uppsättning: starkt korrelerade variabler kan göra koefficientuppskattningar instabila.
4. Tillräcklig urvalsstorlek: en vanlig tumregel är minst 10–20 observationer per variabel, även om forskningssammanhanget kan kräva mer.
Dessutom måste variabler vara på en jämförbar eller standardiserad skala (z-poäng) så att koefficienterna är lättare att jämföra.
Steg i kanonisk korrelationsanalys
I allmänhet inkluderar stegen i att genomföra CCA:
1. Bestäm två uppsättningar variabler
Se till att variabler grupperas baserat på teori eller konceptuellt ramverk, inte bara trial and error.
2. Datakontroll
Inklusive saknade data (saknade värden), extremvärden, normalitetstest och korrelationer inom varje uppsättning (för att detektera multikollinearitet).
3. Uppskattning av kanoniska variabler
Genererar variabelparen U₁–V₁, U₂–V₂, och så vidare.
4. Beräkning av den kanoniska korrelationen
Korrelationen mellan U_k och V_k för varje k:te par.
5. Signifikanstest
Testar om den erhållna kanoniska korrelationen statistiskt skiljer sig från noll. Vanligt förekommande tester är Wilks Lambda, Pillais spår (oftare i MANOVA), Hotellings spår och Roys största rot. I CCA är Wilks Lambda ofta det föredragna valet.
6. Tolkning av resultaten
Inkluderar bedömning av korrelationens storlek, belastningar, vikter och variabla bidrag.
Hur man läser och tolkar CCA-utdata
CCA-utdata innehåller vanligtvis flera viktiga komponenter:
1. Kanoniska korrelationer
Detta värde anger styrkan i sambandet mellan variablerna U och V i ett visst par. Till exempel indikerar en första kanonisk korrelation på 0,80 ett starkt linjärt samband mellan kombinationen av variablerna X och kombinationen av variablerna Y i den första dimensionen.
Den kanoniska R², kvadraten av den kanoniska korrelationen, rapporteras också ofta. Om r = 0,80 så är R² = 0,64, vilket innebär att ungefär 64 % av variationen i den kanoniska variabler Y kan förklaras av den kanoniska variabler X (och vice versa) på den dimensionen, i betydelsen av förhållandet mellan variablerna, inte mellan de ursprungliga variablerna.
2. Kanoniska vikter (Kanoniska vikter / Koefficienter)
Vikter är koefficienterna a och b som bildar variablerna U och V. Vikter är dock ofta känsliga för multikollinearitet, så den substantiva tolkningen förlitar sig vanligtvis inte enbart på vikter.
3. Kanoniska laddningar (kanoniska laddningar / strukturkoefficienter)
Belastning är korrelationen mellan den ursprungliga variabeln och dess kanoniska variabel. Till exempel innebär en belastning av X₂ på U₁ på 0,70 att X₂ bidrar starkt till den första kanoniska dimensionen på sidan av mängden X. Belastningar är generellt sett mer stabila och lättare att tolka än vikter.
4. Korsbelastningar
Korsbelastning är korrelationen mellan variabler från en mängd med kanoniska variabler från en annan mängd (t.ex. korrelationen mellan X₁ och V₁). Detta hjälper till att förstå vilka variabler som är närmast relaterade till dimensionerna av korsmängdsförhållandet.
5. Redundansindex
Redundansindexet anger hur mycket av variansen hos de ursprungliga variablerna i en mängd som kan förklaras av de kanoniska variablerna från en annan mängd. Detta är viktigt eftersom en hög kanonisk korrelation inte nödvändigtvis indikerar hög förklaringskraft för de ursprungliga variablerna. Redundans används ofta för att bedöma praktiskt värde (inte bara statistisk signifikans).
Enkel illustration
Anta att en studie undersöker sambandet mellan:
– Set X (arbetsförhållanden): X₁ = arbetsbelastning, X₂ = stöd för handledare, X₃ = flexibilitet i arbetstider
– Mängd Y (välbefinnande): Y₁ = stress, Y₂ = arbetstillfredsställelse, Y₃ = sömnkvalitet
CCA kan finna en signifikant första kanonisk korrelation på r = 0,75. Belastningar indikerar att arbetsbelastning och handledares stöd starkast bildar U₁, medan stress och arbetstillfredsställelse starkast bildar V₁. Den substantiva tolkningen: huvuddimensionen av sambandet mellan arbetsförhållanden och välbefinnande är kombinationen av "arbetspress kontra stöd" som är nära relaterad till "stress och tillfredsställelse".
Fördelar med kanonisk korrelationsanalys
1. Omfattande: fångar sambandet mellan två uppsättningar variabler samtidigt.
2. Minska risken för upprepad testning: jämfört med att utföra många en-i-en-korrelationer vilket ökar risken för typ I-fel.
3. Hjälper till att hitta latenta strukturer: avslöjar dimensioner av samband som inte är synliga från univariat analys.
Begränsningar och utmaningar
1. Tolkning kan vara komplex: många komponenter (vikter, belastningar, redundanser) måste ses tillsammans.
2. Känslig för multikollinearitet och små urvalsstorlekar: kan producera instabila koefficienter.
3. Linjära till sin natur: icke-linjära samband registreras inte om inte en transformation eller annan metod utförs.
4. Kräver en teoretisk grund: utan ett tydligt konceptuellt ramverk blir tolkningen av kanoniska dimensioner tenderar att bli spekulativ.
Stängning
Kanonisk korrelationsanalys är en kraftfull multivariat metod för att förstå sambandet mellan två uppsättningar variabler samtidigt. Genom att konstruera kanoniska variabler som maximerar korsmängdskorrelationer, gör CCA det möjligt för forskare att se mer omfattande mönster av samband än enkel korrelation eller enstaka regressioner. Dess användning kräver dock uppmärksamhet på antaganden, datakvalitet och lämpliga tolkningsstrategier (särskilt med betoning på belastningar, korsbelastningar och redundans). I forskning som involverar flera indikatorer över två primära domäner kan CCA vara ett kraftfullt verktyg för att utforska och sammanfatta komplexa samband i meningsfulla dimensioner.