정준 상관 분석

정준 상관 분석

펜다훌루안
많은 연구에서 연구자들은 종종 여러 지표로 구성된 두 가지 변수 집합을 접하게 됩니다. 예를 들어 교육 분야에서는 학습 요인(동기 부여, 학습 시간, 가족 지원, 인터넷 접근성)에 관한 변수 집합과 학습 결과(수학 성적, 외국어 성적, 과학 성적, 평균 학점)에 관한 변수 집합이 있을 수 있습니다. 여기서 중요한 질문은 단순히 "동기 부여가 수학 성적과 관련이 있는가?"가 아니라 "학습 요인 집합과 학습 결과 집합 간의 전반적인 상관관계는 얼마나 강한가?"입니다. 이러한 질문에 답하기 위해 정준상관분석(CCA)은 가장 적합한 다변량 통계 방법 중 하나입니다.

정준상관분석(CCA)은 두 변수 집합 간의 관계를 동시에 측정하고 설명하기 위해 개발된 분석 방법입니다. 다시 말해, CCA는 단순 상관관계(두 변수 간의 상관관계)의 개념을 두 변수 집합의 선형 조합 간의 상관관계로 확장한 것입니다. 본 논문에서는 CCA의 기본 개념, 목적, 분석 단계, 해석, 장점 및 한계에 대해 논의합니다.

정준 상관관계의 기본 개념
일반적인 상관관계(예: 피어슨 상관계수)는 두 변수(예: X와 Y) 사이의 선형 관계의 강도를 측정합니다. CCA는 두 개의 새로운 변수를 선형 조합으로 구성함으로써 이 개념을 일반화합니다.

– 집합 X에 대한 첫 번째 정규 변량:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– 집합 Y에 대한 첫 번째 정규 변량:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q

계수 a와 b는 U와 V 사이의 상관관계가 최대가 되도록 선택됩니다. 이 최대 상관관계를 제1 정준상관이라고 합니다. 첫 번째 쌍이 얻어지면, CCA는 이전 쌍과 직교하는(상관관계가 없는) 후속 변수 쌍(제2, 제3 등)을 생성할 수 있습니다.

가능한 정규 변량 쌍의 수는 min(p, q)이며, 이는 두 집합 간의 변수 개수 중 가장 작은 값입니다.

목적 및 사용
CCA는 연구 목표가 다음과 같을 때 사용됩니다.

1. 두 변수 집합 간의 연관성 강도를 전체적으로 측정합니다.
2. 집합 X와 집합 Y에서 가장 관련성이 높은 변수 조합을 찾으십시오.
3. 다변량 관계의 차원을 해석하기 쉬운 몇 개의 변수 쌍으로 축소합니다.
4. 데이터 패턴 탐색: 두 영역 간의 관계를 주로 설명하는 변수는 무엇인가?

예시 애플리케이션 컨텍스트:
– 심리학: “성격 특성”과 “정신 건강 지표” 간의 관계.
– 경제: 거시 경제 지표와 노동 시장 지표 간의 관계.
건강 과학: 일련의 "생활 습관"과 일련의 "임상 매개변수" 간의 관계.

데이터 가정 및 요구 사항
다른 많은 다변량 분석 방법과 마찬가지로, CCA는 결과가 안정적이고 해석 가능하려면 고려해야 할 몇 가지 가정을 가지고 있습니다.

1. 선형 관계: CCA는 집합 간의 선형 관계를 포착합니다. 관계가 비선형일 경우, 정규 상관 계수는 관계의 강도를 과소평가할 수 있습니다.
2. 다변량 정규성: 이상적으로는, 특히 유의성 검정의 경우, 변수들은 다변량 정규 분포를 따라야 합니다. 그러나 실제로는 데이터가 완전히 정규 분포를 따르지 않더라도 CCA가 탐색적으로 사용되는 경우가 많습니다.
3. 각 데이터 세트에는 극심한 다중공선성이 없습니다. 상관관계가 높은 변수는 계수 추정치를 불안정하게 만들 수 있습니다.
4. 적절한 표본 크기: 일반적으로 변수당 최소 10~20개의 관측치가 필요하지만, 연구 상황에 따라 더 많은 관측치가 필요할 수도 있습니다.

또한, 계수를 더 쉽게 비교할 수 있도록 변수들은 비교 가능한 또는 표준화된 척도(z-점수)로 나타내야 합니다.

정준 상관 분석의 단계
일반적으로 CCA 수행 단계는 다음과 같습니다.

1. 두 개의 변수 집합을 결정합니다.
변수들을 단순히 시행착오를 통해 그룹화하는 것이 아니라, 이론이나 개념적 틀에 기반하여 그룹화해야 합니다.

2. 데이터 확인
결측값, 이상치, 정규성 검사, 각 데이터 세트 내 상관관계 분석(다중공선성 탐지) 등을 포함합니다.

3. 정준변수 추정
U₁–V₁, U₂–V₂ 등과 같은 변수 쌍을 생성합니다.

4. 정준 상관관계 계산
각 k번째 쌍에 대한 U_k와 V_k 사이의 상관관계.

5. 유의성 검정
얻어진 정준상관관계가 통계적으로 0과 다른지 여부를 검정합니다. 일반적으로 사용되는 검정으로는 Wilks' Lambda, Pillai's Trace(MANOVA에서 더 자주 사용됨), Hotelling's Trace, Roy's Largest Root 등이 있습니다. CCA에서는 Wilks' Lambda가 선호되는 경우가 많습니다.

6. 결과 해석
상관관계의 크기, 요인 부하량, 가중치 및 변수 기여도에 대한 평가가 포함됩니다.

CCA 출력 결과를 읽고 해석하는 방법
CCA 출력에는 일반적으로 다음과 같은 몇 가지 중요한 구성 요소가 포함됩니다.

1. 정준 상관관계
이 값은 특정 쌍에서 변수 U와 V 사이의 관계 강도를 나타냅니다. 예를 들어, 제1 정규 상관계수가 0,80이면 첫 번째 차원에서 변수 X의 조합과 변수 Y의 조합 사이에 강한 선형 관계가 있음을 의미합니다.

정준 상관계수의 제곱인 정준 R² 값도 종종 보고됩니다. 예를 들어 r = 0,80이면 R² = 0,64인데, 이는 정준 변수 Y의 변동 중 약 64%가 정준 변수 X에 의해 설명될 수 있음을 의미합니다(그리고 그 반대의 경우도 마찬가지입니다). 여기서 말하는 변동은 변수들 간의 관계를 나타내는 것이지, 원래 변수들 사이의 관계를 나타내는 것은 아닙니다.

2. 정규 가중치 (정규 가중치/계수)
가중치는 변수 U와 V를 구성하는 계수 a와 b입니다. 그러나 가중치는 다중공선성에 민감한 경우가 많으므로 실질적인 해석은 일반적으로 가중치에만 의존하지 않습니다.

3. 정규 적재량 (정규 적재량 / 구조 계수)
로딩은 원변수와 해당 정규변수 간의 상관관계를 나타냅니다. 예를 들어, X₂의 U₁에 대한 로딩이 0,70이라는 것은 X₂가 집합 X 측의 첫 번째 정규차원에 강하게 기여한다는 것을 의미합니다. 로딩은 일반적으로 가중치보다 안정적이고 해석하기 쉽습니다.

4. 교차 하중
교차적재(Cross-loading)는 한 집합의 변수와 다른 집합의 표준 변수 간의 상관관계를 나타냅니다(예: X₁과 V₁의 상관관계). 이를 통해 어떤 변수가 집합 간 관계의 차원과 가장 밀접하게 관련되어 있는지 파악할 수 있습니다.

5. 중복성 지수
중복성 지수는 한 데이터 세트의 원래 변수들의 분산 중 얼마나 많은 부분이 다른 데이터 세트의 정규 변수들에 의해 설명될 수 있는지를 나타냅니다. 정규 상관계수가 높다고 해서 원래 변수들의 설명력이 반드시 높은 것은 아니기 때문에 이는 중요한 지표입니다. 중복성은 통계적 유의성뿐 아니라 실제적인 가치를 평가하는 데에도 자주 사용됩니다.

간단한 일러스트레이션
어떤 연구에서 다음과 같은 관계를 조사한다고 가정해 봅시다.

– 근무 조건 X 설정: X₁ = 업무량, X₂ = 상사 지원, X₃ = 근무 시간 유연성
– Y(웰빙) 집합: Y₁ = 스트레스, Y₂ = 직무 만족도, Y₃ = 수면의 질

CCA 분석 결과, 첫 번째 정규 상관계수 r = 0,75로 유의미한 값을 나타냈습니다. 요인 부하량 분석에 따르면, 업무량과 상사 지원은 U₁을 가장 강력하게 형성하는 반면, 스트레스와 직무 만족도는 V₁을 가장 강력하게 형성합니다. 실질적인 해석은 다음과 같습니다. 근무 조건과 웰빙 간의 관계를 나타내는 주요 차원은 "업무 압력 대 지원"의 조합이며, 이는 "스트레스 및 만족도"와 밀접한 관련이 있습니다.

정준 상관 분석의 장점
1. 포괄적: 두 변수 집합 간의 관계를 한 번에 파악합니다.
2. 반복 테스트 위험 감소: 여러 번 일대일 상관관계를 수행하는 것과 비교하면 제1종 오류 발생 가능성이 높아집니다.
3. 잠재 구조를 찾는 데 도움이 됩니다. 단변량 분석에서는 드러나지 않는 관계의 차원을 보여줍니다.

제한사항 및 과제
1. 해석은 복잡할 수 있습니다. 여러 구성 요소(가중치, 부하, 중복성)를 함께 고려해야 합니다.
2. 다중공선성과 작은 표본 크기에 민감하여 불안정한 계수를 생성할 수 있습니다.
3. 본질적으로 선형적입니다. 비선형 관계는 변환이나 다른 접근 방식을 수행하지 않는 한 포착되지 않습니다.
4. 이론적 기반이 필요합니다. 명확한 개념적 틀이 없으면 정전적 차원에 대한 해석은 추측에 의존하기 쉽습니다.

폐회
정준상관분석(CCA)은 두 변수 집합 간의 관계를 동시에 이해하는 데 유용한 다변량 분석 방법입니다. CCA는 변수 집합 간 상관관계를 최대화하는 정준변수를 구성함으로써 단순 상관분석이나 단일 회귀분석보다 더 포괄적인 관계 패턴을 파악할 수 있도록 해줍니다. 그러나 CCA를 효과적으로 활용하려면 가정, 데이터 품질, 그리고 적절한 해석 전략(특히 요인 부하량, 교차 부하량, 중복성에 대한 고려)에 주의를 기울여야 합니다. 두 가지 주요 영역에 걸쳐 여러 지표를 사용하는 연구에서 CCA는 복잡한 관계를 의미 있는 차원으로 탐색하고 요약하는 데 강력한 도구가 될 수 있습니다.

댓글을 남겨주세요