典型相关分析
彭达胡乱
在许多研究中,研究人员经常会遇到存在两组变量的情况,每组变量又包含若干指标。例如,在教育领域,我们可能拥有一组关于学习因素的变量(例如学习动机、学习时间、家庭支持、网络接入等),以及一组关于学习结果的变量(例如数学成绩、语言成绩、科学成绩和平均绩点)。重要的问题并非仅仅是“学习动机是否与数学成绩相关?”,而是“学习因素组和学习结果组之间的整体相关性有多强?”为了回答这类问题,典型相关分析(CCA)是最相关的多元统计方法之一。
典型相关分析(CCA)旨在同时测量和解释两组变量之间的关系。换句话说,CCA 将简单相关(两个变量之间的相关)的概念扩展到两组变量的两个线性组合之间的相关性。本文将探讨 CCA 的基本概念、目标、分析步骤、结果解释、优势和局限性。
典型相关的基本概念
普通相关性(例如皮尔逊相关系数)衡量两个变量(例如 X 和 Y)之间线性关系的强度。典型相关分析 (CCA) 通过将两个新变量线性组合起来,推广了这一概念:
– 集合 X 的第一个典型变量:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– 集合 Y 的第一个典型变量:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q
选择系数 a 和 b 的目的是使 U 和 V 之间的相关性最大。这个最大相关性称为第一典型相关系数。一旦获得第一对变量,CCA 就可以形成后续的变量对(第二对、第三对等等),这些变量对与前一对变量正交(不相关)。
可能的典型变量对的数量为 min(p, q),即两组变量中变量数最少的那个。
用途
当研究目标为以下情况时,会使用典型相关分析(CCA):
1. 衡量两组变量之间整体关联的强度。
2. 找出集合 X 和集合 Y 中最相关的变量组合。
3. 将多元关系的维度降低为几对更容易解释的变量。
4. 探索数据中的模式:哪些变量主要解释了两个领域之间的关系。
应用示例:
– 心理学:一组“人格特质”与一组“心理健康指标”之间的关系。
– 经济:宏观指标集与劳动力市场指标集之间的关系。
– 健康科学:一系列“生活习惯”与一系列“临床参数”之间的关系。
数据假设和要求
与许多多元方法一样,CCA 也有许多假设需要考虑,才能使结果稳定且可解释:
1. 线性关系:典型相关分析 (CCA) 捕捉的是数据集之间的线性关系。如果关系是非线性的,典型相关分析可能会低估关系的强度。
2. 多元正态性:理想情况下,变量应服从多元正态分布,尤其是在进行显著性检验时。然而,在实践中,即使数据并非完全正态分布,也常常会使用典型相关分析 (CCA) 进行探索性分析。
3. 每个集合中不存在极端的多重共线性:高度相关的变量会导致系数估计不稳定。
4. 足够的样本量:通常的经验法则是每个变量至少需要 10-20 个观测值,尽管研究背景可能需要更多。
此外,变量需要处于可比或标准化的尺度(z 分数),以便更容易比较系数。
典型相关分析的步骤
一般来说,CCA 的实施步骤包括:
1. 确定两组变量
确保变量是根据理论或概念框架进行分组的,而不是仅仅依靠反复试验。
2. 数据核查
包括缺失数据(缺失值)、异常值、正态性检验以及每组数据内的相关性(以检测多重共线性)。
3. 估计典型变量
生成变量对 U₁–V₁、U₂–V₂ 等。
4. 计算典型相关系数
对于每一对第 k 个 U_k 和 V_k,它们的相关性。
5. 显著性检验
检验所得典型相关系数是否在统计学上显著异于零。常用的检验方法包括威尔克斯λ检验、皮莱迹检验(常用于多元方差分析)、霍特林迹检验和罗伊最大根检验。在典型相关分析中,威尔克斯λ检验通常是首选方法。
6. 结果解读
包括对相关性大小、载荷、权重和变量贡献的评估。
如何解读 CCA 输出结果
CCA 输出通常包含几个重要组成部分:
1.典型相关系数
该值表示特定变量对中变量 U 和 V 之间关系的强度。例如,第一典型相关系数为 0,80 表示第一维度中变量 X 的组合与变量 Y 的组合之间存在很强的线性关系。
典型相关系数R²(即典型相关系数的平方)也经常被报告。如果r = 0,80,则R² = 0,64,这意味着在该维度上,典型变量Y的变异大约有64%可以由典型变量X解释(反之亦然),这里指的是变量之间的关系,而不是原始变量之间的关系。
2. 典型权重(典型权重/系数)
权重是构成变量 U 和 V 的系数 a 和 b。然而,权重通常对多重共线性很敏感,因此实质性解释通常不能仅仅依赖于权重。
3. 典型载荷(典型载荷/结构系数)
载荷是指原始变量与其典型变量之间的相关性。例如,X₂ 在 U₁ 上的载荷为 0,70,意味着 X₂ 对集合 X 一侧的第一典型维度贡献较大。载荷通常比权重更稳定,也更容易解释。
4. 横向载荷
交叉载荷是指一个数据集中的变量与另一个数据集中的典型变量之间的相关性(例如,X₁ 与 V₁ 的相关性)。这有助于理解哪些变量与交叉数据集关系的各个维度最为密切相关。
5. 冗余指数
冗余指数表明,一组原始变量的方差有多少可以由另一组典型变量解释。这一点很重要,因为高典型相关系数并不一定意味着对原始变量具有很高的解释力。冗余指数通常用于评估实际价值(而不仅仅是统计显著性)。
简图
假设一项研究考察了以下两者之间的关系:
– 设置 X(工作条件):X₁ = 工作量,X₂ = 主管支持,X₃ = 工作时间的灵活性
– 设定 Y(幸福感):Y₁ = 压力,Y₂ = 工作满意度,Y₃ = 睡眠质量
CCA分析可能发现显著的第一典型相关系数r = 0,75。载荷表明,工作负荷和主管支持对U₁的影响最大,而压力和工作满意度对V₁的影响最大。实质解释:工作条件与幸福感之间关系的主要维度是“工作压力与支持”的组合,而这一组合又与“压力和满意度”密切相关。
典型相关分析的优势
1. 全面性:同时捕捉两组变量之间的关系。
2. 降低重复测试的风险:与进行多次一对一相关性测试相比,这增加了犯 I 类错误的几率。
3. 有助于发现潜在结构:揭示单变量分析中不可见的关系维度。
局限性和挑战
1. 解释可能很复杂:必须将许多组成部分(权重、载荷、冗余)放在一起考虑。
2. 对多重共线性和小样本量敏感:可能产生不稳定的系数。
3. 本质上是线性的:除非进行转换或其他方法,否则无法捕捉非线性关系。
4. 需要理论基础:如果没有清晰的概念框架,对规范维度的解释就容易变成推测。
关闭
典型相关分析(CCA)是一种强大的多元分析方法,能够同时理解两组变量之间的关系。通过构建最大化跨集相关性的典型变量,CCA 使研究人员能够观察到比简单相关或单一回归更全面的关系模式。然而,使用 CCA 需要关注假设、数据质量和适当的解释策略(尤其要重视载荷、交叉载荷和冗余)。在涉及两个主要领域多个指标的研究中,CCA 可以成为探索和概括复杂关系并将其提炼为有意义维度的有力工具。