Канонический корреляционный анализ
Пендаулуан
Во многих исследованиях ученые часто сталкиваются с ситуациями, когда существуют два набора переменных, каждый из которых состоит из нескольких показателей. Например, в сфере образования у нас может быть набор переменных, отражающих факторы обучения (мотивация, количество учебных часов, поддержка семьи, доступ в интернет), и набор переменных, отражающих результаты обучения (оценки по математике, языку, естественным наукам и средний балл). Важный вопрос заключается не просто в том, «связана ли мотивация с оценками по математике?», а скорее в том, «насколько сильна общая взаимосвязь между набором факторов обучения и набором результатов обучения?». Для ответа на подобные вопросы канонический корреляционный анализ (ККА) является одним из наиболее подходящих многомерных статистических методов.
Канонический корреляционный анализ был разработан для одновременного измерения и объяснения взаимосвязи между двумя наборами переменных. Другими словами, ККА расширяет концепцию простой корреляции (между двумя переменными) до корреляции между двумя линейными комбинациями двух наборов переменных. В этой статье рассматриваются основные понятия, цели, этапы анализа, интерпретация, а также преимущества и ограничения ККА.
Основное понятие канонической корреляции
Обычная корреляция (например, корреляция Пирсона) измеряет силу линейной зависимости между двумя переменными, скажем, X и Y. Метод CCA обобщает эту концепцию, формируя две новые переменные в виде линейных комбинаций:
– Первая каноническая переменная для множества X:
U = a₁X₁ + a₂X₂ + … + aₚXₚ
– Первый канонический вариант для множества Y:
V = b₁Y₁ + b₂Y₂ + … + b_qY_q
Коэффициенты a и b выбираются таким образом, чтобы корреляция между U и V была максимальной. Эта максимальная корреляция называется первой канонической корреляцией. После получения первой пары, метод канонической канонической корреляции (CCA) может формировать последующие пары переменных (вторую, третью и так далее), которые ортогональны (некоррелированы) с предыдущей парой.
Число возможных пар канонических переменных равно min(p, q), что представляет собой наименьшее количество переменных между двумя множествами.
Назначение и применение
Метод CCA используется, когда цели исследования следующие:
1. Измерьте силу взаимосвязи между двумя наборами переменных в целом.
2. Определите наиболее связанную комбинацию переменных в наборах X и Y.
3. Сведите размерность многомерных взаимосвязей к нескольким парам переменных, которые легче интерпретировать.
4. Изучение закономерностей в данных: какие переменные преимущественно объясняют взаимосвязь между двумя областями.
Пример контекста приложения:
– Психология: взаимосвязь между совокупностью «личностных черт» и совокупностью «показателей психического здоровья».
– Экономика: взаимосвязь между совокупностью «макроиндикаторов» и совокупностью «индикаторов рынка труда».
– Наука о здоровье: взаимосвязь между набором «привычек образа жизни» и набором «клинических параметров».
Предположения и требования к данным
Как и многие многомерные методы, метод канонического корреляционного анализа (CCA) имеет ряд допущений, которые необходимо учитывать для обеспечения стабильности и интерпретируемости результатов:
1. Линейная зависимость: каноническая корреляция (CCA) отражает линейную зависимость между наборами данных. Если зависимость нелинейная, каноническая корреляция может недооценивать силу этой зависимости.
2. Многомерная нормальность: В идеале переменные должны следовать многомерному нормальному распределению, особенно для проверки значимости. Однако на практике CCA часто используется в исследовательских целях, даже когда данные не являются полностью нормальными.
3. В каждом наборе данных отсутствует крайняя мультиколлинеарность: сильно коррелированные переменные могут сделать оценки коэффициентов нестабильными.
4. Адекватный размер выборки: общепринятое эмпирическое правило — минимум 10–20 наблюдений на каждую переменную, хотя контекст исследования может потребовать большего количества.
Кроме того, переменные должны быть представлены в сопоставимой или стандартизированной шкале (z-оценка), чтобы упростить сравнение коэффициентов.
Этапы канонического корреляционного анализа
В целом, этапы проведения анализа корреляции включают в себя:
1. Определите два набора переменных.
Убедитесь, что переменные сгруппированы на основе теории или концептуальной модели, а не просто методом проб и ошибок.
2. Проверка данных
Включая пропущенные данные (отсутствующие значения), выбросы, тесты на нормальность распределения и корреляции внутри каждого набора (для выявления мультиколлинеарности).
3. Оценка канонических переменных
Генерирует пары переменных U₁–V₁, U₂–V₂ и так далее.
4. Расчет канонической корреляции
Корреляция между U_k и V_k для каждой k-й пары.
5. Проверка значимости
Проверяет, отличается ли полученная каноническая корреляция статистически от нуля. Обычно используются следующие тесты: лямбда Вилкса, след Пиллаи (чаще в MANOVA), след Хотеллинга и наибольший корень Роя. В канонической канонической корреляции лямбда Вилкса часто является предпочтительным выбором.
6. Интерпретация результатов
Включает оценку величины корреляции, нагрузок, весов и вклада переменных.
Как читать и интерпретировать результаты анализа CCA
Выходные данные CCA обычно включают несколько важных компонентов:
1. Канонические корреляции
Это значение указывает на силу связи между переменными U и V в конкретной паре. Например, первая каноническая корреляция, равная 0,80, указывает на сильную линейную связь между комбинацией переменных X и комбинацией переменных Y в первом измерении.
Также часто приводится канонический коэффициент детерминации R², квадрат канонической корреляции. Если r = 0,80, то R² = 0,64, что означает, что приблизительно 64% вариации канонической переменной Y может быть объяснено канонической переменной X (и наоборот) в этом измерении, в смысле взаимосвязи между переменными, а не между исходными переменными.
2. Канонические веса (Канонические веса / Коэффициенты)
Веса — это коэффициенты a и b, образующие переменные U и V. Однако веса часто чувствительны к мультиколлинеарности, поэтому содержательная интерпретация обычно не основывается исключительно на весах.
3. Канонические нагрузки (Канонические нагрузки / Коэффициенты конструкции)
Нагрузка — это корреляция между исходной переменной и её канонической переменной. Например, нагрузка X₂ на U₁, равная 0,70, означает, что X₂ вносит значительный вклад в первое каноническое измерение со стороны множества X. Нагрузки, как правило, более стабильны и проще для интерпретации, чем веса.
4. Поперечные нагрузки
Перекрестная нагрузка — это корреляция между переменными из одного набора и каноническими переменными из другого набора (например, корреляция X₁ с V₁). Это помогает понять, какие переменные наиболее тесно связаны с измерениями взаимосвязи между наборами.
5. Индекс избыточности
Индекс избыточности показывает, какая часть дисперсии исходных переменных в одном наборе может быть объяснена каноническими переменными из другого набора. Это важно, поскольку высокая каноническая корреляция не обязательно указывает на высокую объясняющую способность исходных переменных. Избыточность часто используется для оценки практической ценности (а не только статистической значимости).
Простая иллюстрация
Предположим, в исследовании изучается взаимосвязь между:
– Установите X (условия работы): X₁ = рабочая нагрузка, X₂ = поддержка со стороны руководителя, X₃ = гибкий график работы.
– Установите Y (благополучие): Y₁ = стресс, Y₂ = удовлетворенность работой, Y₃ = качество сна
Метод CCA может выявить значимую первую каноническую корреляцию r = 0,75. Нагрузки показывают, что рабочая нагрузка и поддержка со стороны руководителя наиболее сильно формируют U₁, в то время как стресс и удовлетворенность работой наиболее сильно формируют V₁. Сущностная интерпретация: основным измерением взаимосвязи между условиями труда и благополучием является сочетание «рабочего давления против поддержки», которое тесно связано со «стрессом и удовлетворенностью».
Преимущества канонического корреляционного анализа
1. Комплексный: отражает взаимосвязь между двумя наборами переменных одновременно.
2. Снижение риска повторного тестирования: по сравнению с проведением множества пошаговых корреляций, что увеличивает вероятность ошибки первого типа.
3. Помогает выявлять скрытые структуры: раскрывает аспекты взаимосвязей, невидимые при одномерном анализе.
Ограничения и проблемы
1. Интерпретация может быть сложной: необходимо рассматривать множество компонентов (веса, нагрузки, избыточность) в совокупности.
2. Чувствителен к мультиколлинеарности и малым размерам выборки: может приводить к нестабильным коэффициентам.
3. Линейный характер: нелинейные зависимости не выявляются, если не применяется преобразование или иной подход.
4. Требует теоретической основы: без четкой концептуальной структуры интерпретация канонических измерений склонна к умозрительным выводам.
обложка
Канонический корреляционный анализ (ККА) — это мощный многомерный метод для одновременного понимания взаимосвязи между двумя наборами переменных. Путем построения канонических переменных, максимизирующих межгрупповые корреляции, ККА позволяет исследователям увидеть более полные закономерности взаимосвязей, чем простая корреляция или регрессия. Однако его использование требует внимания к предположениям, качеству данных и соответствующим стратегиям интерпретации (особенно с акцентом на факторные нагрузки, перекрестные нагрузки и избыточность). В исследованиях, включающих множество показателей в двух основных областях, ККА может стать мощным инструментом для изучения и обобщения сложных взаимосвязей в осмысленные измерения.