Wyznaczanie współczynnika korelacji: wprowadzenie, metody i zastosowania
Współczynnik korelacji to miara statystyczna określająca siłę związku między dwiema zmiennymi w zbiorze danych. Korelacje mieszczą się w zakresie od -1 do 1. Wartość współczynnika bliska 1 lub -1 oznacza silny związek między dwiema zmiennymi. Wartość współczynnika bliska 0 oznacza brak silnego związku między dwiema zmiennymi. W tym artykule omówiono współczynnik korelacji, metody jego obliczania, jego interpretację oraz zastosowania w różnych dziedzinach.
Wprowadzenie do współczynnika korelacji
Współczynnik korelacji daje nam liczbowy obraz tego, jak blisko powiązane są dwie zmienne. Współczynniki korelacji dzielą się na dwa główne typy w zależności od kierunku relacji:
1. Współczynnik korelacji dodatniej: wskazuje, że gdy wzrasta wartość jednej zmiennej, wzrasta również wartość drugiej zmiennej.
2. Ujemny współczynnik korelacji: wskazuje, że gdy wartość jednej zmiennej wzrasta, wartość drugiej zmiennej maleje.
Związek między dwiema zmiennymi można podzielić na trzy typy, w zależności od siły związku:
1. Silna korelacja: współczynnik jest bliski -1 lub 1.
2. Korelacja umiarkowana: współczynnik wynosi od -0.5 do -1 lub od 0.5 do 1.
3. Słaba korelacja: współczynnik jest bliski 0.
Metoda obliczania współczynnika korelacji
Do obliczenia współczynnika korelacji stosuje się kilka popularnych metod, w tym korelację Pearsona, korelację Spearmana i korelację Kendalla. Omówmy każdą z tych metod bardziej szczegółowo.
1. Korelacja Pearsona
Współczynnik korelacji Pearsona jest często stosowany, gdy obie zmienne są ciągłe i mają rozkład normalny. Wzór na współczynnik korelacji Pearsona jest następujący:
\[ r = \frac {n(\Sigma xy) – (\Sigma x)(\Sigma y)}{ \sqrt{ [n \Sigma x^2 – (\Sigma x)^2] [n \Sigma y^2 – (\Sigma y)^2 ] } } \]
Di mana:
– \( r \) = współczynnik korelacji,
– \( n \) = liczba par danych,
– \( \Sigma xy \) = suma iloczynów par danych \( x \) i \( y \),
– \( \Sigma x \) = suma wartości \( x \),
– \( \Sigma y \) = suma wartości \( y \),
– \( \Sigma x^2 \) = suma kwadratów \( x \),
– \( \Sigma y^2 \) = suma kwadratów \( y \).
2. Korelacja rang Spearmana
Współczynnik korelacji Spearmana stosuje się w przypadku danych porządkowych lub gdy założenie normalności rozkładu nie może być spełnione. Korelacja Spearmana opiera się na rankingu wartości danych, a nie na ich rzeczywistych wartościach. Wzór na współczynnik korelacji Spearmana jest następujący:
\[ \rho = 1 – \frac {6\Sigma d_i^2}{n(n^2-1)} \]
Di mana:
– \( \rho \) = współczynnik korelacji Spearmana,
– \( d_i \) = różnica między rankingami par danych \( x \) i \( y \),
– \( n \) = liczba par danych.
3. Korelacja Tau Kendalla
Współczynnik korelacji Kendalla mierzy siłę związku między dwiema zmiennymi porządkowymi. W przeciwieństwie do współczynnika Spearmana, korelacja Kendalla koncentruje się bardziej na liczbie par zgodnych i niezgodnych. Wzór na współczynnik korelacji Kendalla jest następujący:
\[ \tau = \frac{ (C – D)} { \sqrt{(C + D + T) (C + D + U) } } \]
Di mana:
– \( \tau \) = współczynnik korelacji Kendalla,
– \( C \) = liczba zgodnych par,
– \( D \) = liczba par niezgodnych,
– \( T \) = liczba par szeregów w zmiennej \( x \),
– \( U \) = liczba par szeregów w zmiennej \( y \).
Interpretacja współczynnika korelacji
Interpretacja współczynnika korelacji zależy od wartości uzyskanego współczynnika:
– Współczynnik +1: Idealnie dodatnia relacja.
– Współczynnik 0.7 do 0.9: Silna dodatnia zależność.
– Współczynnik 0.4 do 0.6: Umiarkowana pozytywna zależność.
– Współczynnik 0.1 do 0.3: Słaba dodatnia zależność.
– Współczynnik 0: Brak związku.
– Współczynnik -0.1 do -0.3: Słaba negatywna zależność.
– Współczynnik -0.4 do -0.6: Umiarkowana negatywna zależność.
– Współczynnik -0.7 do -0.9: Silna negatywna zależność.
– Współczynnik -1: Idealnie negatywna relacja.
Zastosowanie współczynnika korelacji
Współczynnik korelacji ma szerokie zastosowanie w różnych dziedzinach, takich jak ekonomia, nauki społeczne, zdrowie, edukacja i wiele innych. Oto kilka przykładów:
1. Ekonomia: Określanie związku między inflacją a bezrobociem lub między wydatkami konsumentów a dochodami.
2. Nauki społeczne: Określanie związku między wykształceniem a dochodami lub między mediami społecznościowymi a dobrostanem psychicznym.
3. Zdrowie: Porównanie zależności między paleniem tytoniu a zachorowaniami na raka płuc oraz między aktywnym trybem życia a zdrowiem serca.
4. Edukacja: badanie zależności między czasem poświęconym na naukę a wynikami egzaminów lub między liczebnością klasy a osiągnięciami uczniów.
Praktyczne przykłady wykorzystania zestawów danych
Załóżmy, że mamy zbiór danych obejmujący wyniki testów matematycznych i czas nauki 10 uczniów w godzinach, jak poniżej:
„„
Godziny nauki uczniów Oceny z matematyki
1 5 85
2 3 78
3 6 90
4 2 76
5 4 80
6 6 88
7 5 85
8 3 82
9 7 91
10 5 87
„„
Możemy obliczyć współczynnik korelacji Pearsona między liczbą godzin nauki a wynikiem z matematyki. Korzystając ze wzoru Pearsona, obliczamy najpierw \( \Sigma x \), \( \Sigma y \), \( \Sigma xy \), \( \Sigma x^2 \) i \( \Sigma y^2 \), a następnie podstawiamy te wartości do wzoru, aby uzyskać wartość \( r \).
Wniosek
Współczynnik korelacji to potężne narzędzie w analizie danych, służące do określania siły i kierunku zależności między dwiema zmiennymi. Zrozumienie koncepcji, metod obliczeniowych i interpretacji współczynnika korelacji jest niezbędne do skutecznej analizy danych. Dzięki temu możemy lepiej określać korelacje między zmiennymi w różnych dziedzinach i podejmować bardziej świadome decyzje w oparciu o dane.