Bepaling fan 'e korrelaasjekoëffisjint: Ynlieding, metoaden en tapassingen
De korrelaasjekoëffisjint is in statistyske mjitte dy't de sterkte fan 'e relaasje tusken twa fariabelen yn in dataset bepaalt. Korrelaasjes fariearje fan -1 oant 1. In koëffisjintwearde tichtby 1 of -1 jout in sterke relaasje oan tusken de twa fariabelen. In koëffisjintwearde tichtby 0 jout gjin sterke relaasje oan tusken de twa fariabelen. Dit artikel sil de korrelaasjekoëffisjint, metoaden foar it berekkenjen dêrfan, de ynterpretaasje dêrfan en de tapassingen dêrfan yn ferskate fjilden beprate.
Ynlieding ta korrelaasjekoëffisjint
De korrelaasjekoëffisjint jout ús in numerike werjefte fan hoe nau twa fariabelen relatearre binne. Korrelaasjekoëffisjinten wurde ferdield yn twa haadtypen op basis fan 'e rjochting fan' e relaasje:
1. Positive korrelaasjekoëffisjint: Jout oan dat as ien fariabele tanimt, de oare fariabele ek tanimt.
2. Negative korrelaasjekoëffisjint: Jout oan dat as ien fariabele tanimt, de oare fariabele ôfnimt.
De relaasje tusken twa fariabelen kin ek wurde ferdield yn trije typen op basis fan 'e sterkte fan' e relaasje:
1. Sterke korrelaasje: De koëffisjint is tichtby -1 of 1.
2. Moderate korrelaasje: De koëffisjint leit tusken -0.5 oant -1 of 0.5 oant 1.
3. Swakke korrelaasje: De koëffisjint is tichtby 0.
Metoade foar it berekkenjen fan korrelaasjekoëffisjint
Ferskate mienskiplike metoaden wurde brûkt om de korrelaasjekoëffisjint te berekkenjen, ynklusyf de korrelaasje fan Pearson, de korrelaasje fan Spearman en de korrelaasje fan Kendall. Litte wy elk fan dizze metoaden yn mear detail beprate.
1. Pearson-korrelaasje
De Pearson-korrelaasjekoëffisjint wurdt faak brûkt as beide fariabelen kontinu binne en in normale ferdieling hawwe. De formule foar de Pearson-korrelaasjekoëffisjint is:
\[ r = \frac {n(\Sigma xy) – (\Sigma x)(\Sigma y)}{ \sqrt{ [n \Sigma x^2 – (\Sigma x)^2] [n \Sigma y^2 – (\Sigma y)^2 ] } } \]
Wêr:
– \(r \) = korrelaasjekoëffisjint,
– \(n \) = oantal datapearen,
– \( \Sigma xy \) = de som fan 'e produkten fan 'e datapearen \( x \) en \( y \),
– \( \Sigma x \) = som fan wearden \( x \),
– \( \Sigma y \) = som fan wearden \( y \),
– \( \Sigma x^2 \) = som fan 'e kwadraten fan \( x \),
– \( \Sigma y^2 \) = som fan 'e kwadraten fan \( y \).
2. Spearman's rangkorrelaasje
De Spearman-korrelaasjekoëffisjint wurdt brûkt foar ordinale gegevens of as de oanname fan normaliteit net foldien wurde kin. Spearman-korrelaasje is basearre op 'e ranglist fan gegevenswearden ynstee fan har werklike wearden. De formule foar de Spearman-korrelaasjekoëffisjint is:
\[ \rho = 1 – \frac {6 \Sigma d_i^2}{n(n^2-1)} \]
Wêr:
– \( \rho \) = Spearman's korrelaasjekoëffisjint,
– \(d_i \) = ferskil tusken de ranglist fan datapearen \(x \) en \(y \),
– \(n \) = oantal datapearen.
3. Kendall's Tau-korrelaasje
De korrelaasjekoëffisjint fan Kendall mjit de sterkte fan 'e relaasje tusken twa ordinale fariabelen. Oars as dy fan Spearman rjochtet de korrelaasje fan Kendall him mear op it oantal konkordante en diskordante pearen. De formule foar de korrelaasjekoëffisjint fan Kendall is:
\[ \tau = \frac{ (C – D)} { \sqrt{(C + D + T) (C + D + U) } } \]
Wêr:
– \( \tau \) = Kendall's korrelaasjekoëffisjint,
– \( C \) = oantal konkordante pearen,
– \( D \) = oantal diskordante pearen,
– \(T \) = oantal searjepearen yn fariabele \(x \),
– \( U \) = oantal searjepearen yn fariabele \( y \).
Ynterpretaasje fan korrelaasjekoëffisjint
De ynterpretaasje fan 'e korrelaasjekoëffisjint hinget ôf fan 'e wearde fan 'e krigen koëffisjint:
– Koëffisjint +1: Perfekte positive relaasje.
– Koëffisjint 0.7 oant 0.9: Sterke positive relaasje.
– Koëffisjint 0.4 oant 0.6: Matige positive relaasje.
– Koëffisjint 0.1 oant 0.3: Swakke positive relaasje.
– Koëffisjint 0: Gjin relaasje.
– Koëffisjint -0.1 oant -0.3: Swakke negative relaasje.
– Koëffisjint -0.4 oant -0.6: Matige negative relaasje.
– Koëffisjint -0.7 oant -0.9: Sterke negative relaasje.
– Koëffisjint -1: Perfekte negative relaasje.
Korrelaasjekoëffisjint tapassing
De korrelaasjekoëffisjint hat in breed skala oan tapassingen yn ferskate fjilden, ynklusyf ekonomy, sosjale wittenskippen, sûnens, ûnderwiis en mear. Hjir binne wat foarbylden:
1. Ekonomy: It bepalen fan 'e relaasje tusken ynflaasje en wurkleazens, of tusken konsuminteútjeften en ynkommen.
2. Sosjale Wittenskippen: It bepalen fan 'e relaasje tusken ûnderwiis en ynkommen, of tusken sosjale media en psychologysk wolwêzen.
3. Sûnens: Fergelykjen fan 'e relaasje tusken rookgewoanten en gefallen fan longkanker, of tusken in aktive libbensstyl en hertsûnens.
4. Underwiis: Undersyk nei de relaasje tusken stúdzjetiid en eksamenresultaten, of tusken klasgrutte en studinteprestaasjes.
Praktyske foarbylden mei gebrûk fan datasets
Stel dat wy in dataset hawwe dy't wiskundetestskoares en stúdzjetiid yn oeren fan 10 studinten omfettet as folget:
""
Studinten Study-oeren Wiskunde Sifers
1 5 85
2 3 78
3 6 90
4 2 76
5 4 80
6 6 88
7 5 85
8 3 82
9 7 91
10 5 87
""
Wy kinne de Pearson-korrelaasjekoëffisjint tusken Study_Hours en Math_Score berekkenje. Mei de formule fan Pearson berekkenje wy earst \( \Sigma x \), \( \Sigma y \), \( \Sigma xy \), \( \Sigma x^2 \), en \( \Sigma y^2 \), en ferfange dan dizze wearden yn 'e formule om de wearde fan \( r \) te krijen.
Konklúzje
De korrelaasjekoëffisjint is in krêftich ark yn gegevensanalyse foar it bepalen fan 'e sterkte en rjochting fan 'e relaasje tusken twa fariabelen. It begripen fan it konsept, de berekkeningsmetoaden en de ynterpretaasje fan 'e korrelaasjekoëffisjint is essensjeel foar effektive gegevensanalyse. Mei in goed begryp kinne wy korrelaasjes tusken fariabelen yn ferskate fjilden better bepale en better ynformearre, gegevensgestuurde besluten nimme.