സ്വാതന്ത്ര്യത്തിനായുള്ള ചി-സ്ക്വയർ ടെസ്റ്റ്
രണ്ട് കാറ്റഗറിക്കൽ വേരിയബിളുകൾ (നാമമാത്രമോ ഓർഡിനൽ സ്കെയിലോ) ബന്ധപ്പെട്ടതാണോ അതോ ബന്ധമില്ലാത്തതാണോ എന്ന് നിർണ്ണയിക്കാൻ പലപ്പോഴും ഉപയോഗിക്കുന്ന ഒരു നോൺ-പാരാമെട്രിക് സ്റ്റാറ്റിസ്റ്റിക്കൽ രീതിയാണ് ചി-സ്ക്വയർ (χ²) ഇൻഡിപെൻഡൻസ് ടെസ്റ്റ്. നിരവധി സാമൂഹിക, ആരോഗ്യ, വിദ്യാഭ്യാസ, മാർക്കറ്റിംഗ്, നയ വിശകലന പഠനങ്ങളിൽ, ഗവേഷകർ പലപ്പോഴും ലിംഗഭേദം (പുരുഷൻ/സ്ത്രീ), പുകവലി നില (അതെ/ഇല്ല), വിദ്യാഭ്യാസ നിലവാരം (ഹൈസ്കൂൾ/ഡിപ്ലോമ/ബാച്ചിലേഴ്സ് ബിരുദം), ബ്രാൻഡ് മുൻഗണനകൾ (എ/ബി/സി) തുടങ്ങിയ വർഗ്ഗീകരണ ഡാറ്റ കണ്ടെത്തുന്നു. സ്വാതന്ത്ര്യത്തിനായുള്ള ചി-സ്ക്വയർ ടെസ്റ്റ് പ്രധാന ചോദ്യത്തിന് ഉത്തരം നൽകാൻ സഹായിക്കുന്നു: മറ്റ് വേരിയബിൾ വിഭാഗങ്ങളിൽ ഒരു വേരിയബിളിന്റെ വിതരണം ഗണ്യമായി വ്യത്യസ്തമാണോ?
അടിസ്ഥാന ആശയങ്ങൾ: സ്വാതന്ത്ര്യം എന്നാൽ എന്താണ്?
ആദ്യത്തെ വേരിയബിളിലെ വിഭാഗങ്ങളെക്കുറിച്ചുള്ള വിവരങ്ങൾ രണ്ടാമത്തെ വേരിയബിളിലെ വിഭാഗങ്ങൾ പ്രവചിക്കാൻ സഹായിക്കുന്നില്ലെങ്കിൽ രണ്ട് വേരിയബിളുകൾ സ്വതന്ത്രമാണെന്ന് പറയപ്പെടുന്നു. ഉദാഹരണത്തിന്, "ലിംഗഭേദം", "പാനീയ മുൻഗണന" എന്നിവ സ്വതന്ത്രമാണെങ്കിൽ, പുരുഷ, സ്ത്രീ ഗ്രൂപ്പുകളിൽ പാനീയ മുൻഗണനകളുടെ അനുപാതം താരതമ്യേന സമാനമായിരിക്കും. നേരെമറിച്ച്, അനുപാതങ്ങൾ ഗണ്യമായി വ്യത്യാസപ്പെട്ടാൽ, രണ്ട് വേരിയബിളുകളും സ്വതന്ത്രമല്ല (ബന്ധപ്പെട്ടിരിക്കുന്നു) എന്നാണ് ഇത് സൂചിപ്പിക്കുന്നത്.
നിരീക്ഷിച്ച ആവൃത്തികളെ (നമ്മൾ കാണുന്ന യഥാർത്ഥ ഡാറ്റ) പ്രതീക്ഷിക്കുന്ന ആവൃത്തികളുമായി (രണ്ട് വേരിയബിളുകളും യഥാർത്ഥത്തിൽ സ്വതന്ത്രമാണെങ്കിൽ "സംഭവിക്കേണ്ട" ആവൃത്തികൾ) താരതമ്യം ചെയ്താണ് സ്വാതന്ത്ര്യത്തിനായുള്ള കൈ-സ്ക്വയർ ടെസ്റ്റ് പ്രവർത്തിക്കുന്നത്. നിരീക്ഷിച്ചതും പ്രതീക്ഷിക്കുന്നതുമായ മൂല്യങ്ങൾ തമ്മിലുള്ള വ്യത്യാസം കൂടുന്തോറും χ² സ്റ്റാറ്റിസ്റ്റിക്സിന്റെ മൂല്യം കൂടുകയും ഒരു ബന്ധത്തിന്റെ തെളിവ് ശക്തമാവുകയും ചെയ്യും.
കണ്ടിജൻസി ടേബിൾ
ഈ പരിശോധനയ്ക്കുള്ള ഡാറ്റ ഒരു കണ്ടിജൻസി ടേബിളായി ക്രമീകരിച്ചിരിക്കുന്നു, ഇത് രണ്ട് വേരിയബിളുകളുടെ വർഗ്ഗീകൃത കോമ്പിനേഷനുകൾക്കുള്ള ആവൃത്തികൾ പ്രദർശിപ്പിക്കുന്നു. ഉദാഹരണത്തിന്, പുകവലി അവസ്ഥയും (അതെ/ഇല്ല) വിട്ടുമാറാത്ത ചുമയുടെ സംഭവങ്ങളും (അതെ/ഇല്ല) തമ്മിലുള്ള ബന്ധം പരിശോധിക്കാം. ഓരോ കോമ്പിനേഷനിലും പ്രതികരിക്കുന്നവരുടെ എണ്ണം ഉൾക്കൊള്ളുന്ന ഒരു 2x2 പട്ടിക ഞങ്ങൾ സൃഷ്ടിക്കും.
പൊതുവേ, ഓരോ വേരിയബിളിലെയും വിഭാഗങ്ങളുടെ എണ്ണത്തെ ആശ്രയിച്ച് പട്ടികകൾ 2×2, 2×3, 3×4 എന്നിങ്ങനെ ആകാം. ചില നിബന്ധനകൾ പാലിക്കുന്നിടത്തോളം, സ്വാതന്ത്ര്യത്തിനായുള്ള കൈ-സ്ക്വയർ ടെസ്റ്റ് ഏത് വലുപ്പത്തിലുള്ള പട്ടികകൾക്കും ഉപയോഗിക്കാം.
പരികല്പന പരിശോധന
സ്വാതന്ത്ര്യത്തിനായുള്ള കൈ-സ്ക്വയർ പരിശോധനയിൽ, പരികല്പന ഇതാണ്:
– H0 (ശൂന്യ സിദ്ധാന്തം): രണ്ട് വേരിയബിളുകളും സ്വതന്ത്രമാണ് (ബന്ധമോ ബന്ധമോ ഇല്ല).
– H1 (ഇതര സിദ്ധാന്തം): രണ്ട് വേരിയബിളുകളും സ്വതന്ത്രമല്ല (ഒരു ബന്ധം/ബന്ധം ഉണ്ട്).
H0 നിരസിക്കാൻ ഡാറ്റ മതിയായ തെളിവുകൾ നൽകുന്നുണ്ടോ എന്ന് നിർണ്ണയിക്കുക എന്നതാണ് പരിശോധനയുടെ ലക്ഷ്യം.
ചി-സ്ക്വയർ സ്റ്റാറ്റിസ്റ്റിക്കൽ ഫോർമുല
കൈ-സ്ക്വയർ ടെസ്റ്റ് സ്റ്റാറ്റിസ്റ്റിക്സ് ഫോർമുല ഉപയോഗിച്ച് കണക്കാക്കുന്നു:
\[
\chi^2 = \sum \frac{(O_{ij} – E_{ij})^2}{E_{ij}}
\]
വിവരങ്ങൾ:
– \(O_{ij}\) എന്നത് സെൽ വരി-i, കോളം-j എന്നിവയിലെ നിരീക്ഷണ ആവൃത്തിയാണ്.
– \(E_{ij}\) എന്നത് വരി-i, നിര-j എന്നിവയുടെ സെല്ലിൽ പ്രതീക്ഷിക്കുന്ന ആവൃത്തിയാണ്.
പ്രതീക്ഷിക്കുന്ന ആവൃത്തി കണക്കാക്കുന്നത് വരിയുടെയും നിരയുടെയും ആകെത്തുകയിൽ നിന്നാണ്:
\[
E_{ij} = \frac{(\text{ആകെ വരി i}) \times (\text{ആകെ കോളം j})}{\text{മൊത്തം}}
\]
ഓരോ വരിയിലെയും നിരയിലെയും വിതരണങ്ങൾ പരസ്പരം സ്വാധീനിച്ചില്ലെങ്കിൽ (സ്വതന്ത്രമായിരുന്നു) എന്ത് സംഭവിക്കുമെന്ന് ഈ ഫോർമുല പ്രതിഫലിപ്പിക്കുന്നു.
സ്വാതന്ത്ര്യത്തിന്റെ ഡിഗ്രികൾ
ഈ പരിശോധനയ്ക്കുള്ള സ്വാതന്ത്ര്യത്തിന്റെ ഡിഗ്രികൾ (df) പട്ടികയുടെ വലുപ്പമനുസരിച്ച് നിർണ്ണയിക്കപ്പെടുന്നു:
\[
df = (r – 1)(c – 1)
\]
കൂടെ:
– \(r\) = വരികളുടെ എണ്ണം (ആദ്യ വേരിയബിൾ വിഭാഗം)
– \(c\) = നിരകളുടെ എണ്ണം (രണ്ടാമത്തെ വേരിയബിൾ വിഭാഗം)
p-മൂല്യം നിർണ്ണയിക്കാൻ ഉപയോഗിക്കുന്ന കൈ-സ്ക്വയർ ഡിസ്ട്രിബ്യൂഷന്റെ ആകൃതിയെ സ്വാതന്ത്ര്യത്തിന്റെ ഡിഗ്രികൾ ബാധിക്കുന്നു.
ചി-സ്ക്വയർ ഇൻഡിപെൻഡൻസ് ടെസ്റ്റ് നടത്തുന്നതിനുള്ള ഘട്ടങ്ങൾ
ഈ പരിശോധന നടത്തുന്നതിനുള്ള പൊതുവായ ക്രമം ഇപ്രകാരമാണ്:
1. ഡാറ്റ ഒരു കണ്ടിജൻസി ടേബിളിൽ ക്രമീകരിക്കുക.
ഡാറ്റ ശതമാനങ്ങളുടെ രൂപത്തിലല്ല, ഫ്രീക്വൻസികളുടെ രൂപത്തിലാണെന്ന് ഉറപ്പാക്കുക.
2. \(E_{ij}\) എന്ന ഫോർമുല ഉപയോഗിച്ച് ഓരോ സെല്ലിനും പ്രതീക്ഷിക്കുന്ന ആവൃത്തി കണക്കാക്കുക.
3. എല്ലാ സെല്ലുകളുടെയും \((OE)^2/E\) ന്റെ ഘടകങ്ങൾ സംഗ്രഹിച്ച് χ² ന്റെ മൂല്യം കണക്കാക്കുക.
4. \((r-1)(c-1)\) ഉപയോഗിച്ച് df നിർണ്ണയിക്കുക.
5. df-ഉം chi-square വിതരണവും അടിസ്ഥാനമാക്കി p-മൂല്യം കണക്കാക്കുക (അല്ലെങ്കിൽ കണക്കാക്കിയ χ²-നെ α എന്ന പ്രാധാന്യ തലത്തിലെ പട്ടിക χ²-മായി താരതമ്യം ചെയ്യുക, ഉദാഹരണത്തിന് 0,05).
6. ഒരു തീരുമാനം എടുക്കുക.
– p-മൂല്യം ≤ α → H0 നിരസിക്കുകയാണെങ്കിൽ → ഒരു ബന്ധം/ആശ്രിതത്വം ഉണ്ട്.
– p-മൂല്യം > α → H0 നിരസിക്കുന്നതിൽ പരാജയപ്പെട്ടാൽ → ബന്ധത്തിന്റെ തെളിവില്ല.
7. സബ്സ്റ്റാന്റിവ് വ്യാഖ്യാനം.
ഗവേഷണത്തിന്റെ പശ്ചാത്തലത്തിൽ ബന്ധം എന്താണ് അർത്ഥമാക്കുന്നതെന്ന് വിശദീകരിക്കുക, "പ്രധാനം" അല്ലെങ്കിൽ "പ്രധാനമല്ലാത്തത്" എന്ന് മാത്രമല്ല.
വ്യാഖ്യാന ഉദാഹരണം (വിശദമായ കണക്കുകൂട്ടലുകൾ ഇല്ലാതെ)
ഒരു ഗവേഷകൻ "പഠന രീതി" (സ്വതന്ത്രം/ഗ്രൂപ്പ്) "ഗ്രാജുവേഷൻ" (പാസ്/പരാജയം) എന്നിവ തമ്മിലുള്ള ബന്ധം വിലയിരുത്തുന്നുവെന്ന് കരുതുക. ഒരു കൈ-സ്ക്വയർ ടെസ്റ്റ് നടത്തിയ ശേഷം, p-മൂല്യം 0,02 ആണ്. α = 0,05 ഉപയോഗിച്ച്, പഠന രീതിയും ബിരുദവും തമ്മിലുള്ള ബന്ധം സൂചിപ്പിക്കുന്ന H0 നിരസിക്കുക എന്നതാണ് നിഗമനം. തുടർന്ന് ഗവേഷകൻ ഏറ്റവും വലിയ വ്യത്യാസം സംഭാവന ചെയ്യുന്ന സെല്ലുകൾ ഏതൊക്കെയാണെന്ന് നിർണ്ണയിക്കേണ്ടതുണ്ട് (ഉദാഹരണത്തിന്, ഗ്രൂപ്പ് പഠനം ബിരുദധാരികളുടെ അനുപാതം വർദ്ധിപ്പിക്കുന്നുണ്ടോ). പ്രായോഗികമായി, സ്റ്റാൻഡേർഡ് അവശിഷ്ടങ്ങളോ ഇഫക്റ്റ് വലുപ്പങ്ങളോ പരിശോധിച്ചുകൊണ്ട് വിശകലനം വികസിപ്പിക്കാൻ കഴിയും.
പ്രധാനപ്പെട്ട നിബന്ധനകളും അനുമാനങ്ങളും
കൈ-സ്ക്വയർ പാരാമെട്രിക് അല്ലെങ്കിലും, ഈ പരിശോധനയ്ക്ക് നിരവധി പ്രധാന ആവശ്യകതകൾ ഉണ്ട്:
1. ഡാറ്റ എണ്ണങ്ങളുടെ (ഫ്രീക്വൻസി) രൂപത്തിലാണ്, ഓരോ വിഷയവും ഒരു വിഭാഗത്തിൽ മാത്രമേ പെടുകയുള്ളൂ (പരസ്പരം എക്സ്ക്ലൂസീവ്).
2. സ്വതന്ത്ര നിരീക്ഷണങ്ങൾ, അതായത് ഒരു പ്രതികരിക്കുന്നയാളെ ഒന്നിലധികം തവണ കണക്കാക്കാൻ പാടില്ല, കൂടാതെ നിരീക്ഷണങ്ങൾക്കിടയിൽ ജോടിയാക്കിയ ബന്ധമില്ല.
3. പ്രതീക്ഷിക്കുന്ന ആവൃത്തി വളരെ വലുതാണ്. ഒരു പൊതു നിയമം: മിക്ക \(E_{ij}\) മൂല്യങ്ങളും ≥ 5 ആയിരിക്കണം. ചെറിയ പ്രതീക്ഷിക്കുന്ന മൂല്യങ്ങളുള്ള വളരെയധികം സെല്ലുകൾ ഉണ്ടെങ്കിൽ, കൈ-സ്ക്വയർ പരിശോധനാ ഫലങ്ങൾ അസാധുവായിരിക്കാം.
ചെറിയ ഫ്രീക്വൻസികളുള്ള 2×2 പട്ടികകൾക്ക്, ഒരു സാധാരണ ബദൽ ഫിഷേഴ്സ് എക്സ്ക്റ്റ് ടെസ്റ്റ് ആണ്. ജോടിയാക്കിയ ഡാറ്റയ്ക്ക് (ഉദാഹരണത്തിന്, ഒരേ പ്രതികരണത്തിന് മുമ്പും ശേഷവും), ഒരു ബദൽ മക്നെമാറിന്റെ പരിശോധനയാണ്.
ഇഫക്റ്റ് വലുപ്പം: വെറും പ്രധാനമല്ല
ഒരു പ്രധാന ഫലം അനിവാര്യമായും ഒരു "ശക്തമായ" ബന്ധത്തെ അർത്ഥമാക്കുന്നില്ല. അതിനാൽ, പലപ്പോഴും ഇഫക്റ്റ് വലുപ്പം റിപ്പോർട്ട് ചെയ്യാൻ ശുപാർശ ചെയ്യുന്നു, ഉദാഹരണത്തിന്:
– 2×2 പട്ടികയ്ക്കുള്ള ഫൈ (φ)
– വലിയ ടേബിളുകൾക്കായി Cramér's V
ക്രാമറിന്റെ V 0 മുതൽ 1 വരെയാണ്, വലിയ മൂല്യങ്ങൾ ശക്തമായ ഒരു ബന്ധത്തെ സൂചിപ്പിക്കുന്നു. റിപ്പോർട്ടിംഗ് ഇഫക്റ്റ് വലുപ്പങ്ങൾ വായനക്കാർക്ക് ബന്ധത്തിന്റെ നിലനിൽപ്പിനെ മാത്രമല്ല, അതിന്റെ ശക്തിയും മനസ്സിലാക്കാൻ സഹായിക്കുന്നു.
ഗുണങ്ങളും പരിമിതികളും
കെലെബിഹാൻ:
- വർഗ്ഗീകൃത ഡാറ്റയ്ക്ക് ഉപയോഗിക്കാൻ എളുപ്പമാണ്.
– സാധാരണത്വത്തിന്റെ അനുമാനം ആവശ്യമില്ല.
- പല ഗവേഷണ മേഖലകൾക്കും അനുയോജ്യം.
പരിമിതികൾ:
– സാമ്പിൾ വലുപ്പത്തോട് സംവേദനക്ഷമതയുള്ളത്: വലിയ സാമ്പിളുകൾക്ക് ചെറിയ വ്യത്യാസങ്ങൾ "പ്രധാന"മാക്കാൻ കഴിയും.
– ബന്ധത്തിന്റെ ദിശ നേരിട്ട് കാണിക്കുന്നില്ല, മറിച്ച് ഒരു അസോസിയേഷന്റെ സാന്നിധ്യം/അഭാവം മാത്രം കാണിക്കുന്നു.
– പല സെല്ലുകൾക്കും പ്രതീക്ഷിക്കുന്ന ആവൃത്തികൾ കുറവാണെങ്കിൽ അത് പ്രശ്നകരമാണ്.
- വ്യാഖ്യാനത്തിന് അധിക വിശകലനം ആവശ്യമാണ് (ഉദാ. അനുപാതങ്ങളോ അവശിഷ്ടങ്ങളോ നോക്കുന്നത്).
പെനുട്ടപ്പ്
രണ്ട് വർഗ്ഗീകൃത വേരിയബിളുകൾ തമ്മിലുള്ള ബന്ധത്തിന്റെ നിലനിൽപ്പും അഭാവവും വിലയിരുത്തുന്നതിനുള്ള ഒരു പ്രധാന ഉപകരണമാണ് സ്വാതന്ത്ര്യത്തിനായുള്ള കൈ-സ്ക്വയർ ടെസ്റ്റ്. ഒരു ആകസ്മിക പട്ടിക നിർമ്മിക്കുന്നതിലൂടെയും, പ്രതീക്ഷിക്കുന്ന ആവൃത്തികൾ കണക്കാക്കുന്നതിലൂടെയും, χ² സ്റ്റാറ്റിസ്റ്റിക് ഉപയോഗിച്ച് നിരീക്ഷിച്ച ആവൃത്തികളുമായി അവയെ താരതമ്യം ചെയ്യുന്നതിലൂടെയും, ഗവേഷകർക്ക് സ്വാതന്ത്ര്യത്തിന്റെ സിദ്ധാന്തം വസ്തുനിഷ്ഠമായി പരിശോധിക്കാൻ കഴിയും. എന്നിരുന്നാലും, ഒരു ശക്തമായ വിശകലനം നിർമ്മിക്കുന്നതിന്, ഗവേഷകർ ഒരു പ്രധാന പ്രഭാവം നിലവിലുണ്ടോ ഇല്ലയോ എന്ന് നിർണ്ണയിക്കുന്നതിനപ്പുറം പോകണം; അവർ ഫല വലുപ്പങ്ങൾ റിപ്പോർട്ട് ചെയ്യുകയും, പ്രതീക്ഷിക്കുന്ന ആവൃത്തി ആവശ്യകതകൾ പരിശോധിക്കുകയും, കണ്ടെത്തലുകളെ പഠനത്തിന്റെ സാരമായ സന്ദർഭവുമായി ബന്ധപ്പെടുത്തുകയും വേണം. അങ്ങനെ, കൈ-സ്ക്വയർ ടെസ്റ്റ് ഒരു ഗണിതശാസ്ത്ര നടപടിക്രമത്തേക്കാൾ കൂടുതലായി മാറുന്നു, മറിച്ച് വർഗ്ഗീകൃത ഡാറ്റയിലെ ബന്ധങ്ങളുടെ പാറ്റേണുകൾ മനസ്സിലാക്കാൻ സഹായിക്കുന്ന ശാസ്ത്രീയ യുക്തിയുടെ ഭാഗമായി മാറുന്നു.