Основни концепти на еднонасочна ANOVA
Еднонасочната ANOVA е статистички метод што се користи за споредување на средни вредности од повеќе од две групи. Многу луѓе се запознаени со t-тестот за споредување на две средни вредности, но кога бројот на групи е повеќе од две, повторената употреба на t-тестот всушност го зголемува ризикот од донесување неточни одлуки. Тука станува важна еднонасочната ANOVA: таа обезбедува попрецизен и систематски начин за тестирање дали постојат значајни разлики во средните вредности помеѓу споредените групи врз основа на еден фактор (една категорична променлива).
1. Што е еднонасочна ANOVA?
Терминот ANOVA доаѓа од Анализа на варијанса. И покрај неговото име, „анализа на варијанса“, нејзината примарна цел е да ги тестира разликите во средните вредности. Основната интуиција на ANOVA е следнава: ако средните вредности на групите се навистина различни, тогаш варијацијата меѓу групите ќе изгледа поголема од варијацијата во рамките на групите.
Се нарекува „еднонасочно“ бидејќи за формирање на групите се користи само еден фактор или една категорична независна променлива. На пример:
– Методи на учење (самостојно, групно, онлајн) врз резултатите од испитите.
– Вид на ѓубриво (A, B, C, D) врз основа на приносот од жетвата.
– Тип на лек (лек 1, лек 2, плацебо) врз крвниот притисок.
Во примерот погоре, „метод на учење“, „тип на ѓубриво“ и „тип на лек“ се единечни фактори кои имаат повеќе нивоа (категории).
2. Кога се користи еднонасочна ANOVA?
Еднонасочната ANOVA генерално се користи кога:
1. Зависната променлива е во нумеричка/квантитативна форма (примери: вредност, тежина, време, крвен притисок).
2. Независната променлива е еден категоричен фактор со минимум три групи (k ≥ 3).
3. Истражувачите сакаат да знаат дали постои барем една група чиј просек е различен од другите.
Ако има само две групи, t-тестот е обично доволен. Сепак, ANOVA сè уште може да се користи за две групи и ќе произведе заклучоци еквивалентни на t-тестот (под одредени услови).
3. Главна идеја: Варијација меѓу групите наспроти варијација во рамките на групата
ANOVA мери два извори на варијација:
– Варијација во рамките на групата: колку податоците варираат во рамките на секоја група. На пример, иако групата има одреден просек, нејзините поединци може да бидат доста расфрлани од просекот.
– Варијација меѓу групите: колку се разликува просекот на секоја група една од друга.
Ако разликата помеѓу средните вредности на групите е голема, варијацијата помеѓу групите ќе биде голема. Ако податоците во рамките на групите се многу расфрлани, варијацијата во рамките на групите ќе биде голема. ANOVA ги споредува двете користејќи сооднос наречен F статистика.
4. Хипотеза во ANOVA
Во еднонасочна ANOVA, хипотезата е формулирана на следниов начин:
– H0 (нулта хипотеза): сите средни вредности на групната популација се исти.
\[
\mu_1 = \mu_2 = \mu_3 = \точки = \mu_k
\]
– H1 (алтернативна хипотеза): постои барем една различна групна средна вредност.
Тоа е, не сите \(\mu\) се исти.
Важно е да се разбере дека ANOVA ви кажува само дали има разлика во целост или не. Доколку резултатите се значајни, потребно е дополнително тестирање за да се утврди кои парови групи се разликуваат.
5. Тест статистика: F сооднос
Главната тест статистика во ANOVA е F:
\[
F = \frac{\text{Варијансата меѓу групите (MSB)}}{\text{Варијансата во рамките на групата (MSW)}}
\]
Тука:
– MSB (Mean Square Between) = просекот од квадратите меѓу групите, ја опишува варијацијата меѓу средните вредности на групите.
– MSW (Mean Square Within - Средна вредност на квадрати во рамките на групата) = просек на квадрати во рамките на групата, ја опишува варијацијата во рамките на групата.
Логиката:
– Ако средните вредности на сите групи се слични, MSB е мал, па затоа F е блиску до 1.
– Ако постои јасна разлика во средните вредности, MSB се зголемува така што F станува поголемо од 1.
– Доволно голема F вредност (во споредба со критичната F вредност при одреден степен на слобода) нè тера да ја отфрлиме H0.
6. Компоненти за пресметка: SST, SSB и SSW
Во ANOVA, вкупната варијација на податоците е поделена на два дела:
1. SST (Вкупен збир на квадрати): вкупниот збир на квадрати, ја опишува вкупната варијација на сите податоци во однос на вкупниот просек.
2. SSB (Збир на квадрати помеѓу): збирот на квадрати помеѓу групите, варијација поради разлики во средните вредности на групите.
3. SSW (Збир на квадрати во рамките на групата): збирот на квадрати во рамките на групата, варијација поради индивидуални разлики во рамките на групата.
Основната врска:
\[
SST = SSB + SSW
\]
Потоа секој се дели со степените на слобода за да се добијат MSB и MSW.
7. Степени на слобода
Степени на слобода (df) во еднонасочна ANOVA:
– df помеѓу групите: \(k – 1\)
(k = број на групи)
– df во групата : \(N – k\)
(N = вкупно од сите набљудувања)
– вкупно df : \(N – 1\)
Степените на слобода се важни бидејќи го одредуваат обликот на F-распределбата што се користи за тестирање на значајноста.
8. Претпоставки за еднонасочна ANOVA
За да бидат валидни резултатите од ANOVA, обично се потребни неколку претпоставки:
1. Независност: податоците меѓу испитаниците/набљудувањата се независни (не влијаат едни на други).
2. Нормалност: податоците во секоја група се нормално распределени (или барем остатоците се блиску до нормалата).
3. Хомогеност на варијансата (хомоскедастичност): варијансата меѓу групите е релативно иста.
Во пракса, ANOVA е доста „робусна“ на нарушувања на нормалноста ако големините на примероците се доволно големи и избалансирани. Сепак, нарушувањата на хомогеноста на варијансата можат да бидат попроблематични, особено кога големините на примероците на секоја група се нееднакви. Тестови како што се Левеновиот или Бартлетовиот често се користат за да се потврди претпоставката за хомогеност на варијансата.
9. Интерпретација на резултатите: p-вредност и одлука
Резултатите од ANOVA обично се презентираат во ANOVA табела што содржи SSB, SSW, df, MSB, MSW, F-вредност и p-вредност.
– Ако p-вредноста ≤ α (на пр. α = 0,05), тогаш отфрлете ја H0: постои значајна разлика во просекот помеѓу групите.
– Ако p-вредноста е > α, тогаш не можеме да ја отфрлиме H0: нема доволно докази дека средните вредности се различни.
Сепак, „неуспехот да се отфрли H0“ не значи дека средните вредности се навистина исти; тоа едноставно значи дека податоците не се доволно силни за да докажат разлика.
10. Пост-хок тест по ANOVA
Ако ANOVA е значајна, следниот чекор е да се открие кои групи се разликуваат. Ова се прави со пост-хок тест, на пример:
– Tukey HSD (често се користи за споредба на сите парови).
– Бонферони (поконзервативен).
– Шефе (флексибилен за различни контрасти).
– Гејмс-Хауел (посоодветно ако варијансата не е хомогена).
Без понатамошно тестирање, знаеме само дека „постои разлика“, но не знаеме каде лежи разликата.
11. Големина на ефектот
Покрај значајноста, важно е да се наведе и колку влијание има факторот врз зависната променлива. Вообичаени големини на ефектот во ANOVA се:
– Ета на квадрат (\(\eta^2\)): процентот на вкупната варијација објаснет со групните разлики.
– Омега на квадрат (\(\omega^2\)): помалку пристрасна верзија, особено кај мали примероци.
Големините на ефектите помагаат да се процени практичната релевантност, а не само статистичката значајност.
Заклучок
Еднонасочната ANOVA е фундаментална статистичка алатка за споредување на средните вредности на повеќе од две групи врз основа на еден фактор. Основниот концепт е да се спореди варијацијата помеѓу групите со варијацијата во рамките на групите користејќи ја F статистиката. Нејзината употреба бара претпоставки за независност, нормалност и хомогеност на варијансата за да се обезбедат сигурни заклучоци. Доколку резултатите од ANOVA покажат значајни разлики, анализата продолжува со пост хок тестови за да се идентификуваат различни групи и да се пријават големини на ефектите за практично да се процени јачината на влијанието.
Ако сакате, можам да додадам комплетен пример на случај (мали податоци), едноставни чекори за рачно пресметување или пример за ANOVA излез од SPSS/R/Excel заедно со тоа како да се прочита.