ANOVA (analýza rozptylu, z anglického ANalysis Of VAriance) je test pro porovnání průměrů tří a více skupin najednou. Navzdory názvu neporovnává rozptyly – rozptyl používá jako nástroj, kterým rozezná skutečné rozdíly mezi skupinami od náhodného kolísání. Je přirozeným rozšířením t-testu na více skupin.
Proč ne prostě několik t-testů?
Nabízí se porovnat skupiny po dvojicích. Jenže každý test nese 5% riziko falešného poplachu (chyby I. druhu) – a rizika se s počtem testů sčítají. U tří skupin jsou dvojice tři a pravděpodobnost aspoň jednoho falešně významného výsledku stoupá zhruba na 14 %, u pěti skupin (deset dvojic) už přesahuje 40 %. ANOVA ověří všechny skupiny jediným testem, a udrží tak riziko na zvolené hladině α.
Jak ANOVA funguje
Celkovou variabilitu dat rozloží na dvě složky: variabilitu mezi skupinami (rozdíly skupinových průměrů) a variabilitu uvnitř skupin (přirozené kolísání jednotlivých měření). Jejich poměr je testová statistika F:
Čím víc rozdíly mezi skupinami převyšují kolísání uvnitř skupin, tím větší F – a tím menší p-hodnota.
Na co si dát pozor
Významný výsledek říká jen, že aspoň jedna skupina se liší – ne která. Následovat proto musí post-hoc testy (nejčastěji Tukeyho HSD), které porovnají dvojice se správnou korekcí. ANOVA dále předpokládá normalitu reziduí, podobné rozptyly skupin a nezávislá pozorování: při porušení prvních dvou sáhněte po neparametrickém Kruskalově–Wallisově testu, pro opakovaná měření týchž osob existuje zvláštní varianta (repeated measures ANOVA).
Příklad interpretace ANOVA
Agronomové porovnávají výnos tří odrůd pšenice na 30 pokusných parcelách. ANOVA vrátí F(2; 27) = 6,4 a p = 0,005 → nulovou hypotézu „všechny odrůdy dávají stejný průměrný výnos" zamítáme. Tukeyho test následně ukáže, že odrůda C překonává odrůdu A, zatímco B se od ostatních významně neliší – a právě tato informace rozhodne, co se bude sít.
Výpočet ANOVA v Excelu
# Data → Analýza dat → ANOVA: jeden faktor
# (vyžaduje zapnutý doplněk Analytické nástroje)
# p-hodnotu z F-statistiky spočítáte i funkcí
=F.DIST.RT(6,4; 2; 27)
Výpočet ANOVA v jazyce R
# jednofaktorová ANOVA
model <- aov(vynos ~ odruda, data = pokus)
summary(model)
# post-hoc porovnání dvojic
TukeyHSD(model)
# neparametrická alternativa
kruskal.test(vynos ~ odruda, data = pokus)
Analýze rozptylu věnujeme samostatné kurzy ANOVA v R a ANOVA v programu Statistica – od předpokladů po interpretaci výsledků na vlastních datech.
Chcete statistice rozumět do hloubky?
Kurzy statistiky pro vědce a analytiky — max. 10 účastníků, Praha.