Normální (Gaussovo) rozdělení je nejdůležitější pravděpodobnostní rozdělení ve statistice. Má tvar symetrické zvonovité křivky a je plně popsáno dvěma parametry: střední hodnotou (μ), která určuje polohu vrcholu, a směrodatnou odchylkou (σ), která určuje šířku křivky. U normálního rozdělení splývá aritmetický průměr, medián i modus v jedné hodnotě.
Pravidlo 68–95–99,7
U normálního rozdělení leží přibližně:
- 68 % hodnot v intervalu μ ± 1σ,
- 95 % hodnot v intervalu μ ± 2σ,
- 99,7 % hodnot v intervalu μ ± 3σ.
Toto pravidlo je základem intervalů spolehlivosti i posuzování odlehlých hodnot – hodnota vzdálená více než tři směrodatné odchylky od průměru je u normálně rozložených dat velmi vzácná.
Proč je normální rozdělení všude
Podle centrální limitní věty se rozdělení součtů a průměrů mnoha nezávislých vlivů blíží normálnímu – bez ohledu na to, jaké rozdělení mají jednotlivé vlivy. Proto se normální rozdělení objevuje u biologických měření (výška, krevní tlak), chyb měření i výběrových průměrů. Řada testů (t-test, ANOVA, Pearsonova korelace) předpokládá normalitu dat nebo reziduí.
Jak ověřit normalitu dat
- graficky – histogram (zvonovitý tvar) a Q–Q graf (body na přímce),
- testem normality – nejčastěji Shapirův–Wilkův test (p ≥ 0,05 normalitu nezamítá),
- u velkých souborů se opřete spíše o grafy – testy tam zamítají i nepodstatné odchylky.
Pokud data normální nejsou, sáhněte po neparametrických testech (Wilcoxonův, Mannův–Whitneyho) nebo po transformaci dat.
Normální rozdělení v Excelu
# hustota normálního rozdělení v bodě x
=NORM.DIST(x; průměr; směrodatná_odchylka; NEPRAVDA)
# pravděpodobnost hodnoty ≤ x (distribuční funkce)
=NORM.DIST(x; průměr; směrodatná_odchylka; PRAVDA)
Normální rozdělení v jazyce R
# Shapirův–Wilkův test normality
shapiro.test(data)
# Q–Q graf
qqnorm(data); qqline(data)
# generování dat z normálního rozdělení
rnorm(n = 100, mean = 50, sd = 10)
Kdy na normalitě skutečně záleží, jak ji ověřit a co dělat, když ji data nesplňují, učíme na kurzu Statistika I v R.
Chcete statistice rozumět do hloubky?
Kurzy statistiky pro vědce a analytiky — max. 10 účastníků, Praha.