Статистические выводы с использованием нормального и t-распределений
| English | Русский |
|---|---|
| sample/ˈsæmpl/ | выборка |
| distribution/ˌdɪstrɪˈbjuːʃn/ | распределение |
| variance/ˈveərɪəns/ | дисперсией |
| tail/teɪl/ | хвост распределения |
| confidence interval/ˈkɒnfɪdəns ˈɪntəvl/ | доверительный интервал |
| degrees of freedom/dɪˈɡriːz ɒv ˈfriːdəm/ | число степеней свободы |
| standard error/ˈstændəd ˈerə/ | стандартная ошибка |
| paired/peəd/ | парных |
| pooled estimate/puːld ˈestɪmət/ | объединенная оценка |
Малые выборки, честная неопределенность
- При огромной выборке можно использовать нормальное распределение. Но при всего, скажем, 8 измерениях и неизвестном разбросе нормальное распределение слишком уверенно.
- Уильям Госсет, работавший в Guinness, изобрел $t$-распределение, чтобы справиться именно с этим — малыми выборками с неизвестной дисперсией.
Когда использовать t-распределение
- Используйте $t$-распределение, когда выборка малая, а дисперсия генеральной совокупности неизвестна (вы оцениваете ее с помощью выборочной $s$).
- Оно колоколообразное, как нормальное, но с более тяжелыми хвостами — широкими, чтобы учитывать дополнительную неопределенность.

t-распределение колоколообразное, как нормальное, но с более тяжелыми хвостами; по мере роста выборки оно приближается к нормальному.
Статистические выводы и нормальная кривая
P(Z < z)
Тесты и интервалы читают площади под нормальной кривой — сдвиньте z, чтобы найти их.
Вы используете t-распределение (вместо нормального), когда:
Малый n при неизвестном σ → оцениваем с помощью s и используем t.
t-распределение имеет более тяжелые хвосты, чем нормальное распределение.
Более тяжелые хвосты отражают дополнительную неопределенность при оценке дисперсии; t → нормальному по мере роста n.
Доверительный интервал для среднего
- Доверительный интервал для среднего генеральной совокупности:
- $t$ берется из таблиц $t$ с $n - 1$ степенями свободы; $\dfrac{s}{\sqrt n}$ — это стандартная ошибка.
Для одной выборки размером n = 10, сколько степеней свободы использует t-значение?
Степени свободы = n − 1 = 9.
Величина s/√n называется стандартной ______.
Стандартная ошибка среднего равна s/√n.
Разобранный пример
- Выборка из $n = 10$ имеет $s = 4$; для 95% доверительного уровня с 9 степенями свободы, $t = 2.262$.
- Погрешность $= t\dfrac{s}{\sqrt n} = 2.262 \times \dfrac{4}{\sqrt{10}} = 2.86$ (2 знака после запятой).

t-распределение имеет меньшую вершину и более тяжелые хвосты, чем нормальное
Выборка n = 10 имеет s = 4. При t = 2.262, какова погрешность t × s/√n? (2 знака после запятой)
2.262 × 4/√10 = 2.262 × 1.265 = 2.86.
Сравнение двух генеральных совокупностей
- 2-выборочный или парный $t$-тест сравнивает две генеральные совокупности.
- Когда предполагается, что они имеют общую дисперсию, объедините их в совместную оценку $s^2$.
Степени свободы, а не $n$. Значение $t$ использует $n - 1$ степеней свободы, а не $n$. Чтение неправильной строки таблицы — самая частая ошибка.
- Для малой выборки основывайте гипотезу на $t$-распределении: 2-выборочный t-тест или парный t-тест.
Вы поняли
- малая выборка + неизвестная дисперсия → используйте $t$-распределение ($n-1$ степеней свободы)
- CI для среднего: $\bar{x} \pm t\dfrac{s}{\sqrt{n}}$, со стандартной ошибкой $\dfrac{s}{\sqrt n}$
- сравните две генеральные совокупности с помощью 2-выборочного или парного $t$-теста (объедините дисперсию, если она общая)