Мои результаты неожиданны?
| English | Русский |
|---|---|
| counts/kaʊnts/ | учитывается |
| observed counts/ɒbˈzɜːvd kaʊnts/ | наблюдаемые частоты |
| expected counts/ekˈspektɪd kaʊnts/ | ожидаемыми частотами |
| chi-square/kaɪ skweə/ | хи-квадрат (χ²) |
| goodness-of-fit/ˈɡʊdnəs ɒv fɪt/ | соответствие распределению |
Когда подсчеты удивляют нас
- Некоторые вопросы спрашивают, отличаются ли наблюдаемые подсчеты от того, что мы бы ожидали.
- "Соответствуют ли цвета в пакетике конфет заявленной смеси?"
- Мы сравниваем наблюдаемые подсчеты с ожидаемыми подсчетами согласно утверждению.
- Большие расхождения между наблюдаемыми и ожидаемыми являются сигналом чего-то необычного.
Семейство хи-квадрат
- Инструмент — семейство тестов хи-квадрат, записывается как ⟨$\chi^2$⟩.
- Он предназначен для категориальных данных — подсчетов по категориям, а не измерений.
- Каждый тест хи-квадрат сравнивает наблюдаемые частоты с ожидаемыми.
- Чем больше общая разница → тем больше $\chi^2$ → сильнее доказательства против утверждения.
Какой тест хи-квадрат?
- Качество подгонки: соответствует ли один категориальный переменный заявленному распределению?
- Вопросы по двусторонней таблице: связаны ли два категориальных переменных (между группами или внутри одной)?
- Одна переменная, одна выборка → качество подгонки; таблица двух переменных → однородность/независимость.
- Определение типа — это первое решение.
Наблюдаемые и ожидаемые
- Каждый тест хи-квадрат основан на одном сравнении: наблюдаемые и ожидаемые частоты.
- Ожидаемые = то, что предсказывает нулевая гипотеза для каждой частоты.
- Наблюдаемые = то, что фактически показывают данные.
- Тест измеряет, насколько в целом наблюдаемые отклоняются от ожидаемых.
Тесты хи-квадрат используют ЧАСТОТЫ, а не пропорции или проценты. Если в задаче даны проценты, переведите их обратно в фактические частоты перед вычислениями. Вся логика строится на наблюдаемых vs. ожидаемых: ожидаемые частоты получаются из нулевой модели, и большая общая расхождение делает $\chi^2$ большим.
В мешке утверждается равное количество $4$ цветов конфет; вы считаете $100$ конфет.
- Ожидаемые (равномешанные): $25$ каждого цвета.
- Наблюдаемые: $30, 20, 28, 22$ — близко, но не точно.
- Тест хи-квадрат определяет, являются ли эти расхождения неожиданными или просто случайностью.
Тесты хи-квадрат спрашивают, отличаются ли наблюдаемые частоты от ожидаемых частот для категориальных данных. Тест качества подгонки проверяет один переменный против заявленного распределения; тесты двусторонней таблицы проверяют, связаны ли два переменных. Каждый $\chi^2$ тест сравнивает наблюдаемые vs. ожидаемые частоты.
Разбивка по категориям (подсчеты)
Критерий хи-квадрат сравнивает наблюдаемые доли с ожидаемыми.
Для какого типа данных предназначен критерий хи-квадрат?
Критерий хи-квадрат сравнивает подсчеты по категориям.
Сколько категориальных переменных участвует в тесте на соответствие распределению?
TDF проверяет одну переменную на соответствие заявленному распределению.
Критерий хи-квадрат следует применять к процентам, а не к подсчетам.
Сначала переведите проценты обратно в подсчеты — хи-квадрат работает с подсчетами.
В мешке 100 конфет утверждается, что существует 4 равновероятных цвета. Каков ожидаемый подсчет для каждого цвета?
100 ÷ 4 = 25 ожидаемых на каждый цвет.
Каждый тест хи-квадрат сравнивает наблюдаемые подсчеты с ___ подсчетами (одно слово).
Наблюдаемое против ожидаемого — это суть хи-квадрата.