Критерий согласия хи-квадрат: проверяем честность кубика
Критерий χ² Пирсона шаг за шагом: кубик на 60 бросков, степени свободы и пороги, объединение редких ячеек на примере Пуассона и краткий обзор критерия Колмогорова.
Сосед по общежитию три вечера кидает свой кубик и ведёт счёт: из 60 бросков шестёрка выпала 18 раз, а пятёрка — 14. «Кубик кривой, со мной играют нечестно», — делает вывод он. Шесть лишних шестёрок — это много или обычная случайность? Интуиция молчит: у случайности широкий почерк. А статистика даёт численный ответ за пять минут — критерием согласия χ² Пирсона. Им же проверяют, ложатся ли данные на нормальный закон, и этим же ловят накрутки в голосованиях.
Когда частоты слишком разные: в чём идея критерия?#
Проверяем нулевую гипотезу: «кубик честный, все грани равновероятны». Из неё мгновенно следует, сколько выпадений каждой грани ждать в среднем: при бросках ожидаемая частота . Реальные, наблюдаемые частоты от ожидаемых почти никогда не совпадут — вопрос не в наличии расхождения, а в его размере. Пирсон предложил измерять расхождение так:
Почему именно так? Квадрат снимает знак — перевыпадение и недовыпадение одинаково подозрительны. Деление на приводит всё к одной шкале: промах на 3 при ожидании 100 — мелочь, а при ожидании 5 — катастрофа. А сумма по всем ячейкам собирает картину целиком, не давая одной грани замаскировать остальные. Логика нулевой гипотезы и уровня значимости разобрана с нуля в уроке про проверку гипотез.
Гениальный ход Пирсона (1900 год) — он вычислил распределение этой суммы при верной гипотезе: оказалось, при больших она подчиняется закону с степенями свободы. Отсюда рецепт: посчитать статистику по данным и сравнить её с критическим значением — порогом, который честный кубик перескакивает редко (обычно в 5% или 1% случаев).
Как посчитать χ² на кубике и выбрать порог?#
Возвращаемся к соседу. Наблюдаемые частоты: — в сумме 60, всё честно. Ожидаемые — по 10 на грань. Считаем вклады и складываем:
- Вклады граней: , , четыре грани по .
- Сумма: .
- Степени свободы: — граней шесть, но сумма частот жёстко равна , одна связь съедает одну степень.
- Порог на уровне 5%: . Наше больше — гипотезу о честности отвергаем.
- Порог на уровне 1%: . Теперь меньше — на этом уровне гипотезу не отвергаем.
Два разных ответа? Нет, одно решение с разной страховкой. На 5% уровне мы допускаем ошибку «обвинить невиновный» в пяти случаях из ста — при (точный p-value ≈ 0,04) риска не больше договорённого, отвергаем. Требование «ошибаться лишь в 1% случаев» смягчает приговор: для такого обвинения нужен более редкий расклад. Соседу честно скажем: данные говорят против кубика на привычном пороге, но неопровержимых улик уровня «один шанс из ста» нет.
Для контраста возьмём другой вечер: . Вклады: . Три против порога — расхождения вдвое-двое меньше того, что честный кубик себе позволяет. Никакого дела нет: при верной гипотезе такого размера случается примерно в 70% вечеров. Различие между и — и есть разница между «подозрительно» и «шум».
Где критерий живёт за пределами казино?#
Классика генетики. Мендель скрещивал горох и ждал расщепления по признакам в соотношении — всего семян. Ожидаемые частоты: . Наблюдения: . Статистика: при и пороге — данные ложатся на теорию Менделя почти идеально. Именно этот расчёт (по-другому оформленный) защищал его выводы от обвинений в подгонке: слишком уж красивые числа у Менделя до сих пор вызывают у историков науки лёгкую иронию.
Та же механика работает в A/B-тестировании, когда сравнивают две доли, в маркетинге — при проверке «равномерности» выбора вариантов упаковки, в веб-аналитике — при контроле распределения кликов по дням недели. Везде один и тот же рецепт: есть теоретическая пропорция, есть наблюдаемые частоты, есть шкала , которая превращает «что-то кажется странным» в число с порогом. Разница только в том, откуда берутся ожидания: из у кубика, из закона Пуассона у опечаток, из гипотезы равномерности у кликов.
Что делать с редкими событиями: правило E ≥ 5#
Предостережение: приближение Пирсона опирается на то, что ожидаемые частоты не крошечные. Стандартное требование — в каждой ячейке . Что делать, если в хвосте таблицы ожидания падают до единиц? Объединять соседние ячейки, пока правило не выполнится. Типовая ситуация — проверка распределения Пуассона (о ней в уроке биномное и Пуассона): пусть на 100 страницах рукописи искали опечатки. Среднее число опечаток на страницу оценили по тем же данным: . Ожидаемые частоты:
Ячейка «4 опечатки» ожидается в случаях — меньше пяти. Хвост «от 4 и больше» вместе даёт лишь — тоже не дотягивает. Приходится сливать от трёх: ячейка «3 и больше» ожидается с . Наблюдаемые частоты (100 страниц): 31, 35, 20 страниц без опечаток, с одной и с двумя; плюс 11 страниц с тремя и 3 страницы с четырьмя — хвост 14. Сводим таблицу и считаем:
| Опечаток на странице | Наблюдено $O$ | Ожидается $E$ |
|---|---|---|
| 0 | 31 | 30,1 |
| 1 | 35 | 36,1 |
| 2 | 20 | 21,7 |
| 3 и больше | 14 | 12,1 |
Степени свободы считаются по формуле , где — число ячеек после объединения, — число параметров, оценённых по той же выборке. Здесь , а : параметр мы взяли из данных, он «связал» частоты. Итого , порог на 5% — . Статистика в шесть раз меньше порога: данных против гипотезы Пуассона нет (p-value ≈ 0,78).
А если распределение непрерывное? Критерий Колмогорова#
χ²-критерий группирует данные по ячейкам — для непрерывного закона границы приходится придумывать, а это произвол. Критерий Колмогорова обходится без группировки: строится эмпирическая функция распределения (доля наблюдений левее — ступеньки) и измеряется её максимальный вертикальный зазор от теоретической :
При верной статистика имеет распределение Колмогорова; на 5% уровне критическое значение . Проверили 100 наблюдений, максимальный зазор вышел : — повода отвергнуть нет. Тонкость: если параметры закона (среднее, сигма) оценены по той же выборке, порог занижен — нужны поправки Лиллиефорса. Куда копать дальше: оценки и выборка — в уроке выборка и оценки, сам нормальный закон — в уроке про нормальное распределение и словарной статье о нормальном распределении; математическое ожидание в языке ожидаемых частот уже встретилось вам сегодня.
Выбор между критериями простой: данные дискретны и делятся на ячейки — берите χ² Пирсона; данные непрерывны и жалко терять информацию группировкой — берите Колмогорова, если параметры известны заранее, или дополняйте его поправками, если оценены. А если объём мал и ячейки всё равно не набирают пяти ожиданий, у статистиков есть ещё точный критерий Фишера для таблиц — про него рассказывают в курсах статистики поглубже; здесь достаточно понимать, что χ² — не единственный инструмент, но самый частый гость в задачниках.
| Степени свободы df | Порог при α = 0,05 | Порог при α = 0,01 |
|---|---|---|
| 2 | 5,99 | 9,21 |
| 3 | 7,81 | 11,34 |
| 4 | 9,49 | 13,28 |
| 5 | 11,07 | 15,09 |
Порядок работы при любой проверке согласия один: сформулировать конкретным законом с конкретными параметрами, выписать ожидаемые частоты, объединить редкие ячейки, посчитать статистику, найти степени свободы и сравнить с порогом. Тренировочные задачи на всю эту цепочку лежат в тренажёре по теории вероятностей, готовые рецепты — в шпаргалке по статистике и гипотезам, а пошаговые разборы — в разделе как решать задачи на вероятность.
- — квадрат промаха, делённый на ожидание, по всем ячейкам
- Степени свободы: ; оценка параметров по выборке вычитается обязательна
- Порог зависит от уровня значимости: кубик с при отвергается на 5%, но не на 1%
- Ячейку с нельзя оставлять — объединяйте с соседями до выполнения правила
- Для непрерывных законов без группировки — Колмогоров: против на 5%
Кубик кидали 60 раз и посчитали χ². Сколько у него степеней свободы?
Для кубика получилось при . Какой вердикт на уровне значимости 1%?
Когда ячейки объединяют перед применением критерия χ²?
Частые вопросы
Чем критерий χ² Пирсона отличается от критерия Колмогорова?
Работой с данными. Пирсон требует сгруппировать наблюдения по ячейкам и сравнивает частоты; Колмогоров работает с накопленной функцией распределения без группировки. Для дискретных данных с малым числом исходов удобнее χ², для непрерывных законов честнее Колмогоров. Но параметры, оценённые по выборке, ломают пороги обоих.
Почему степени свободы считаются как m − 1 − r?
Каждая связь между частотами съедает одну степень свободы. Сумма наблюдаемых частот жёстко равна объёму выборки — минус единица. Если параметр закона оценивался по тем же данным, частоты ещё сильнее привязаны к наблюдениям — минус по одному за каждый параметр. Остаток и есть число независимых расхождений.
Что значит «отвергаем на 5%, но не на 1%»?
Результат попал в редкую, но не в исключительную зону. На 5% уровне мы соглашаемся ошибочно обвинить честный кубик в пяти случаях из ста — таких данных достаточно. Для обвинения с ошибкой в одном случае из ста данных не хватает. Это один и тот же эксперимент, но разная цена ошибки.
Можно ли применять критерий χ² к маленьким выборкам?
Осторожно. Приближение Пирсона опирается на большие ожидаемые частоты; при меньше пары десятков оно врёт. Выходы: объединить ячейки (если правило вообще достижимо), взять точный критерий для таблиц сопряжённости или собрать больше данных. Малая выборка — повод сначала посчитать ожидания, а потом уже решать.
Готовитесь к контрольной?
Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.
Открыть чеклист предмета →
Проверьте себя в бою
Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.
Начать босс-экзамен →