МатВектор

Command Palette

Search for a command to run...

🎲 Тервер32 минСложность 3/5+70 XP

Проверка статистических гипотез: ошибки, критерии и p-value

Как доказать, что станок сбился, а монета нечестная: нулевая гипотеза, ошибки I и II рода, z-критерий и честное прочтение p-value. С пошаговыми примерами.

4 интерактива3 квизаУрок 15 из 22Обновлено 01.06.2025Обычный

Фабрика заявляет: каждая пачка чая весит 500 граммов. Контролёр взвесил 25 пачек и получил в среднем 495. Совпадение или сбой? Прокурорский вопрос «докажите, что станок виноват» статистика не устраивает — данные шумные, и любой средний может отклониться просто так. Вместо этого статистика работает как суд презумпцией невиновности: гипотеза считается верной, пока данные не докажут обратное. Как именно оформляют такое доказательство — тема урока.

Нулевая и альтернативная гипотезы#

Нулевая гипотеза — утверждение «ничего особенного не происходит», вариант по умолчанию: станок настроен верно, лекарство работает не лучше плацебо, монета честная. Альтернативная гипотеза — то, что мы подозреваем на самом деле: вес отличается, лекарство помогает, монета кривая. Проверяют всегда именно : решение звучит как «отвергаем » или «не отвергаем», и никогда — «доказали ».

Альтернатива бывает двусторонней (: отклонение в любую сторону нас настораживает) и односторонней ( или : важно лишь одно направление). Двусторонняя — выбор по умолчанию: она не подыгрывает исследователю. Одностороннюю имеет смысл ставить, когда отклонение в другую сторону физически неотличимо от нуля или неинтересно по постановке задачи.

  • : — станок держит номинал; : — сбился
  • : монета честная, ; : — монета кривая
  • : новое лекарство не лучше старого; : лучше (односторонняя)
  • : данные коррелируют так же, как два независимых набора; : связь есть

Два способа ошибиться: α и β#

Решение принимается по данным, а данные случайны — значит, возможны ошибки, и их ровно две. Ошибка I рода: отвергнуть верную — посадить невиновный станок. Её вероятность обозначают и называют уровнем значимости; стандарт . Ошибка II рода: не отвергнуть ложную — отпустить виноватый. Её вероятность . Величина — мощность критерия: способность распознать реальное отклонение, когда оно есть.

$H_0$ верна$H_0$ неверна
Отвергли ошибка I рода, вероятность верное решение (мощность )
Не отвергли верное решениеошибка II рода, вероятность
Четыре исхода статистического суда

Симметрии тут нет: уменьшая , мы делаем критерий строже и одновременно увеличиваем — при том же объёме выборки бесплатного обеда не бывает. Единственный способ снизить обе ошибки сразу — собрать больше данных. Эту развилку стоит держать в голове всякий раз, когда кто-то хвастается одновременно сверхжёстким порогом значимости и сверхвысокой обнаруживаемостью на крошечной выборке.

Как устроен z-критерий#

Пусть проверяется , а известно. Логика проста: если верна, то выборочное среднее колеблется вокруг со стандартной ошибкой — мы измеряем, на сколько стандартных ошибок наблюдение отползло от номинала:

z-статистика: отклонение выборочного среднего, измеренное в стандартных ошибках

При верной статистика близка к стандартному нормальному распределению: обычно она гуляет в пределах . Если же получилось, скажем, , случайностью это объясняется плохо — либо редкая удача одна на шестьдесят серий, либо неверна. Порог задаёт : для двусторонней альтернативы при критическая область — .

Пример: пачки чая

Номинал г, из длительного опыта г, взвешено пачек, г. Считаем по шагам — и проверьте каждую строчку сами.

Обратите внимание на масштаб: пять граммов кажутся мелочью, но пять граммов на фоне ошибки в два грамма — большое отклонение. Статистика меряет не отклонение само по себе, а его отношение к шуму. Тот же сдвиг при дал бы и никакого заключения — шум съел бы сигнал. А если бы контролёра интересовало только занижение веса, тест стал бы односторонним: , критическая область , и те же данные дали бы p-value вместо — весь уровень значимости ушёл бы в один хвост.

p-value: докладная статистики#

Современные пакеты выдают не «попал/не попал», а число — p-value: вероятность при верной получить отклонение статистики не слабее наблюдаемого. Для примера с пачками , и нормальная кривая за пределами оставляет долю — вот и p-value. Смысл: если бы станок был настроен верно, такой перекос случился бы примерно в одном эксперименте из восьмидесяти. Решение принимают сравнением с : p-value меньше — отвергаем. Правило «p < 0,05 — значимо» — та же проверка , записанная через площадь.

Бросим монету сто раз и увидим 62 орла. Честная монета? Доля , ошибка , статистика , p-value . На уровне 0,05 — отвергаем: монета подозрительна. А 55 орлов дали бы и p-value около 0,32 — обычная случайность, хотя глазу 55% тоже «много». Здесь как раз пригодится симулятор ниже: даже честная монета регулярно выдаёт серии с перевесом.

Мощность: почему тесты не замечают слабые эффекты#

Мощность отвечает на вопрос «поймаем ли мы отклонение величиной , если оно есть». Она растёт с тремя величинами: с размером эффекта , с уровнем и с объёмом выборки . Отсюда практика планирования эксперимента: прежде чем тестировать, прикидывают, какой нужен, чтобы обнаружить практически важный эффект с вероятностью хотя бы 0,8. Тест с малой мощностью опасен не ошибкой, а тишиной: он пропустит сбой станка, и брак пойдёт к покупателям.

  1. Сформулируйте и ; альтернатива двусторонняя, если нет причин для иного
  2. Выберите уровень значимости — до взгляда на данные, обычно 0,05
  3. Выберите критерий и статистику (z при известной σ, Стьюдента при выборочной s)
  4. Вычислите статистику по выборке и критическую точку (или p-value)
  5. Сделайте вывод на языке задачи: «станок занижает вес», а не « отвергнута»

Тестирование и интервальное оценивание — взаимодополняющие техники: интервал показывает диапазон правдоподобных значений, тест даёт бинарный вердикт. Загляните в предыдущий урок о доверительных интервалах, если формулы квантилей забылись, и в урок о выборке — там определены , и стандартная ошибка, на которых стоит весь этот каркас. Потренироваться считать частоты и вероятности можно в тренажёре по теории вероятностей.

Проверь себя+15 XP

Контролёр не отверг гипотезу о номинале на выборке из 5 пачек. Что это доказывает?

Проверь себя+15 XP

μ₀ = 100, σ = 15, n = 9, x̄ = 109. Чему равна z-статистика двустороннего теста?

Проверь себя+15 XP

Что означает p-value = 0,03 в тесте с α = 0,05?

Частые вопросы

Почему проверяют нулевую, а не альтернативную гипотезу?

Потому что только порождает конкретное распределение статистики: при известно, как гуляет . Альтернатива расплывчата — «мю не равно 500» — и не позволяет посчитать вероятности. Судебная метафора точна: улики оцениваются в рамках презумпции невиновности.

Чем односторонний тест отличается от двустороннего?

Двусторонний реагирует на отклонение в любую сторону, критическая область делится пополам: . Односторонний собирает весь уровень с одной стороны: . Он чувствительнее к эффекту нужного направления, но слеп к противоположному — поэтому обосновывать направление надо до анализа данных.

p-value = 0,07 — это «почти значимо» и результат можно назвать открытием?

Нет: при вердикт один — не отвергаем. Данные допускают дальнейшее исследование на большей выборке, но подпись «значимо» несправедлива. Мягкие формулировки вроде «обнаружен намёк, требующий проверки» уместны, подгонка порога под результат — нет.

Что делать, если σ неизвестно и выборка маленькая?

Заменить σ выборочным s и взять критерий Стьюдента с степенями свободы: статистика , квантили тяжелее нормальных. Механика вывода не меняется — меняется только таблица, откуда берётся порог.

Готовитесь к контрольной?

Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.

Открыть чеклист предмета →

Проверьте себя в бою

Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.

Начать босс-экзамен →