Доверительные интервалы: оценка параметра с заданной надёжностью
Почему 54% без погрешности — пустое число, как собрать интервал для среднего и доли, зачем нужен Стьюдент и сколько данных брать. С примерами и симулятором.
Опрос показал: 54% избирателей поддерживают реформу. Ведущий новостей называет число — и ни слова о том, что за ним стоит. Статистик ответит иначе: «от 51 до 57 процентов при надёжности 95%». Интервал вместо точки, честное сообщение о погрешности вместо ложной точности. Доверительный интервал — главный ответ статистики на вопрос «насколько вам можно верить», и после выборки и точечных оценок настало время научиться его строить.
От точки к интервалу: почему одно число — мало#
Точечная оценка страдает врождённым дефектом: она случайна. Возьмёте другую выборку — получите другое число, и заранее неизвестно, выше оно или ниже истины. Одно число не сообщает, насколько далеко от истины оно может отстоять. Интервальная оценка исправляет это: по данным строят отрезок , который с заранее выбранной вероятностью накрывает неизвестный параметр. Число называют доверительной вероятностью или надёжностью; в прикладных задачах обычно берут , реже или .
Как читать надёжность честно? Частотная формулировка такая: если много раз повторить эксперимент — новая выборка, новый интервал, снова выборка, снова интервал, — то примерно 95% полученных интервалов накроют истинное значение, а 5% промахнутся. Мы не знаем, к какой группе попал наш конкретный интервал, но знаем долю попаданий у метода.
Интервал для среднего, когда σ известна#
Классическая конструкция. Из совокупности с известным стандартным отклонением взята выборка объёма , посчитано среднее . Тогда доверительный интервал для с надёжностью выглядит так:
Читаем по частям. — центр, наша лучшая догадка. — стандартная ошибка среднего, погрешность оценки; она убывает как единица на корень из объёма выборки. Множитель растягивает полосу под выбранную надёжность: при берут — ровно тот отступ, внутри которого стандартная нормальная величина лежит с вероятностью 0,95. Вся конструкция опирается на нормальное распределение и центральную предельную теорему: при больших выборках среднее близко к нормальному даже если сами данные не нормальные.
| Надёжность $\gamma$ | Квантиль $z$ | Полуширина интервала |
|---|---|---|
| 0,90 | 1,645 | |
| 0,95 | 1,96 | |
| 0,99 | 2,576 |
Числовой прогон. Измерена твёрдость закалённых деталей, единиц, из многолетнего опыта . Стандартная ошибка . Полуширина . Интервал: . Вывод, который пишут в отчёте: «с надёжностью 0,95 истинная средняя твёрдость лежит между 98,04 и 101,96». Ширина здесь задана ошибкой среднего, а не желанием исследователя — и это честная ширина.
σ неизвестна: распределение Стьюдента#
В реальных задачах известна редко: если бы мы знали разброс совокупности, зачем бы мы вообще измеряли среднее? Практический маршрут — подставить вместо исправленное выборочное из тех же данных. Но сама колеблется от выборки к выборке, и замена делает оценку шатче. Уильям Госсет, публиковавшийся под псевдонимом Стьюдент, в 1908 году посчитал точное распределение получившейся статистики — у него тяжелее хвосты, чем у нормального, и множитель при ошибке берётся из таблиц распределения Стьюдента с числом степеней свободы :
Пример. Шестнадцать измерений дали и . Ошибка . Квантиль Стьюдента для надёжности 0,95 и степеней свободы равен . Полуширина , интервал . Обратите внимание: при том же интервал вышел бы шире нормального с известным — плата за незнание разброса. При квантиль Стьюдента почти неотличим от , поэтому большие выборки считаются по нормальной схеме без угрызений совести.
Интервал для доли#
Вторая главная задача — по частоте судить о вероятности: из опрошенных сказали «да». Выборочная доля колеблется вокруг истинной со стандартной ошибкой , где ; в формуле неизвестную заменяют на . Интервал:
Возвращаемся к опросу из начала урока: , . Ошибка . Полуширина . Интервал — вот откуда берётся пресловутое «±3 процентных пункта» в подписях к графикам опросов. И есть содержательный вывод: вся полоса лежит выше отметки , значит, с надёжностью 0,95 поддержку большинства утверждать можно — хотя запас тонкий, левая граница выше половины лишь на девять тысячных.
Сколько данных собирать: обратная задача#
Часто интервал не результат, а требование технического задания: «оценить среднее с точностью не хуже при надёжности ». Полуширина должна не превосходить : . Выражаем объём:
Числа. Нужно оценить среднюю массу посылки с точностью до 1 кг при надёжности 0,95, разброс известен: кг. Тогда — округляем всегда вверх: . Для доли подставляют (худший случай, максимальный разброс): при точности 3 п.п. выходит , то есть человек — реальные социологи и опрашивают около тысячи. Корень в знаменателе мстит за оптимизм: вдвое точнее — вчетверо дороже, это прямое следствие закона больших чисел.
Одни данные — три интервала
Посмотрим, как надёжность растягивает границы на примере с твёрдостью деталей: , , . Для отступ и интервал . Для — и . Для — и . Картина закономерная: чем увереннее обещание, тем оно просторнее, и ни один исследователь не может выбрать «надёжно и узко» одновременно — при фиксированных данных это сделка двух участников, а не дипломатическая победа.
Последняя оговорка о честности. Центральная полоса с равными хвостами — соглашение, а не догма: принципиально можно построить несимметричный интервал, накрывающий с той же вероятностью. Соглашение живёт потому, что при симметричном, умеренно колоколообразном распределении среднего оно даёт самый узкий интервал. А сама нормальность среднего при больших обеспечивается центральной предельной теоремой даже для ненормальных данных — при условии, что у совокупности есть конечная дисперсия и наблюдения независимы.
- Надёжность задана — интервал растёт: 0,99 шире, чем 0,95, при тех же данных
- Выборка подросла в 4 раза — интервал сузился вдвое (корень из n в знаменателе)
- σ неизвестна — меняем z на квантиль Стьюдента с степенями свободы
- Доля оценивается по ; без информации берём
- Округление n — всегда вверх; формулы живут в шпаргалке по вероятности
Интервал и проверка гипотез — две стороны одной медали: интервал, не содержащий гипотетического значения, тут же подсказывает, что тест такую гипотезу отвергнет. Об этом — в следующем уроке о проверке статистических гипотез. А если хочется просто потренировать глаз на частотах и вероятностях, загляните в тренажёр по теории вероятностей.
Какая величина случайна в доверительном оценивании?
n = 100, x̄ = 50, σ = 5, надёжность 0,95. Чему равен интервал?
Точность Δ = 2, σ = 6, надёжность 0,95. Какой минимальный объём выборки?
Частые вопросы
Что означает «надёжность 0,95» человеческим языком?
Метод, которым построен интервал, в 95% случаев даёт накрывающий параметр отрезок. Про ваш конкретный интервал гарантий нет: он либо накрыл μ, либо нет, третьего не дано. 0,95 — характеристика метода, а не одного результата.
Когда использовать z, а когда Стьюдента?
z — когда генеральное σ известно из внешних источников. Стьюдента — когда σ заменяется выборочным s; это почти всегда. При n ≥ 30 разница практически исчезает, и обе схемы дают одинаковые интервалы.
Почему при росте надёжности интервал расширяется?
Чтобы ловить параметр чаще, нужно накрывать больше возможных значений: квантиль 2,576 вместо 1,96 растягивает полосу примерно на треть. Точность и надёжность конкурируют, и разрывает эту связку только увеличение выборки.
Можно ли строить интервал для дисперсии?
Можно: при нормальной совокупности используют распределение хи-квадрат, и интервал получается асимметричным — дисперсия неотрицательна и её оценки скошены. В базовом курсе обычно ограничиваются интервалами для среднего и доли, а хи-квадрат оставляют на потом.
Готовитесь к контрольной?
Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.
Открыть чеклист предмета →
Проверьте себя в бою
Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.
Начать босс-экзамен →