Выборка и точечные оценки: среднее и дисперсия
Как судить обо всём по части: генеральная совокупность, выборочное среднее, исправленная дисперсия и почему в знаменателе n минус один.
Социологи заявляют: «54% горожан поддерживают новый маршрут» — хотя опросили всего тысячу человек из миллиона. Производитель проверяет 50 лампочек из партии в десять тысяч и делает вывод о всей партии. Оба сидят на одной идее: об огромной совокупности можно судить по небольшой, но правильно отобранной части. Как именно судить, насколько этому верить и зачем в формуле дисперсии выскакивает странное — вопросы этого урока. Тут начинается математическая статистика: теория вероятностей задним числом смотрит на данные.
Генеральная совокупность и выборка#
Генеральная совокупность — все интересующие нас объекты: миллион горожан, десять тысяч лампочек, все детали станка за смену. Обследовать всё — дорого, долго, а иногда и невозможно: проверка «всех спичек» уничтожает все спички. Поэтому из совокупности извлекают выборку — набор из наблюдений , которым суждено представлять целое.
Чтобы представлять честно, выборка должна быть репрезентативной: каждый объект совокупности имеет равный шанс попасть в неё. Опросить тысячу человек у одного выхода из метро — значит опросить один район, а не город. Классическое решение — случайный отбор с возвращением или без: теория вероятностей позволяет считать выборку набором независимых случайных величин с тем же распределением, что у генеральной совокупности. Именно эта модельная рамка делает все дальнейшие формулы осмысленными.
Первый шаг обработки — упорядочить данные по возрастанию: получится вариационный ряд. Затем считают частоты: сколько раз встретилось каждое значение , и относительные частоты . Например, из пяти наблюдений получим значения с частотами и относительными частотами . Сумма относительных частот всегда единица — то же условие нормировки, что и у закона распределения в уроке о дискретных величинах.
Выборочное среднее: оценка центра#
Центр выборки описывает выборочное среднее — знакомый всем минус очков:
Среднее — случайная величина: возьмёте другую выборку, получите другое число. Отсюда главный вопрос статистики: насколько эта случайная оценка похожа на истину? Смотрят на три качества. Несмещённость: в среднем по многим выборкам оценка попадает в истинное значение — систематической ошибки нет. Состоятельность: с ростом оценка прижимается к истине — за это отвечает закон больших чисел. Эффективность: разброс оценки меньше, чем у конкурентов из того же класса.
Для среднего всё прекрасно. Если в совокупности среднее равно и дисперсия , то — несмещённость налицо, а — разброс сжимается с ростом выборки. Корень из этого числа, , — знаменитая стандартная ошибка среднего: погрешность оценки убывает как единица на корень из объёма выборки. Хотите вдвое точнее — соберите вчетверо больше данных; вот почему качественные опросы так дороги.
Выборочная дисперсия и загадка n − 1#
Разброс описывает выборочная дисперсия — средний квадрат отклонений от выборочного среднего:
Подвох в том, что оценка смещена: она систематически занижает истинную дисперсию . Причина честная: отклонения считаются не от истинного центра , а от выборочного — центра, подогнанного под те же данные. Подогнанный центр лежит ближе к точкам, чем настоящий, квадраты отклонений выходят меньше. Точный подсчёт даёт : не хватает множителя . Умножив на него, получаем исправленную дисперсию с честным ожиданием .
Числовой прогон. Выборка : среднее . Квадраты отклонений: ; сумма . Обычная выборочная дисперсия ; исправленная . Исправленная всегда не меньше — и не потому, что «данные на самом деле разбросаны сильнее», а потому, что мы сняли занижение от подгонки центра.
Оценка доли: маршрутка и проценты#
Вторая классическая задача — оценка вероятности (доли) по частоте. Из опрошенных ответили «да»; точечная оценка доли — выборочная доля . Под капотом — схема Бернулли: каждый ответчик даёт единицу или ноль, среднее и есть доля. Несмещённость очевидна из линейности ожидания, а дисперсия оценки равна , где — истинная доля.
Числа: опросили человек, за маршрут. Оценка . Стандартная ошибка , то есть около полутора процентных пунктов. Вот откуда в серьёзных опросах берутся «погрешность ±2%»: берут две-три стандартные ошибки, и в дело вступает нормальное приближение из ЦПТ.
| Оцениваем | Оценка | Несмещённая? | Стандартная ошибка |
|---|---|---|---|
| Среднее | да | ||
| Дисперсию | да (исправленная) | зависит от распределения | |
| Долю | да |
Среднее — не единственная мера центра, и на кривых данных она подводит. Вернёмся к зарплатам из начала урока: пять человек получают тысяч. Среднее тысяч — больше, чем у четверых из пяти. Медиана — значение, делящее упорядоченный ряд пополам — здесь тысяч, и она честнее описывает «типичного человека». Практическое правило: при сильных выбросах или скошенных данных доверяйте медиане, а среднее пускайте в дело только после проверки на выбросы.
- Упорядочите выборку: .
- Нечётный объём : медиана — средний по счёту элемент, третий по порядку: .
- При чётном объёме, например , медиана — полусумма двух средних элементов: .
- Сравните со средним этих четырёх чисел: — совпало, потому что выбросов нет.
Третья мера центра — мода: значение с наибольшей частотой. В ряду мода равна . Для данных, измеренных грубо или носящих «пиковый» характер, мода иногда полезнее среднего и медианы: у размера одежды, продаваемой магазином, важна именно самая ходовая величина, а не средняя по витрине.
Зачем в исправленной дисперсии деление на ?
Выборка: 2, 4, 6. Чему равны и исправленная ?
Из 1000 опрошенных 540 поддержали проект. Оценка доли и её стандартная ошибка?
Частые вопросы
Что такое точечная оценка параметра?
Одно число, вычисленное по выборке и принятое за приближённое значение параметра совокупности: вместо , вместо , вместо . Хорошая оценка несмещена (не завышает и не занижает в среднем), состоятельна (точнеет с ростом n) и эффективна (имеет минимальный разброс).
Чем выборочное среднее отличается от математического ожидания?
Ожидание — характеристика теоретического распределения, известная только в задачах с заданной моделью. Выборочное среднее — наблюдаемое число, вычисленное из данных. Математическое ожидание — то, что оцениваем; — то, чем оцениваем. По закону больших чисел при росте выборки второе приближается к первому.
Когда использовать , а когда исправленную ?
Если выборка — вся, что вам известно, а дисперсию оцениваете с целью судить о совокупности, берите с делением на . Деление на допустимо, когда центр известен заранее (не подгоняется под данные) или при очень больших , где разница исчезает. В учебных задачах по умолчанию почти всегда ждут исправленную.
Что изучать дальше?
Следующий шаг — интервальные оценки: как из и стандартной ошибки собрать интервал, накрывающий истину с заданной надёжностью. А перед этим полезно закрепить текущий материал: дисперсия — в словаре, полный разбор её свойств — в уроке об ожидании и дисперсии.
Готовитесь к контрольной?
Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.
Открыть чеклист предмета →
Проверьте себя в бою
Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.
Начать босс-экзамен →