МатВектор

Command Palette

Search for a command to run...

🎲 Тервер30 минСложность 3/5+65 XP

Выборка и точечные оценки: среднее и дисперсия

Как судить обо всём по части: генеральная совокупность, выборочное среднее, исправленная дисперсия и почему в знаменателе n минус один.

3 интерактива3 квизаУрок 13 из 22Обновлено 01.06.2025Обычный

Социологи заявляют: «54% горожан поддерживают новый маршрут» — хотя опросили всего тысячу человек из миллиона. Производитель проверяет 50 лампочек из партии в десять тысяч и делает вывод о всей партии. Оба сидят на одной идее: об огромной совокупности можно судить по небольшой, но правильно отобранной части. Как именно судить, насколько этому верить и зачем в формуле дисперсии выскакивает странное — вопросы этого урока. Тут начинается математическая статистика: теория вероятностей задним числом смотрит на данные.

Генеральная совокупность и выборка#

Генеральная совокупность — все интересующие нас объекты: миллион горожан, десять тысяч лампочек, все детали станка за смену. Обследовать всё — дорого, долго, а иногда и невозможно: проверка «всех спичек» уничтожает все спички. Поэтому из совокупности извлекают выборку — набор из наблюдений , которым суждено представлять целое.

Чтобы представлять честно, выборка должна быть репрезентативной: каждый объект совокупности имеет равный шанс попасть в неё. Опросить тысячу человек у одного выхода из метро — значит опросить один район, а не город. Классическое решение — случайный отбор с возвращением или без: теория вероятностей позволяет считать выборку набором независимых случайных величин с тем же распределением, что у генеральной совокупности. Именно эта модельная рамка делает все дальнейшие формулы осмысленными.

Первый шаг обработки — упорядочить данные по возрастанию: получится вариационный ряд. Затем считают частоты: сколько раз встретилось каждое значение , и относительные частоты . Например, из пяти наблюдений получим значения с частотами и относительными частотами . Сумма относительных частот всегда единица — то же условие нормировки, что и у закона распределения в уроке о дискретных величинах.

Выборочное среднее: оценка центра#

Центр выборки описывает выборочное среднее — знакомый всем минус очков:

выборочное среднее; через частоты: x̄ = Σ n_i x_i / n

Среднее — случайная величина: возьмёте другую выборку, получите другое число. Отсюда главный вопрос статистики: насколько эта случайная оценка похожа на истину? Смотрят на три качества. Несмещённость: в среднем по многим выборкам оценка попадает в истинное значение — систематической ошибки нет. Состоятельность: с ростом оценка прижимается к истине — за это отвечает закон больших чисел. Эффективность: разброс оценки меньше, чем у конкурентов из того же класса.

Для среднего всё прекрасно. Если в совокупности среднее равно и дисперсия , то — несмещённость налицо, а — разброс сжимается с ростом выборки. Корень из этого числа, , — знаменитая стандартная ошибка среднего: погрешность оценки убывает как единица на корень из объёма выборки. Хотите вдвое точнее — соберите вчетверо больше данных; вот почему качественные опросы так дороги.

Выборочная дисперсия и загадка n − 1#

Разброс описывает выборочная дисперсия — средний квадрат отклонений от выборочного среднего:

S² — обычная выборочная дисперсия, s² — исправленная (с делением на n − 1)

Подвох в том, что оценка смещена: она систематически занижает истинную дисперсию . Причина честная: отклонения считаются не от истинного центра , а от выборочного — центра, подогнанного под те же данные. Подогнанный центр лежит ближе к точкам, чем настоящий, квадраты отклонений выходят меньше. Точный подсчёт даёт : не хватает множителя . Умножив на него, получаем исправленную дисперсию с честным ожиданием .

Числовой прогон. Выборка : среднее . Квадраты отклонений: ; сумма . Обычная выборочная дисперсия ; исправленная . Исправленная всегда не меньше — и не потому, что «данные на самом деле разбросаны сильнее», а потому, что мы сняли занижение от подгонки центра.

Оценка доли: маршрутка и проценты#

Вторая классическая задача — оценка вероятности (доли) по частоте. Из опрошенных ответили «да»; точечная оценка доли — выборочная доля . Под капотом — схема Бернулли: каждый ответчик даёт единицу или ноль, среднее и есть доля. Несмещённость очевидна из линейности ожидания, а дисперсия оценки равна , где — истинная доля.

Числа: опросили человек, за маршрут. Оценка . Стандартная ошибка , то есть около полутора процентных пунктов. Вот откуда в серьёзных опросах берутся «погрешность ±2%»: берут две-три стандартные ошибки, и в дело вступает нормальное приближение из ЦПТ.

ОцениваемОценкаНесмещённая?Стандартная ошибка
Среднее да
Дисперсию да (исправленная)зависит от распределения
Долю да
Три главные точечные оценки начального курса статистики

Среднее — не единственная мера центра, и на кривых данных она подводит. Вернёмся к зарплатам из начала урока: пять человек получают тысяч. Среднее тысяч — больше, чем у четверых из пяти. Медиана — значение, делящее упорядоченный ряд пополам — здесь тысяч, и она честнее описывает «типичного человека». Практическое правило: при сильных выбросах или скошенных данных доверяйте медиане, а среднее пускайте в дело только после проверки на выбросы.

  1. Упорядочите выборку: .
  2. Нечётный объём : медиана — средний по счёту элемент, третий по порядку: .
  3. При чётном объёме, например , медиана — полусумма двух средних элементов: .
  4. Сравните со средним этих четырёх чисел: — совпало, потому что выбросов нет.

Третья мера центра — мода: значение с наибольшей частотой. В ряду мода равна . Для данных, измеренных грубо или носящих «пиковый» характер, мода иногда полезнее среднего и медианы: у размера одежды, продаваемой магазином, важна именно самая ходовая величина, а не средняя по витрине.

Проверь себя+15 XP

Зачем в исправленной дисперсии деление на ?

Проверь себя+15 XP

Выборка: 2, 4, 6. Чему равны и исправленная ?

Проверь себя+15 XP

Из 1000 опрошенных 540 поддержали проект. Оценка доли и её стандартная ошибка?

Частые вопросы

Что такое точечная оценка параметра?

Одно число, вычисленное по выборке и принятое за приближённое значение параметра совокупности: вместо , вместо , вместо . Хорошая оценка несмещена (не завышает и не занижает в среднем), состоятельна (точнеет с ростом n) и эффективна (имеет минимальный разброс).

Чем выборочное среднее отличается от математического ожидания?

Ожидание — характеристика теоретического распределения, известная только в задачах с заданной моделью. Выборочное среднее — наблюдаемое число, вычисленное из данных. Математическое ожидание — то, что оцениваем; — то, чем оцениваем. По закону больших чисел при росте выборки второе приближается к первому.

Когда использовать , а когда исправленную ?

Если выборка — вся, что вам известно, а дисперсию оцениваете с целью судить о совокупности, берите с делением на . Деление на допустимо, когда центр известен заранее (не подгоняется под данные) или при очень больших , где разница исчезает. В учебных задачах по умолчанию почти всегда ждут исправленную.

Что изучать дальше?

Следующий шаг — интервальные оценки: как из и стандартной ошибки собрать интервал, накрывающий истину с заданной надёжностью. А перед этим полезно закрепить текущий материал: дисперсия — в словаре, полный разбор её свойств — в уроке об ожидании и дисперсии.

Готовитесь к контрольной?

Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.

Открыть чеклист предмета →

Проверьте себя в бою

Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.

Начать босс-экзамен →