Теория вероятностей и математическая статистика: в чём разница
Коротко: Учить первым стоит теорию вероятностей: без неё статистика превращается в набор рецептов. Вероятность идёт от модели к событию, статистика — от выборки к модели; связывает их центральная предельная теорема.
Их так часто ставят рядом — «теория вероятностей и математическая статистика» — что многие считают это одним предметом. В расписании да, одним; по направлению мысли — двумя противоположными. Теория вероятностей идёт от модели к данным: распределение известно, и мы вычисляем, какие события и как часто из него вытекают. Математическая статистика идёт в обратную сторону: данные есть, а модель неизвестна — её нужно восстановить, оценить и проверить.
Понимание разницы экономит месяцы учёбы: у двух миров разные инструменты и разные ловушки. Ниже — таблица отличий, разбор каждого мира, мост между ними (центральная предельная теорема и связь «выборка ↔ распределение») и честный ответ, что сложнее. Практика по смежным задачам — в разборе как решать задачи на вероятность, задачах типа вероятность и тренажёре вероятности.
| Критерий | Теория вероятностей | Математическая статистика |
|---|---|---|
| Направление мысли | от модели к данным: распределение известно — считаем события | от данных к модели: выборка есть — восстанавливаем распределение |
| Ключевые объекты | событие, вероятность, случайная величина, матожидание, дисперсия | выборка, оценка параметра, доверительный интервал, уровень значимости |
| Главные инструменты | классическая вероятность, формула Байеса, схема Бернулли | выборочное среднее, доверительные интервалы, критерии проверки гипотез |
| Типичные задачи | найти вероятность события, матожидание выигрыша, число успехов в серии | оценить параметр, построить интервал, проверить гипотезу по данным |
| Кому нужна в первую очередь | моделистам: финансы, страхование, теория игр | аналитикам данных: эксперименты, A/B-тесты, отчёты |
Короткий ответ: сначала — вероятность#
Учить первым стоит теорию вероятностей: без неё статистика превращается в набор рецептов «считайте так». Формулы статистики — оценки, интервалы, критерии — выводятся вероятностными рассуждениями, и студент, пропустивший вероятность, вынужден верить рецептам на слово. У статистики, впрочем, есть свой плюс: вход в неё «земляной» — среднее по выборке посчитает каждый, и первые темы идут легко и без парадоксов.
«Сложнее» в этих мирах тоже распределено по-разному: в вероятности трудность — моделирование, перевод житейской истории в события и схемы; в статистике — интерпретация, понимание того, что именно утверждает доверительный интервал и что значит «гипотеза отвергнута». Определения и примеры — в уроках классическая вероятность и выборка и оценки.
Что такое теория вероятностей#
Теория вероятностей — математика случайности при известной модели. Монета симметрична, кубик честный, детали независимы — и вопрос всегда один: какие шансы у интересующего нас события. Отправные точки курса: классическая вероятность как отношение благоприятных исходов ко всем, условная вероятность и формула Байеса, схема Бернулли для серий независимых испытаний. Два самых «переиспользуемых» понятия — термины условная вероятность и формула Байеса: они потом всплывут и в статистике, и в машинном обучении.
Второй этаж — случайные величины: дискретные и непрерывные, их характеристики — математическое ожидание и дисперсия — и семейства распределений: биномное, Пуассона, нормальное. Уроки дискретные случайные величины и нормальное распределение переводят предмет из «монеток и кубиков» в язык, на котором статистика будет формулировать свои вопросы.
Что такое математическая статистика#
Математическая статистика — искусство вывода из данных. Модель неизвестна: известно только, что природа что-то выдала — выборку из n измерений. Задач три: оценить параметры (какое среднее у генеральной совокупности?), оценить надёжность оценки (доверительные интервалы — термин доверительный интервал) и проверить гипотезы (есть ли разница между группами или это шум?). Все три задачи разобраны в уроке проверка гипотез — термин нулевая гипотеза здесь центральный.
Ключевой поворот мышления: выборочное среднее — случайная величина. Возьмите другую выборку — получите другое число. Вся статистика живёт вокруг вопроса «насколько сильно оно меняется?» — и отвечает на него распределениями выборочных характеристик, которые поставляет как раз теория вероятностей. Финал курса — корреляция и регрессия: первая встреча с моделированием связей между величинами.
Мост между мирами: ЦПТ и выборка#
Два результата делают из двух предметов одну науку. Первый — закон больших чисел: выборочное среднее стабилизируется вокруг математического ожидания по мере роста выборки (урок закон больших чисел). Он оправдывает саму идею оценивать среднее по данным: измерять выборку имеет смысл, потому что она не врёт в среднем.
Второй и главный — центральная предельная теорема: стандартизованная сумма многих независимых слагаемых, вклад каждого из которых мал, ведёт себя как нормальное распределение — каким бы ни было распределение отдельных слагаемых:
Смысл моста: статистика берёт выборку (мир данных), а ЦПТ переводит её характеристики в распределение (мир вероятности) — и дальше работают вероятностные инструменты: по нормальной кривой считаются доверительные интервалы и критические значения критериев. Связь «выборка ↔ распределение» — не метафора, а ровно эта теорема: она позволяет делать вероятностные заявления о данных, не зная их точного распределения.
Задачи из каждого мира#
Быстрый тест на принадлежность: если распределение известно и спрашивается про шансы — это вероятность; если данные известны и спрашивается про модель — статистика.
Типичные задачи теории вероятностей
- В урне 5 белых и 3 чёрных шара, вынули два: какова вероятность, что оба белые? (классическая вероятность и гипергеометрический подсчёт)
- Прибор отказывает с вероятностью 0,02 в час: какова вероятность ровно одной поломки за смену из 100 часов? (приближение Пуассона — термин распределение Пуассона)
- Тест дал положительный результат: какова вероятность болезни, если тест точен на 99%? (формула Байеса — и почему интуиция тут врёт)
- Стрелок попадает с вероятностью 0,7: сколько попаданий ждать в серии из 10 выстрелов и с каким разбросом? (схема Бернулли)
Типичные задачи статистики
- По 64 измерениям нашли среднее 12,4, дисперсия известна: построить 95%-й доверительный интервал для среднего генеральной совокупности.
- Заявлено, что новая кнопка повышает конверсию: проверить гипотезу по данным A/B-теста на уровне значимости 0,05.
- По парам «реклама — продажи» оценить связь: коэффициент корреляции и линейная регрессия.
- Партия из 1000 деталей, выборка 50: оценить долю брака и сказать, насколько оценке можно верить.
Потренировать вероятностный мир можно на тренажёре вероятности и в задачах типа вероятность; формулы обоих миров собраны в шпаргалке по вероятности и шпаргалке «статистика и гипотезы».
Что сложнее: честный разбор#
В вероятности труднее всего начало: моделирование. Условие — житейская история, и вся сложность в переводе её на язык событий: что считать исходом, какие события независимы, откуда берётся условность. Стоит модель построиться — арифметика почти всегда простая. Вторая трудность — комбинаторика: подсчёт числа исходов требует аккуратности и тренировки (урок комбинаторика, термин размещения и сочетания).
В статистике труднее конец: техника считается легко — среднее, дисперсия, формула интервала, — но интерпретация требует зрелости. Доверительный интервал не означает «параметр лежит внутри с вероятностью 95%» в наивном смысле; «гипотеза отвергнута» не означает «она неверна»; корреляция не означает причинность. Баллы на экзамене теряются не на вычислениях, а на выводах после них.
На контрольных статистические задачи чаще «бумажные» — подставить в формулу и сделать вывод, — вероятностные «головоломные» — построить модель. Кому что проще, зависит от склада ума, поэтому честный совет один: прогоните по десятку задач каждого мира и посмотрите, где решения получаются сами.
Маршрут на семестр#
- Недели 1–3: классическая вероятность, условная вероятность, формула Байеса. Практика — разбор как решать задачи на вероятность.
- Недели 4–6: комбинаторика и схема Бернулли; довести подсчёт исходов до автоматизма на тренажёре комбинаторики.
- Недели 7–9: случайные величины, матожидание и дисперсия; биномное распределение и Пуассона (урок биномное и Пуассона).
- Недели 10–11: непрерывные величины и нормальное распределение; ЦПТ — сквозная тема (урок непрерывные случайные величины).
- Недели 12–14: выборка и оценки, доверительные интервалы — первая настоящая статистика на данных.
- Недели 15–16: проверка гипотез и корреляция — финал курса и мост в анализ данных.
Распределение случайной величины известно полностью. Какова вероятность, что она примет значение в заданном интервале? Это задача…
По 100 измерениям построили доверительный интервал для среднего. Какая наука работала и на каком мосту?
Частые вопросы
Можно ли изучать статистику без теории вероятностей?
Формально можно просчитывать примеры, но без вероятности статистика не понимается: оценки, интервалы и критерии — вероятностные утверждения о выборочных характеристиках. Минимум для старта: классическая вероятность, матожидание и дисперсия, нормальное распределение и ЦПТ.
Чем выборочное среднее отличается от математического ожидания?
Матожидание — характеристика распределения, число, которое знает природа, но не вы. Выборочное среднее — оценка этого числа по данным; случайная величина, которая меняется от выборки к выборке и лишь приближается к матожиданию с ростом n — это закон больших чисел.
Что такое ЦПТ и зачем она нужна на практике?
Центральная предельная теорема утверждает: стандартизованная сумма многих независимых малых вкладов ведёт себя как нормальное распределение независимо от природы слагаемых. Для статистики это фундамент: при больших выборках можно строить доверительные интервалы и критерии, не зная точного распределения данных.
Где тренироваться решать задачи обоих миров?
Вероятность — разбор как решать задачи на вероятность и тренажёр вероятности. Статистика — формулы в шпаргалке «статистика и гипотезы» и типовые задачи на оценки в задачах типа «вероятность».
Дальше по теме: термины среднеквадратичное отклонение и критерий хи-квадрат — для статистического блока; метод наименьших квадратов — для регрессии. Обзор всего курса — на странице теории вероятностей и матстатистики.