МатВектор

Command Palette

Search for a command to run...

🎲 Тервер

Теория вероятностей и математическая статистика: в чём разница

Теория вероятностейМатстатистика

Коротко: Учить первым стоит теорию вероятностей: без неё статистика превращается в набор рецептов. Вероятность идёт от модели к событию, статистика — от выборки к модели; связывает их центральная предельная теорема.

План на семестр Вердикт: с чего начать

Их так часто ставят рядом — «теория вероятностей и математическая статистика» — что многие считают это одним предметом. В расписании да, одним; по направлению мысли — двумя противоположными. Теория вероятностей идёт от модели к данным: распределение известно, и мы вычисляем, какие события и как часто из него вытекают. Математическая статистика идёт в обратную сторону: данные есть, а модель неизвестна — её нужно восстановить, оценить и проверить.

Понимание разницы экономит месяцы учёбы: у двух миров разные инструменты и разные ловушки. Ниже — таблица отличий, разбор каждого мира, мост между ними (центральная предельная теорема и связь «выборка ↔ распределение») и честный ответ, что сложнее. Практика по смежным задачам — в разборе как решать задачи на вероятность, задачах типа вероятность и тренажёре вероятности.

КритерийТеория вероятностейМатематическая статистика
Направление мыслиот модели к данным: распределение известно — считаем событияот данных к модели: выборка есть — восстанавливаем распределение
Ключевые объектысобытие, вероятность, случайная величина, матожидание, дисперсиявыборка, оценка параметра, доверительный интервал, уровень значимости
Главные инструментыклассическая вероятность, формула Байеса, схема Бернулливыборочное среднее, доверительные интервалы, критерии проверки гипотез
Типичные задачинайти вероятность события, матожидание выигрыша, число успехов в серииоценить параметр, построить интервал, проверить гипотезу по данным
Кому нужна в первую очередьмоделистам: финансы, страхование, теория играналитикам данных: эксперименты, A/B-тесты, отчёты
Теория вероятностей и статистика: пять линий отличия

Короткий ответ: сначала — вероятность#

Учить первым стоит теорию вероятностей: без неё статистика превращается в набор рецептов «считайте так». Формулы статистики — оценки, интервалы, критерии — выводятся вероятностными рассуждениями, и студент, пропустивший вероятность, вынужден верить рецептам на слово. У статистики, впрочем, есть свой плюс: вход в неё «земляной» — среднее по выборке посчитает каждый, и первые темы идут легко и без парадоксов.

«Сложнее» в этих мирах тоже распределено по-разному: в вероятности трудность — моделирование, перевод житейской истории в события и схемы; в статистике — интерпретация, понимание того, что именно утверждает доверительный интервал и что значит «гипотеза отвергнута». Определения и примеры — в уроках классическая вероятность и выборка и оценки.

Что такое теория вероятностей#

Теория вероятностей — математика случайности при известной модели. Монета симметрична, кубик честный, детали независимы — и вопрос всегда один: какие шансы у интересующего нас события. Отправные точки курса: классическая вероятность как отношение благоприятных исходов ко всем, условная вероятность и формула Байеса, схема Бернулли для серий независимых испытаний. Два самых «переиспользуемых» понятия — термины условная вероятность и формула Байеса: они потом всплывут и в статистике, и в машинном обучении.

Второй этаж — случайные величины: дискретные и непрерывные, их характеристики — математическое ожидание и дисперсия — и семейства распределений: биномное, Пуассона, нормальное. Уроки дискретные случайные величины и нормальное распределение переводят предмет из «монеток и кубиков» в язык, на котором статистика будет формулировать свои вопросы.

Что такое математическая статистика#

Математическая статистика — искусство вывода из данных. Модель неизвестна: известно только, что природа что-то выдала — выборку из n измерений. Задач три: оценить параметры (какое среднее у генеральной совокупности?), оценить надёжность оценки (доверительные интервалы — термин доверительный интервал) и проверить гипотезы (есть ли разница между группами или это шум?). Все три задачи разобраны в уроке проверка гипотез — термин нулевая гипотеза здесь центральный.

Ключевой поворот мышления: выборочное среднее — случайная величина. Возьмите другую выборку — получите другое число. Вся статистика живёт вокруг вопроса «насколько сильно оно меняется?» — и отвечает на него распределениями выборочных характеристик, которые поставляет как раз теория вероятностей. Финал курса — корреляция и регрессия: первая встреча с моделированием связей между величинами.

Мост между мирами: ЦПТ и выборка#

Два результата делают из двух предметов одну науку. Первый — закон больших чисел: выборочное среднее стабилизируется вокруг математического ожидания по мере роста выборки (урок закон больших чисел). Он оправдывает саму идею оценивать среднее по данным: измерять выборку имеет смысл, потому что она не врёт в среднем.

Второй и главный — центральная предельная теорема: стандартизованная сумма многих независимых слагаемых, вклад каждого из которых мал, ведёт себя как нормальное распределение — каким бы ни было распределение отдельных слагаемых:

ЦПТ: стандартизованное выборочное среднее стремится к стандартному нормальному закону — термин центральная предельная теорема

Смысл моста: статистика берёт выборку (мир данных), а ЦПТ переводит её характеристики в распределение (мир вероятности) — и дальше работают вероятностные инструменты: по нормальной кривой считаются доверительные интервалы и критические значения критериев. Связь «выборка ↔ распределение» — не метафора, а ровно эта теорема: она позволяет делать вероятностные заявления о данных, не зная их точного распределения.

Задачи из каждого мира#

Быстрый тест на принадлежность: если распределение известно и спрашивается про шансы — это вероятность; если данные известны и спрашивается про модель — статистика.

Типичные задачи теории вероятностей

  • В урне 5 белых и 3 чёрных шара, вынули два: какова вероятность, что оба белые? (классическая вероятность и гипергеометрический подсчёт)
  • Прибор отказывает с вероятностью 0,02 в час: какова вероятность ровно одной поломки за смену из 100 часов? (приближение Пуассона — термин распределение Пуассона)
  • Тест дал положительный результат: какова вероятность болезни, если тест точен на 99%? (формула Байеса — и почему интуиция тут врёт)
  • Стрелок попадает с вероятностью 0,7: сколько попаданий ждать в серии из 10 выстрелов и с каким разбросом? (схема Бернулли)

Типичные задачи статистики

  • По 64 измерениям нашли среднее 12,4, дисперсия известна: построить 95%-й доверительный интервал для среднего генеральной совокупности.
  • Заявлено, что новая кнопка повышает конверсию: проверить гипотезу по данным A/B-теста на уровне значимости 0,05.
  • По парам «реклама — продажи» оценить связь: коэффициент корреляции и линейная регрессия.
  • Партия из 1000 деталей, выборка 50: оценить долю брака и сказать, насколько оценке можно верить.

Потренировать вероятностный мир можно на тренажёре вероятности и в задачах типа вероятность; формулы обоих миров собраны в шпаргалке по вероятности и шпаргалке «статистика и гипотезы».

Что сложнее: честный разбор#

В вероятности труднее всего начало: моделирование. Условие — житейская история, и вся сложность в переводе её на язык событий: что считать исходом, какие события независимы, откуда берётся условность. Стоит модель построиться — арифметика почти всегда простая. Вторая трудность — комбинаторика: подсчёт числа исходов требует аккуратности и тренировки (урок комбинаторика, термин размещения и сочетания).

В статистике труднее конец: техника считается легко — среднее, дисперсия, формула интервала, — но интерпретация требует зрелости. Доверительный интервал не означает «параметр лежит внутри с вероятностью 95%» в наивном смысле; «гипотеза отвергнута» не означает «она неверна»; корреляция не означает причинность. Баллы на экзамене теряются не на вычислениях, а на выводах после них.

На контрольных статистические задачи чаще «бумажные» — подставить в формулу и сделать вывод, — вероятностные «головоломные» — построить модель. Кому что проще, зависит от склада ума, поэтому честный совет один: прогоните по десятку задач каждого мира и посмотрите, где решения получаются сами.

Маршрут на семестр#

  1. Недели 1–3: классическая вероятность, условная вероятность, формула Байеса. Практика — разбор как решать задачи на вероятность.
  2. Недели 4–6: комбинаторика и схема Бернулли; довести подсчёт исходов до автоматизма на тренажёре комбинаторики.
  3. Недели 7–9: случайные величины, матожидание и дисперсия; биномное распределение и Пуассона (урок биномное и Пуассона).
  4. Недели 10–11: непрерывные величины и нормальное распределение; ЦПТ — сквозная тема (урок непрерывные случайные величины).
  5. Недели 12–14: выборка и оценки, доверительные интервалы — первая настоящая статистика на данных.
  6. Недели 15–16: проверка гипотез и корреляция — финал курса и мост в анализ данных.
Проверь себя+15 XP

Распределение случайной величины известно полностью. Какова вероятность, что она примет значение в заданном интервале? Это задача…

Проверь себя+15 XP

По 100 измерениям построили доверительный интервал для среднего. Какая наука работала и на каком мосту?

Частые вопросы

Можно ли изучать статистику без теории вероятностей?

Формально можно просчитывать примеры, но без вероятности статистика не понимается: оценки, интервалы и критерии — вероятностные утверждения о выборочных характеристиках. Минимум для старта: классическая вероятность, матожидание и дисперсия, нормальное распределение и ЦПТ.

Чем выборочное среднее отличается от математического ожидания?

Матожидание — характеристика распределения, число, которое знает природа, но не вы. Выборочное среднее — оценка этого числа по данным; случайная величина, которая меняется от выборки к выборке и лишь приближается к матожиданию с ростом n — это закон больших чисел.

Что такое ЦПТ и зачем она нужна на практике?

Центральная предельная теорема утверждает: стандартизованная сумма многих независимых малых вкладов ведёт себя как нормальное распределение независимо от природы слагаемых. Для статистики это фундамент: при больших выборках можно строить доверительные интервалы и критерии, не зная точного распределения данных.

Где тренироваться решать задачи обоих миров?

Вероятность — разбор как решать задачи на вероятность и тренажёр вероятности. Статистика — формулы в шпаргалке «статистика и гипотезы» и типовые задачи на оценки в задачах типа «вероятность».

Дальше по теме: термины среднеквадратичное отклонение и критерий хи-квадрат — для статистического блока; метод наименьших квадратов — для регрессии. Обзор всего курса — на странице теории вероятностей и матстатистики.