МатВектор

Command Palette

Search for a command to run...

🎲 Тервер

Как решать задачи на дисперсионный анализ (ANOVA): пример

Пошаговый алгоритм однофакторного ANOVA: гипотезы, таблица сумм квадратов, F-критерий 7,2 против 4,26, η² и тест Тьюки — на примере трёх методов обучения.

Сложность: Первый курс 2 схемы действий

Завкафедрой собрал три группы по четыре студента: одни готовились к тесту по лекциям, другие — на практикуме, третьи — в смешанном формате. Баллы на руках, вопрос один: метод влияет на результат или разница — случайность? Три t-теста подряд проблему не решают: каждая проверка вносит свой шанс промахнуться, и уже на трёх парах вероятность хоть одной ложной тревоги подскакивает с 5% до . Для таких вопросов и придуман дисперсионный анализ. Теория и вывод формул — в уроке дисперсионный анализ; здесь — рабочая процедура: от гипотез до проверенного вывода и пост-хока.

Весь разброс баллов можно разрезать на две части: то, что создано различием средних групп, и то, что осталось внутри групп. Первая часть — сигнал, вторая — шум. Отношение сигнала к шуму, каждое слагаемое нормированное своей степенью свободы, и есть F-статистика. Дальше — аккуратный счёт, и почти каждый шаг снабжён встроенной проверкой.

Когда ANOVA применим, а когда нужен другой тест?#

Метод требует четырёх условий, и все они проверяются до вычислений, а не после:

  • фактор качественный и имеет три и более уровня — группы, методы, станки, сорта;
  • наблюдения независимы: каждый студент попал ровно в одну группу;
  • данные внутри групп примерно симметричны — близки к нормальному распределению — или групп достаточно много;
  • дисперсии групп близки (гомоскедастичность): грубое правило — наибольшая выборочная дисперсия не превосходит наименьшую в 3–4 раза.

При двух группах ANOVA вырождается в t-тест: F численно равен квадрату t-статистики. Логику отвержения гипотез и работу с порогом α мы расписали в уроке проверка гипотез и в термине нулевая гипотеза. Если условия нарушены — не беда: внизу есть таблица замен (Уэлч, Краскел–Уоллис), а пока идём по канону.

Как записать гипотезы и что именно проверяет F?#

Нулевая гипотеза — все групповые средние равны. Альтернатива — хотя бы одно отличается. В формулировке альтернативы и прячется первая ловушка: не «все различаются», а «хоть один». Два метода могут совпадать между собой, но если третий выбился, H₀ падает целиком.

μᵢ — средний балл в i-й группе; при верной H₀ фактор ни при чём, различия — только шум

Проверочный инструмент строится на двух оценках одного и того же шума. Внутригрупповой средний квадрат MSW оценивает шум всегда — это разброс студентов внутри одного метода. Межгрупповой MSB при верной H₀ оценивает тот же шум, а при неверной — раздувается вместе с различием средних. Отношение двух оценок в норме держится около единицы:

k — число групп, N — общее число наблюдений; SSB и SSW — суммы квадратов между группами и внутри

Как собрать таблицу сумм квадратов?#

SSB — взвешенные квадраты отклонений средних групп от общего среднего; SSW — разброс внутри каждой группы

Здесь — среднее группы i, — общее среднее по всем N наблюдениям, — размер группы. Групповые средние и дисперсии считаются как обычные выборочные характеристики — материал урока выборка и оценки. Общая сумма квадратов складывается из двух частей и служит встроенной проверкой:

посчитайте SST независимо, как сумму квадратов всех отклонений от общего среднего, и сравните с SSB + SSW
ИсточникСумма квадратовdfСредний квадратF
Между группамиSSB
Внутри группSSW—
ИтогоSST——
классическая ANOVA-таблица: каждая сумма квадратов делится на свою степень свободы

Критическое значение берётся из таблицы F-распределения Фишера по паре степеней свободы: . Наблюдаемая F больше критического — H₀ отвергается. Напоминание, на чём всё это стоит: дисперсия — средний квадрат отклонений, см. термин дисперсия.

  1. Проверьте применимость: три и более группы, независимость наблюдений, примерная нормальность, близость дисперсий.
  2. Выпишите и , зафиксируйте уровень значимости — обычно .
  3. Посчитайте групповые средние и общее среднее .
  4. Найдите SSB и SSW; проверьте разложение прямым подсчётом по всем отклонениям.
  5. Степени свободы ; средние квадраты и .
  6. Статистика ; сравните с из таблицы Фишера.
  7. Если H₀ отвергнута — пост-хок тест Тьюки: какие именно пары средних различаются.
  8. Добавьте размер эффекта и сформулируйте вывод словами: что значимо, насколько велико, что это значит практически.

Сквозной пример: три метода, двенадцать студентов#

Вернёмся к вводной задаче. Баллы и групповые средние:

МетодБаллы четырёх студентовСреднее $\bar{x}_i$
Лекции58, 60, 64, 6662
Практикум62, 66, 72, 7268
Смешанный69, 71, 77, 7974
n = 4 в каждой группе, всего N = 12 наблюдений

При равных размерах групп общее среднее — обычное среднее трёх чисел: .

  1. Межгрупповая часть: .
  2. Внутригрупповая: лекции ; практикум ; смешанный . Итого .
  3. Проверка: . Прямой подсчёт всех двенадцати отклонений от 68 даёт по группам — сошлось.
  4. Степени свободы: между группами , внутри . Средние квадраты: , .
  5. Статистика: . Критическое значение по таблице: .
  6. Вывод: — H₀ отвергается. Приближённый p-уровень здесь : при верной H₀ такая или большая F выпадает примерно в 1,4% экспериментов.
наблюдаемая F превышает критическую в 1,7 раза — различие методов не сводится к шуму

Осталось назвать размер эффекта: . Шестьдесят два процента разброса баллов создаётся самим фактом «группы учились по-разному», остальные 38% — индивидуальный шум. Эффект крупный, а не просто формально значимый.

Какие пары различаются: пост-хок Тьюки?#

Отвергнутая H₀ не говорит, какие именно группы выбились. Ответ даёт тест Тьюки: каждая пара средних сравнивается с единым порогом HSD — критерий размаха q, умноженный на корень из MSW, делённого на размер группы. Для трёх групп, девяти степеней свободы и критерий q ≈ 3,95:

n — размер группы; порог один на все пары, и именно он держит семейную ошибку на уровне 5%
Пара методовРазность среднихВывод
Лекции — Практикум6не значима: 6 < 8,83
Лекции — Смешанный12значима: 12 > 8,83
Практикум — Смешанный6не значима: 6 < 8,83
значимо различается только пара крайних средних — лекции против смешанного формата

Честная оговорка: F значим, а значимых пар — всего одна. Тьюки намеренно консервативен: порог 8,83 шире, чем у трёх независимых t-тестов, зато общая вероятность ошибки остаётся на уровне 5% при любом числе сравнений. Интервальный взгляд даёт то же: 95-процентный интервал для разности «смешанный − лекции» — от 3,2 до 20,8 балла, и лишь он не содержит ноль.

Что делать, если что-то пошло не по канону?#

СлучилосьЧто делать
F < 1Шум сильнее различий групп — H₀ не отвергается; это нормальный исход, а не ошибка расчёта
F близко к F_критЧестный ответ — «различие не выявлено на взятом α»; увеличить выборку можно только в новом эксперименте
Дисперсии групп сильно различаютсяANOVA Уэлча: та же логика, но без требования равенства дисперсий
Группы разного размераСчитать можно; для пост-хока брать Тьюки–Крамера вместо обычного Тьюки
Нормальность под сомнением, группы малыНепараметрический аналог — критерий Краскела–Уоллиса по рангам
В данных подозрительный выбросСначала проверить исходник: ошибка ввода или реальное наблюдение; удалять молча нельзя
быстрая диагностика: аномалия → следующий шаг

Уэлч и Краскел–Уоллис — не экзотика, а штатные замены. Первый отвечает на тот же вопрос о средних, но устойчив к разным дисперсиям; второй сравнивает распределения по рангам и почти не замечает выбросов. Оба выдают p-уровень, и дальнейшая логика вывода не меняется.

Проверь себя+15 XP

Групп три, всего 12 наблюдений, SSB = 288, SSW = 180. Чему равна F-статистика?

Проверь себя+15 XP

Порог Тьюки HSD ≈ 8,83, разности средних групп — 6, 12 и 6. Сколько пар различаются значимо?

Частые вопросы

Чем ANOVA отличается от t-теста?

t-тест сравнивает ровно две группы; ANOVA — любое число групп одним тестом. При двух группах они эквивалентны: F равен квадрату t. А вот при трёх и больше серия t-тестов быстро накапливает ложные тревоги: уже три сравнения поднимают общую ошибку примерно до 14%. ANOVA проверяет равенство всех средних сразу на уровне α, а конкретные пары ищет пост-хок.

Что делать, если выборки разного размера?

Однофакторный ANOVA работает и с разными n: в SSB отклонения средних просто взвешиваются размерами групп, остальные формулы не меняются. Меняются две вещи. Пост-хок: обычный Тьюки предполагает равные n, поэтому берут его обобщение — Тьюки–Крамера. И чувствительность: маленькие группы добавляют неопределённости, а при сильной асимметрии размеров и дисперсий надёжнее ANOVA Уэлча.

Что такое η² и как его читать?

Это доля общего разброса, объяснённая фактором: η² = SSB/SST. Значение 0,62 означает, что 62% разброса наблюдений приходится на различие групп, остальные 38% — шум внутри них. Ориентиры для поведенческих наук: 0,01 — малый эффект, 0,06 — средний, 0,14 и выше — большой. p-уровень отвечает на вопрос «случайно ли различие», η² — «насколько оно велико»; для полного вывода нужны оба.

Когда вместо ANOVA нужен Уэлч или Краскел–Уоллис?

Уэлч — когда дисперсии групп явно различаются, а сравнивать хочется именно средние: он заменяет MSW взвешенной оценкой и поправляет степени свободы. Краскел–Уоллис — когда нормальность под сомнением или шкала порядковая: он сравнивает группы по рангам и почти не чувствителен к выбросам. Грубое правило: наибольшая выборочная дисперсия превосходит наименьшую втрое и больше — берите Уэлч.

Куда дальше: формулы по всей статистике собраны в шпаргалке по статистике и гипотезам и шпаргалке по теории вероятностей; теория выборочных характеристик — в уроке о выборке и оценках. Конкретный следующий шаг: замените в третьей группе балл 79 на 89 и пересчитайте разложение — SSW вырастет со 180 до 355, F просядет с 7,2 до 5,4, вывод об отличии методов устоит, а η² упадёт с 0,62 до 0,55. Так модель ощущается живой, а не набором букв. Разборы смежных задач — в гайде по вероятности и задачах с решениями; а приём «тот же МНК в другой упаковке» работает в корреляции и регрессии и в сравнении вероятность против статистики.