Как решать задачи на дисперсионный анализ (ANOVA): пример
Пошаговый алгоритм однофакторного ANOVA: гипотезы, таблица сумм квадратов, F-критерий 7,2 против 4,26, η² и тест Тьюки — на примере трёх методов обучения.
Завкафедрой собрал три группы по четыре студента: одни готовились к тесту по лекциям, другие — на практикуме, третьи — в смешанном формате. Баллы на руках, вопрос один: метод влияет на результат или разница — случайность? Три t-теста подряд проблему не решают: каждая проверка вносит свой шанс промахнуться, и уже на трёх парах вероятность хоть одной ложной тревоги подскакивает с 5% до . Для таких вопросов и придуман дисперсионный анализ. Теория и вывод формул — в уроке дисперсионный анализ; здесь — рабочая процедура: от гипотез до проверенного вывода и пост-хока.
Весь разброс баллов можно разрезать на две части: то, что создано различием средних групп, и то, что осталось внутри групп. Первая часть — сигнал, вторая — шум. Отношение сигнала к шуму, каждое слагаемое нормированное своей степенью свободы, и есть F-статистика. Дальше — аккуратный счёт, и почти каждый шаг снабжён встроенной проверкой.
Когда ANOVA применим, а когда нужен другой тест?#
Метод требует четырёх условий, и все они проверяются до вычислений, а не после:
- фактор качественный и имеет три и более уровня — группы, методы, станки, сорта;
- наблюдения независимы: каждый студент попал ровно в одну группу;
- данные внутри групп примерно симметричны — близки к нормальному распределению — или групп достаточно много;
- дисперсии групп близки (гомоскедастичность): грубое правило — наибольшая выборочная дисперсия не превосходит наименьшую в 3–4 раза.
При двух группах ANOVA вырождается в t-тест: F численно равен квадрату t-статистики. Логику отвержения гипотез и работу с порогом α мы расписали в уроке проверка гипотез и в термине нулевая гипотеза. Если условия нарушены — не беда: внизу есть таблица замен (Уэлч, Краскел–Уоллис), а пока идём по канону.
Как записать гипотезы и что именно проверяет F?#
Нулевая гипотеза — все групповые средние равны. Альтернатива — хотя бы одно отличается. В формулировке альтернативы и прячется первая ловушка: не «все различаются», а «хоть один». Два метода могут совпадать между собой, но если третий выбился, H₀ падает целиком.
Проверочный инструмент строится на двух оценках одного и того же шума. Внутригрупповой средний квадрат MSW оценивает шум всегда — это разброс студентов внутри одного метода. Межгрупповой MSB при верной H₀ оценивает тот же шум, а при неверной — раздувается вместе с различием средних. Отношение двух оценок в норме держится около единицы:
Как собрать таблицу сумм квадратов?#
Здесь — среднее группы i, — общее среднее по всем N наблюдениям, — размер группы. Групповые средние и дисперсии считаются как обычные выборочные характеристики — материал урока выборка и оценки. Общая сумма квадратов складывается из двух частей и служит встроенной проверкой:
| Источник | Сумма квадратов | df | Средний квадрат | F |
|---|---|---|---|---|
| Между группами | SSB | |||
| Внутри групп | SSW | — | ||
| Итого | SST | — | — |
Критическое значение берётся из таблицы F-распределения Фишера по паре степеней свободы: . Наблюдаемая F больше критического — H₀ отвергается. Напоминание, на чём всё это стоит: дисперсия — средний квадрат отклонений, см. термин дисперсия.
- Проверьте применимость: три и более группы, независимость наблюдений, примерная нормальность, близость дисперсий.
- Выпишите и , зафиксируйте уровень значимости — обычно .
- Посчитайте групповые средние и общее среднее .
- Найдите SSB и SSW; проверьте разложение прямым подсчётом по всем отклонениям.
- Степени свободы ; средние квадраты и .
- Статистика ; сравните с из таблицы Фишера.
- Если H₀ отвергнута — пост-хок тест Тьюки: какие именно пары средних различаются.
- Добавьте размер эффекта и сформулируйте вывод словами: что значимо, насколько велико, что это значит практически.
Сквозной пример: три метода, двенадцать студентов#
Вернёмся к вводной задаче. Баллы и групповые средние:
| Метод | Баллы четырёх студентов | Среднее $\bar{x}_i$ |
|---|---|---|
| Лекции | 58, 60, 64, 66 | 62 |
| Практикум | 62, 66, 72, 72 | 68 |
| Смешанный | 69, 71, 77, 79 | 74 |
При равных размерах групп общее среднее — обычное среднее трёх чисел: .
- Межгрупповая часть: .
- Внутригрупповая: лекции ; практикум ; смешанный . Итого .
- Проверка: . Прямой подсчёт всех двенадцати отклонений от 68 даёт по группам — сошлось.
- Степени свободы: между группами , внутри . Средние квадраты: , .
- Статистика: . Критическое значение по таблице: .
- Вывод: — H₀ отвергается. Приближённый p-уровень здесь : при верной H₀ такая или большая F выпадает примерно в 1,4% экспериментов.
Осталось назвать размер эффекта: . Шестьдесят два процента разброса баллов создаётся самим фактом «группы учились по-разному», остальные 38% — индивидуальный шум. Эффект крупный, а не просто формально значимый.
Какие пары различаются: пост-хок Тьюки?#
Отвергнутая H₀ не говорит, какие именно группы выбились. Ответ даёт тест Тьюки: каждая пара средних сравнивается с единым порогом HSD — критерий размаха q, умноженный на корень из MSW, делённого на размер группы. Для трёх групп, девяти степеней свободы и критерий q ≈ 3,95:
| Пара методов | Разность средних | Вывод |
|---|---|---|
| Лекции — Практикум | 6 | не значима: 6 < 8,83 |
| Лекции — Смешанный | 12 | значима: 12 > 8,83 |
| Практикум — Смешанный | 6 | не значима: 6 < 8,83 |
Честная оговорка: F значим, а значимых пар — всего одна. Тьюки намеренно консервативен: порог 8,83 шире, чем у трёх независимых t-тестов, зато общая вероятность ошибки остаётся на уровне 5% при любом числе сравнений. Интервальный взгляд даёт то же: 95-процентный интервал для разности «смешанный − лекции» — от 3,2 до 20,8 балла, и лишь он не содержит ноль.
Что делать, если что-то пошло не по канону?#
| Случилось | Что делать |
|---|---|
| F < 1 | Шум сильнее различий групп — H₀ не отвергается; это нормальный исход, а не ошибка расчёта |
| F близко к F_крит | Честный ответ — «различие не выявлено на взятом α»; увеличить выборку можно только в новом эксперименте |
| Дисперсии групп сильно различаются | ANOVA Уэлча: та же логика, но без требования равенства дисперсий |
| Группы разного размера | Считать можно; для пост-хока брать Тьюки–Крамера вместо обычного Тьюки |
| Нормальность под сомнением, группы малы | Непараметрический аналог — критерий Краскела–Уоллиса по рангам |
| В данных подозрительный выброс | Сначала проверить исходник: ошибка ввода или реальное наблюдение; удалять молча нельзя |
Уэлч и Краскел–Уоллис — не экзотика, а штатные замены. Первый отвечает на тот же вопрос о средних, но устойчив к разным дисперсиям; второй сравнивает распределения по рангам и почти не замечает выбросов. Оба выдают p-уровень, и дальнейшая логика вывода не меняется.
Групп три, всего 12 наблюдений, SSB = 288, SSW = 180. Чему равна F-статистика?
Порог Тьюки HSD ≈ 8,83, разности средних групп — 6, 12 и 6. Сколько пар различаются значимо?
Частые вопросы
Чем ANOVA отличается от t-теста?
t-тест сравнивает ровно две группы; ANOVA — любое число групп одним тестом. При двух группах они эквивалентны: F равен квадрату t. А вот при трёх и больше серия t-тестов быстро накапливает ложные тревоги: уже три сравнения поднимают общую ошибку примерно до 14%. ANOVA проверяет равенство всех средних сразу на уровне α, а конкретные пары ищет пост-хок.
Что делать, если выборки разного размера?
Однофакторный ANOVA работает и с разными n: в SSB отклонения средних просто взвешиваются размерами групп, остальные формулы не меняются. Меняются две вещи. Пост-хок: обычный Тьюки предполагает равные n, поэтому берут его обобщение — Тьюки–Крамера. И чувствительность: маленькие группы добавляют неопределённости, а при сильной асимметрии размеров и дисперсий надёжнее ANOVA Уэлча.
Что такое η² и как его читать?
Это доля общего разброса, объяснённая фактором: η² = SSB/SST. Значение 0,62 означает, что 62% разброса наблюдений приходится на различие групп, остальные 38% — шум внутри них. Ориентиры для поведенческих наук: 0,01 — малый эффект, 0,06 — средний, 0,14 и выше — большой. p-уровень отвечает на вопрос «случайно ли различие», η² — «насколько оно велико»; для полного вывода нужны оба.
Когда вместо ANOVA нужен Уэлч или Краскел–Уоллис?
Уэлч — когда дисперсии групп явно различаются, а сравнивать хочется именно средние: он заменяет MSW взвешенной оценкой и поправляет степени свободы. Краскел–Уоллис — когда нормальность под сомнением или шкала порядковая: он сравнивает группы по рангам и почти не чувствителен к выбросам. Грубое правило: наибольшая выборочная дисперсия превосходит наименьшую втрое и больше — берите Уэлч.
Куда дальше: формулы по всей статистике собраны в шпаргалке по статистике и гипотезам и шпаргалке по теории вероятностей; теория выборочных характеристик — в уроке о выборке и оценках. Конкретный следующий шаг: замените в третьей группе балл 79 на 89 и пересчитайте разложение — SSW вырастет со 180 до 355, F просядет с 7,2 до 5,4, вывод об отличии методов устоит, а η² упадёт с 0,62 до 0,55. Так модель ощущается живой, а не набором букв. Разборы смежных задач — в гайде по вероятности и задачах с решениями; а приём «тот же МНК в другой упаковке» работает в корреляции и регрессии и в сравнении вероятность против статистики.