Корреляция и регрессия: коэффициент Пирсона и линия тренда
Как измерить связь двух величин одним числом, почему корреляция не доказывает причину и как метод наименьших квадратов проводит прямую через точки.
Рост человека и размер его обуви идут в ногу: длиннее человек — больше нога. Число мороженого, съеденного за день в городе, и число утоплений коррелируют ещё сильнее — но запрет мороженого ни одного пловца не спасёт. Между «величины движутся вместе» и «одна величина двигает другую» лежит пропасть, и весь этот урок — про два инструмента, которые эту разницу не дают стереть: коэффициент корреляции и уравнение регрессии.
Коэффициент корреляции: связь в одном числе#
Пусть по объектам измерены две величины: — скажем, часы подготовки и балл за экзамен. Идея Пирсона проста: если величины связаны, отклонения от своих средних должны совпадать по знаку — кто выше среднего по часам, тот чаще выше среднего по баллам. Складываем произведения отклонений и нормируем на разбросы обеих величин:
Числитель — родня ковариации: он положителен, когда величины растут вместе, отрицателен, когда одна растёт при падении другой. Знаменатель — произведение разбросов, тот самый нормировщик, который прижимает результат в коридор от до : значения означают точную прямую зависимость, — отсутствие линейной связи. Промежуточные значения трактуют по силе: около — слабая, около — умеренная, ближе к и выше — сильная. Разброс самих величин при этом измеряется дисперсией — тут вся та же механика, что и в обычной статистике.
| x | y | $x_i - \bar{x}$ | $y_i - \bar{y}$ | произведение |
|---|---|---|---|---|
| 1 | 2 | −2 | −2 | 4 |
| 2 | 4 | −1 | 0 | 0 |
| 3 | 5 | 0 | 1 | 0 |
| 4 | 4 | 1 | 0 | 0 |
| 5 | 5 | 2 | 1 | 2 |
Считаем: . Связь сильная и положительная. Заметьте, что масштаб данных не важен: переведите часы в минуты, а баллы в проценты — не изменится, потому что знаменатель нормирует всё сам. В этом и прелесть коэффициента: одно число, не зависящее от единиц измерения.
Корреляция — не причина#
Коэффициент отвечает строго на один вопрос: «насколько тесно величины движутся вместе». Он молчит о том, кто кого двигает. У мороженого и утоплений есть третий участник — жара: в жару и мороженого едят больше, и в воду лезут чаще, поэтому обе величины синхронно взлетают. Такой скрытый общий фактор называют мешающей переменной, и он — самая частая причина ложных открытий: от «кофе продлевает жизнь» (здоровые люди просто больше выходят из дома за кофе) до «врачи опасны для здоровья» (к людям, которые уже больны, врачей вызывают чаще).
Вторая ловушка — направленность: даже настоящая сильная связь не говорит, что двигает . Продажи зонтов коррелируют с открытием зонта над головой — но зонты не открывают дождь. Третья — малые выборки: на пяти точках , как в примере выше, ещё ни о чём убедительном не говорит, случайный шум легко выдаёт такую величину. Ниже, в разделе о значимости, мы проверим это честно.
Линейная регрессия: метод наименьших квадратов#
Корреляция констатирует связь; регрессия её использует: по значению предсказать . Ищем прямую , где шапка над отличает предсказание от факта. Критерий качества — метод наименьших квадратов (МНК): подбираем и так, чтобы сумма квадратов вертикальных отклонений точек от прямой была минимальна. Дифференцирование даёт готовый рецепт:
Для нашей таблицы: , . Уравнение: . Читается так: с каждым дополнительным часом подготовки балл в среднем растёт на 0,6; ноль часов обещает 2,2 балла. Предсказание для : . Обратите внимание: прямая всегда проходит через точку — центр облака точек, и прогноз за пределами наблюдавшихся значений — рискованная экстраполяция.
Между и есть точная связь: — наклон равен корреляции, умноженной на отношение стандартных отклонений. Проверим на числах: , , и — сходится. А величина имеет собственное имя — коэффициент детерминации: она показывает, какую долю разброса объясняет регрессия. У нас : шестьдесят процентов изменчивости баллов связаны с часами подготовки, остальные сорок — с чем-то ещё (талант, сон, лотерея формулировок).
Прямая, найденная МНК, обладает одним элегантным свойством: сумма остатков — расхождений между фактом и предсказанием — равна нулю. Проверьте: предсказания , , , , , факты , , , , , остатки , , , , , и их сумма действительно нулевая. Геометрически это значит, что прямая сбалансирована относительно облака точек: выше неё и ниже неё остаётся поровну суммарного отклонения. Именно поэтому предсказание при всегда совпадает с — лучшая догадка без всякой информации о x есть среднее.
Отдельный разговор — выбросы. Коэффициент Пирсона и наклон МНК считаются по квадратам отклонений, а квадраты беспощадны к аномалиям: одна точка, сорвавшаяся с общего строя, способна повернуть прямую и утопить связь из девяти остальных. Прежде чем доверять числам, постройте диаграмму рассеяния и проверьте, не тянет ли одинокая точка всю линию за собой; при подозрении пересчитайте оценку без неё и посмотрите, как изменился результат — устойчивость к такой проверке ценнее любого показателя блеска.
А значима ли связь? Проверка гипотезой#
Пять точек — мало. Насколько мало, показывает тест: нулевая гипотеза «истинная корреляция равна нулю», статистика живёт в распределении Стьюдента с степенями свободы. Для наших данных: . Критическое значение при и трёх степенях свободы — . Два меньше трёх: даже крепкая на вид корреляция 0,77 на пяти точках не проходит проверку — шум мог нарисовать её сам. Мораль практическая: сообщайте вместе с объёмом выборки и уровнем значимости, иначе число не интерпретируемо. Полная механика тестов разобрана в уроке о проверке гипотез.
Корреляция и регрессия — естественный финал всего курса: здесь встречаются ожидание и дисперсия из теории случайных величин, выборочные характеристики из урока о выборке и тесты из предыдущего раздела. Если хочется укрепить базу на живых задачах, лучший способ — тренажёр по теории вероятностей.
r = −0,9. Что можно сказать о связи?
Данные: x = 1, 2, 3, 4, 5; y = 3, 5, 7, 9, 11. Наклон b по МНК?
r² = 0,64 в регрессии зарплаты от стажа. Что это значит?
Частые вопросы
Чем регрессия отличается от корреляции?
Корреляция симметрична и безразмерна: она лишь измеряет тесноту связи, и r(x, y) = r(y, x). Регрессия асимметрична: она назначает одну величину объясняющей, другую — предсказываемой, и выдаёт уравнение для прогноза. Менять x и y местами в регрессии — получать разные прямые.
Может ли r быть равен 1, а связи причинной — не быть?
Да, и это не экзотика. Обе величины могут расти просто со временем (курс доллара и ваш возраст) — корреляция будет близка к единице без всякой причинности. Такой рост называют ложной корреляцией по общему тренду; лечится он анализом приростов и контролем третьих переменных.
Что делать, если связь на графике кривая?
Пирсона в лоб не применять: он увидит слабую связь там, где она сильная, но нелинейная. Варианты: преобразовать переменные (логарифм, корень), использовать ранговые коэффициенты (Спирмена) или подбирать нелинейную регрессию. Первое действие всегда одно — посмотреть на диаграмму рассеяния.
Сколько нужно точек, чтобы доверять коэффициенту?
Формального минимума нет, но при n меньше 10 оценка r настолько шумная, что практической ценности почти не имеет; тест значимости с малыми n отвергает только очень большие |r|. Для уверенных выводов на практике ориентируются на десятки наблюдений и проверку значимости.
Готовитесь к контрольной?
Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.
Открыть чеклист предмета →
Проверьте себя в бою
Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.
Начать босс-экзамен →