Множественная регрессия: матричная форма, R² и VIF с примером
От парной регрессии к матричной формуле β̂ = (XᵀX)⁻¹Xᵀy: смысл коэффициентов «при прочих равных», ловушка R², скорректированный R² и VIF — на примере цен квартир.
Две квартиры в одном районе: 56 м² в восьми минутах ходьбы от метро и 64 м² в двадцати. Первая стоит 8,2 млн, вторая — 8,6. Что двигает цену сильнее — лишние восемь метров или лишние двенадцать минут? Парная регрессия из урока о корреляции и регрессии такой вопрос не возьмёт: она умеет один фактор за раз, и её коэффициент при площади впитает в себя всё, что с площадью связано, — включая удалённость от центра. Нужна модель, которая держит в руках несколько причин сразу, — множественная регрессия.
Что значит «при прочих равных»?#
Модель линейна по каждому фактору одновременно: , где — площадь в м², — минуты пешком до метро, — предсказанная цена в млн руб. Коэффициент читается так: на сколько изменится предсказанная цена при увеличении площади на один квадратный метр, если удалённость при этом не менялась. Коэффициент — наоборот, про минуты при зафиксированной площади. Фраза «при прочих равных» — не украшение, а вся суть метода: каждый коэффициент отвечает за свой фактор при замороженных остальных.
В этом и отличие от парной модели. В парной регрессии эффект площади смешан с эффектами всего, что коррелирует с площадью; во множественной эти эффекты разделены по разным коэффициентам. Именно поэтому такие модели и строят — чтобы сравнить «что дороже: метр или минута» на честных условиях. Заметьте: факторы редко бывают независимы в реальных данных — большие квартиры тяготеют к центру, а центр к метро. Модель это переварит; плохо ей станет лишь тогда, когда связь факторов станет почти неразличимой с их вкладом в отклик — случай из раздела о мультиколлинеарности ниже.
Возьмём пять квартир — минимальная выборка, на которой уже видно всё:
| Квартира | Площадь x₁, м² | До метро x₂, мин | Цена y, млн руб |
|---|---|---|---|
| 1 | 30 | 20 | 4,7 |
| 2 | 40 | 15 | 6,0 |
| 3 | 50 | 10 | 7,9 |
| 4 | 60 | 5 | 8,4 |
| 5 | 70 | 10 | 9,4 |
Как матрицы решают систему разом?#
Метод наименьших квадратов из парной регрессии остаётся тем же: подбираем коэффициенты, чтобы сумма квадратов остатков была минимальной. Минимум ищут частными производными по каждому коэффициенту, приравненными к нулю. В матричной записи весь вывод сжимается в одну строку: столбец единиц и столбцы факторов складываются в матрицу размера , цены — в столбец , коэффициенты — в вектор :
Расшифровка: накапливает суммы, квадраты и произведения факторов, — произведения факторов с откликом, а переворачивает систему. Эта формула — компактная запись системы нормальных уравнений: по одному уравнению на каждый коэффициент. Для двух факторов после центрирования остаётся система 2×2 — решим её руками, по формулам Крамера, знакомым по определителям; с тремя и больше факторами включается метод Гаусса.
В сыром виде, без центрирования, та же система — три уравнения с тремя неизвестными: ; ; . Когда дорешаете до ответа , подставьте его сюда — все три равенства сойдутся копейка в копейку. Центрирование ничего не меняет по сути: оно лишь аккуратнее перегруппирует те же числа и выносит свободный член из борьбы.
Считаем суммы по таблице: , , ; средние , , . Дальше работают центрированные суммы квадратов и произведений — при таком ходе система становится чище, а свободный член возвращается в самом конце:
- Система для наклонов: и , то есть и .
- Определитель системы: — не ноль, решение существует.
- Первый столбец меняем на правые части: , откуда .
- Второй столбец меняем на правые части: , откуда .
- Свободный член через средние: .
- Итог: . Контроль: для первой квартиры против фактических — остаток .
Читаем коэффициенты. Каждый квадратный метр добавляет к предсказанной цене млн — сто тысяч рублей — при той же удалённости от метро. Каждая минута ходьбы отнимает млн — шестьдесят тысяч — при той же площади. Свободный член млн — «базовая» цена при нулевых факторах; за пределами данных (квартира меньше 30 м²) его трактовать не стоит. Прогноз для квартиры 55 м² в восьми минутах: млн.
Почему R² всегда растёт — и чем это плохо?#
Качество подгонки измеряет коэффициент детерминации — доля разброса отклика, объяснённая моделью. Считаем по нашей пятёрке: полный разброс цен вокруг среднего , модель объяснила , в остатках :
Для парной модели только по площади наклон и . Добавили метро — R² вырос: с 0,965 до 0,975. Так бывает всегда, и это не достижение: новый регрессор физически не может ухудшить подгонку — худший случай, когда МНК присвоит ему нулевой коэффициент и R² не изменится. Модель с лишними переменными выглядит лучше чисто механически, как отчёт, где к успехам команды записали и погоду.
Лекарство — скорректированный R², который штрафует за число факторов:
Считаем: для парной модели , для множественной . Вот и развязка: обычный R² вырос, а скорректированный упал — второй фактор не окупил себя на этой пятёрке данных. Причина видна в следующем разделе: площадь и удалённость в выборке дублируют друг друга.
Что такое мультиколлинеарность и как её поймать?#
В нашей пятёрке большие квартиры стоят ближе к метро — типичная картина новых кварталов. Корреляция факторов: . Это и есть мультиколлинеарность — регрессоры несут пересекающуюся информацию. Модель не может решить, кому начислять общий эффект: коэффициенты становятся неустойчивыми — уберите одну квартиру, и перепрыгнет с на или сменит знак. Стандартные ошибки растут, t-статистики падают, хотя предсказания страдают меньше всего — модель хорошо описывает данные, но беспомощно разделяет причины.
Стандартный измеритель — фактор инфляции дисперсии. Для каждого регрессора строят вспомогательную регрессию его на все остальные и берут её R²:
Для : , значит . Классический порог тревоги — 10, в жёстких рекомендациях — 5: до них далеко, но стандартная ошибка уже раздута в раза по сравнению с бесколлинеарным миром. Лечение: оставить один из дублирующих факторов, собрать данные, где факторы независимы, или перейти к гребневой регрессии, которая чуть смещает оценку ради устойчивости.
Диагностика укладывается в три коротких приёма. Первый — посмотреть корреляционную матрицу факторов ещё до моделирования: подозрительная пара видна сразу. Второй — сравнить коэффициенты до и после удаления одной строки: колоссальный сдвиг при том же знаке эффектов выдаёт хрупкую оценку. Третий — проверить знаки на здравый смысл: минус при площади в модели цены — почти всегда симптом коллинеарности, а не экономического открытия. Дешёвая страховка, которая экономит часы перед защитой.
Следующий шаг: возьмите реальные данные — десяток квартир и два фактора — и пройдите весь маршрут руками: суммы, система 2×2, коэффициенты, оба R², VIF. Пары «площадь — цена» достаточно, чтобы каждую формулу почувствовать пальцами. Матрицы, если забылись, поджидают в уроке о матрицах и операциях, формулы по статистике — в шпаргалке, тренировка задач — в тренажёре по теории вероятностей. А из сравнения групп начните, если пропустили: дисперсионный анализ — родной брат регрессии, тот же МНК в другой упаковке.
- Модель : каждый коэффициент читается «при прочих равных»
- МНК в матричной форме: ; для двух факторов — система 2×2, решается по Крамеру
- R² не убывает от новых регрессоров; скорректированный R² штрафует за их число и умеет падать
- Мультиколлинеарность ловят корреляцией регрессоров и ; лечат выбором факторов или регуляризацией
- Плоскость МНК проходит через точку средних, сумма остатков равна нулю — две бесплатные проверки
В уравнении ŷ = 3 + 0,1x₁ − 0,06x₂ (x₁ — м², x₂ — минуты до метро) что означает коэффициент −0,06?
В модель с двумя регрессорами добавили третий. Что произойдёт с R² и скорректированным R²?
VIF одного из факторов равен 12. Какой вывод верен?
Частые вопросы
Что такое множественная регрессия простыми словами?
Это линейная модель, предсказывающая величину сразу по нескольким факторам: цена квартиры — по площади и удалённости от метро. Каждый коэффициент показывает вклад своего фактора при фиксированных остальных. Метод наименьших квадратов подбирает коэффициенты так, чтобы сумма квадратов остатков была минимальной; в матричной форме решение — одна формула (XᵀX)⁻¹Xᵀy.
Почему скорректированный R² лучше обычного при выборе модели?
Обычный R² не может уменьшиться при добавлении регрессора: даже бесполезный фактор чуть-чуть его поднимет, и модель будет казаться лучше только из-за числа переменных. Скорректированный R² вводит штраф за количество факторов: растёт он лишь тогда, когда новый регрессор объясняет больше, чем случайность. Поэтому сравнивать модели разной сложности честнее по скорректированному.
Как обнаружить мультиколлинеарность в данных?
Начните с корреляционной матрицы факторов: пары с модулем r выше 0,8 — подозрительны. Затем посчитайте VIF для каждого регрессора: значения выше 10, а в жёстких рекомендациях выше 5, означают раздутые стандартные ошибки и неустойчивые коэффициенты. Косвенные признаки: большой R² модели при малозначимых коэффициентах, смена знака коэффициента после удаления одной строки или фактора.
Чем множественная регрессия отличается от парной на практике?
Числом факторов и смыслом коэффициентов: в парной модели один коэффициент впитывает эффекты всех связанных переменных, во множественной эффекты разделяются — каждый фактор оценивается при прочих равных. Растёт и арсенал диагностики: скорректированный R², проверка мультиколлинеарности, анализ остатков. Вычисления ведут в матричной форме — вручную это уже система из трёх и более уравнений.
Готовитесь к контрольной?
Чеклист тем по «Тервер»: что вы уже умеете, что повторить и в каком порядке.
Открыть чеклист предмета →
Проверьте себя в бою
Босс-экзамен по «Тервер»: квизы всех уроков плюс бесконечный поток сгенерированных задач. Каждая попытка — новый расклад.
Начать босс-экзамен →