Как решать задачи на регрессию и МНК: алгоритм с примером
МНК на числах: нормальные уравнения, b₁ = Sxy/Sxx и b₀ = ȳ − b₁x̄, SSE, SST и R² для пяти точек, прогноз на 10 часов — и где экстраполяция начинает врать.
Контрольная по статистике: таблица из пяти строк — часы подготовки и балл теста, а в вопросе — «оцените зависимость и предскажите балл студента, который готовился 10 часов». Пять точек просят провести прямую, слово «МНК» вспоминается, а вот порядок действий и проверки в памяти рыхлые. Здесь они собраны в один маршрут: от сумм до уравнения, от уравнения до R², от R² до прогноза с честными оговорками. Теоретический фундамент — в уроке корреляция и регрессия.
Сразу договоримся о словах. Корреляция измеряет силу связи — одно число от −1 до 1. Регрессия даёт правило предсказания: подставь x — получи ожидаемый y. Связка такая: — про тесноту, — про наклон. У корреляции нет направления, у регрессии есть: предсказывать балл по часам и часы по баллу — разные модели с разными коэффициентами. О тесноте связи — в термине коэффициент корреляции, о совместном разбросе — ковариация.
Откуда берутся формулы МНК и что они минимизируют?#
Метод наименьших квадратов выбирает прямую с минимальной суммой квадратов вертикальных отклонений точек: . Приравниваем нулю частные производные по a и b — техника из урока о частных производных и градиенте — и получаем систему двух линейных уравнений. Её решение и есть рабочие формулы:
Знаменатель положителен всегда, кроме вырожденного случая «все x одинаковые» — там регрессии не существует. Бесплатная проверка : подставьте — получите . Не получилось — где-то потерян знак. Численные тонкости метода и его матричную реализацию мы разбираем ещё и в уроке численных методов и в термине метод наименьших квадратов.
Почему именно квадраты, а не модули отклонений? Причин две. Квадратичная функция гладкая: производные существуют всюду, минимум находится приравниванием их к нулю, а с модулем на каждом изломе пришлось бы перебирать случаи. И квадраты штрафуют крупные промахи сильнее мелких: точка, отклонившаяся вдвое, влияет вчетверо. Цена за удобство — чувствительность к выбросам, о ней ниже, в FAQ. Метод восходит к Гауссу и Лежандру, а его статистическое обоснование опирается на нормальность шума.
Сквозной пример: пять точек от таблицы до прогноза#
Данные и все нужные произведения удобно собрать в одну таблицу — это половина всей работы:
| x, часы | y, балл | x − x̄ | y − ȳ | (x − x̄)(y − ȳ) | (x − x̄)² |
|---|---|---|---|---|---|
| 1 | 52 | −4 | −13 | 52 | 16 |
| 3 | 61 | −2 | −4 | 8 | 4 |
| 5 | 65 | 0 | 0 | 0 | 0 |
| 7 | 69 | 2 | 4 | 8 | 4 |
| 9 | 78 | 4 | 13 | 52 | 16 |
| Σ = 25 | Σ = 325 | 0 | 0 | 120 | 40 |
- Средние: часов, баллов.
- Наклон: балла за час подготовки.
- Свободный член: .
- Уравнение: . Проверка точкой средних: — сошлось.
- Предсказания , остатки . Сумма остатков равна нулю — вторая проверка.
- Ошибка подгонки: .
Полный разброс баллов вокруг среднего: . Модель объяснила , и доля объяснённого разброса —
Оговорка о размере выборки: пять точек минус два оценённых параметра — всего три степени свободы на ошибку. R² на маленьких выборках смещён вверх: даже чистый шум при пяти точках и одном факторе даёт в среднем около 0,25 объяснённого разброса. Поэтому заявленный 0,973 — характеристика этой пятёрки, а не гарантия; на сотне точек с тем же шумом то же значение было бы куда более весомым.
Интерпретация на словах. : каждый дополнительный час подготовки в среднем добавляет три балла. : ожидаемый балл при нуле часов, то есть базовый уровень знаний. Тонкость: ноль часов в данных не встречался — минимум x равен 1, так что сам по себе лёгкая экстраполяция, и опираться на него стоит меньше, чем на наклон. И главное: обе цифры — средние тенденции по этой выборке, а не закон природы; пять точек не доказывают причинность, они её только подсказывают.
Чем прогноз при x = 10 отличается от прогноза при x = 15?#
Прогноз — это подстановка: баллов. Но взгляните на диапазон данных: x менялся от 1 до 9, значит x = 10 — уже экстраполяция, выход за наблюдённую зону на один шаг. Один шаг — терпимо: линия на графике прямая, остатки крошечные, и прогноз 80 обоснован — с оговоркой, что это ожидание, а не обещание.
Зачем МНК матричная запись со столбцом единиц?#
Свободный член можно приравнять к обычному коэффициенту, если добавить фиктивный регрессор : модель превращается в , где каждый столбец матрицы X — свой фактор. Все коэффициенты становятся равноправными, и парная регрессия оказывается частным случаем одной матричной формулы:
- Собираем суммы: , , — отсюда .
- Правая часть: , , то есть .
- Нормальные уравнения: и ; определитель .
- По Крамеру: и — совпало с парными формулами, как и обязано.
Смысл затеи не в пересчёте того же ответа, а в масштабировании: добавили столбец — модель стала множественной, механика не изменилась. Как решать такие задачи с двумя и более факторами — в уроке множественная регрессия; там же объяснено, почему при многих факторах R² перестаёт быть главным судьёй. Определители и действия с матрицами, если подзабылись, — в уроках определители и матрицы и операции, а сам приём решения систем — в термине система линейных уравнений.
Где матричная запись спасает жизнь — проверка вырожденности. Определитель равен 200: ненулевой, система решается однозначно. А если бы столбцы X оказались пропорциональны — скажем, кто-то продублировал часы, переведённые в минуты, — определитель обнулился бы, обратной матрицы не существует, коэффициенты неопределимы. Это мультиколлинеарность, главный враг множественной регрессии. Парная модель защищена сама по себе: столбец единиц и столбец часов пропорциональными не бывают.
Как читать R² и где проходят его границы?#
R² — доля объяснённого разброса, но «хорошее» значение зависит от области: шум социальных данных и шум физического эксперимента — разные шумы. Ориентиры:
| R² | Социально-экономические данные | Физика и техника |
|---|---|---|
| ≈ 0,2 | слабо, но бывает: поведение людей и рынков шумное, модель уже полезнее среднего | плохо: искать пропущенный фактор, нелинейность или грубую ошибку |
| ≈ 0,5 | рабочий уровень для опросов, продаж, успеваемости: половина разброса объяснена | средне: аккуратный эксперимент обычно даёт больше |
| ≈ 0,8 | сильно; проверьте, не дублируют ли факторы друг друга | хорошо: закономерность схвачена, остатки почти чистые |
Три честные оговорки. R² ничего не говорит о причинности: высокая доля объяснённого разброса совместима со скрытым третьим фактором. R² молчит о прогнозе за пределами данных — предупреждение из прошлого раздела никуда не делось. И в парной модели R² — просто квадрат корреляции: , никакого отдельного волшебства.
- Нанесите точки на плоскость: глаз ловит кривизну и выбросы раньше любой формулы.
- Посчитайте суммы , , , и средние; убедитесь, что суммы отклонений от средних равны нулю.
- Найдите и ; наклон , свободный член .
- Проверки: прямая проходит через , сумма остатков равна нулю.
- Качество: по остаткам, , .
- Прогноз подстановкой в уравнение; отдельно скажите, лежит ли точка внутри диапазона данных.
- Вывод словами: смысл и , размер R², оговорки про причинность и диапазон.
, , , . Чему равны и ?
SST = 370, SSE = 10, r = 0,986. Чему равен R² и что он означает?
Частые вопросы
Чем корреляция отличается от регрессии?
Корреляция — мера тесноты линейной связи, одно число от −1 до 1, симметричное: r(x, y) = r(y, x). Регрессия — уравнение предсказания с направлением: балл по часам и часы по баллу дают разные прямые. Корреляция отвечает «есть ли связь», регрессия — «как именно y зависит от x». Обычно их считают вместе: r подсказывает, стоит ли строить прямую.
Всегда ли линейная модель — лучший выбор?
Нет. Если точки выстраиваются в дугу, прямая систематически ошибается: в центре завышает, по краям занижает. Кандидаты на замену — парабола, логарифм, экспонента — диктуются формой графика. Диагностика простая: постройте остатки против предсказанных значений; изогнутый узор требует сменить модель, даже если R² приличный. Сам МНК при этом не отменяется — он так же минимизирует квадраты, просто по другой форме связи.
Что выброс делает с МНК и как его поймать?
МНК минимизирует квадраты, поэтому один грубый промах тянет прямую на себя: наклон и свободный член съезжают, R² падает. Ловится выброс графически: точка, отстоящая от прямой на несколько остатков, видна сразу. Дальше — расследование: ошибку ввода исправляем, а реальное необычное наблюдение оставляем и показываем модель с ним и без него. Для загрязнённых данных есть устойчивые альтернативы вроде квантильной регрессии.
Как проверить качество построенной модели?
Минимум три. Численная: R² и SSE — сколько шума осталось необъяснённым. Графическая: остатки против предсказаний — изгиб или воронка означают неполную модель. Содержательная: знаки и порядок коэффициентов правдоподобны, прогнозы не выходят за физически возможные границы. Напоследок спрячьте одну точку, постройте прямую по остальным четырём и проверьте, попал ли прогноз в скрытый балл.
Куда дальше: следующий шаг — взять любые пять точек из жизни (цена кофе по дням, шаги по часам) и пройти маршрут целиком. Формулы — в шпаргалке по статистике и гипотезам, матричная техника — в разборе матриц и определителей, задачи с решениями — в разделе вероятности. Если точки легли не по прямой, а по красивой кривой, — это уже вопрос к интерполяции против аппроксимации. А когда факторов станет несколько или данные распадутся на группы, открывайте дисперсионный анализ: там тот же МНК работает на сравнение средних.