МатВектор

Command Palette

Search for a command to run...

🎲 Тервер

Как решать задачи на регрессию и МНК: алгоритм с примером

МНК на числах: нормальные уравнения, b₁ = Sxy/Sxx и b₀ = ȳ − b₁x̄, SSE, SST и R² для пяти точек, прогноз на 10 часов — и где экстраполяция начинает врать.

Сложность: Первый курс 2 схемы действий

Контрольная по статистике: таблица из пяти строк — часы подготовки и балл теста, а в вопросе — «оцените зависимость и предскажите балл студента, который готовился 10 часов». Пять точек просят провести прямую, слово «МНК» вспоминается, а вот порядок действий и проверки в памяти рыхлые. Здесь они собраны в один маршрут: от сумм до уравнения, от уравнения до R², от R² до прогноза с честными оговорками. Теоретический фундамент — в уроке корреляция и регрессия.

Сразу договоримся о словах. Корреляция измеряет силу связи — одно число от −1 до 1. Регрессия даёт правило предсказания: подставь x — получи ожидаемый y. Связка такая: — про тесноту, — про наклон. У корреляции нет направления, у регрессии есть: предсказывать балл по часам и часы по баллу — разные модели с разными коэффициентами. О тесноте связи — в термине коэффициент корреляции, о совместном разбросе — ковариация.

Откуда берутся формулы МНК и что они минимизируют?#

Метод наименьших квадратов выбирает прямую с минимальной суммой квадратов вертикальных отклонений точек: . Приравниваем нулю частные производные по a и b — техника из урока о частных производных и градиенте — и получаем систему двух линейных уравнений. Её решение и есть рабочие формулы:

Sxy — совместный разброс x и y, Sxx — разброс x; прямая всегда проходит через точку средних (x̄; ȳ)

Знаменатель положителен всегда, кроме вырожденного случая «все x одинаковые» — там регрессии не существует. Бесплатная проверка : подставьте — получите . Не получилось — где-то потерян знак. Численные тонкости метода и его матричную реализацию мы разбираем ещё и в уроке численных методов и в термине метод наименьших квадратов.

Почему именно квадраты, а не модули отклонений? Причин две. Квадратичная функция гладкая: производные существуют всюду, минимум находится приравниванием их к нулю, а с модулем на каждом изломе пришлось бы перебирать случаи. И квадраты штрафуют крупные промахи сильнее мелких: точка, отклонившаяся вдвое, влияет вчетверо. Цена за удобство — чувствительность к выбросам, о ней ниже, в FAQ. Метод восходит к Гауссу и Лежандру, а его статистическое обоснование опирается на нормальность шума.

Сквозной пример: пять точек от таблицы до прогноза#

Данные и все нужные произведения удобно собрать в одну таблицу — это половина всей работы:

x, часыy, баллx − x̄y − ȳ(x − x̄)(y − ȳ)(x − x̄)²
152−4−135216
361−2−484
5650000
7692484
9784135216
Σ = 25Σ = 3250012040
суммы отклонений в средних столбцах равны нулю — первая проверка таблицы
  1. Средние: часов, баллов.
  2. Наклон: балла за час подготовки.
  3. Свободный член: .
  4. Уравнение: . Проверка точкой средних: — сошлось.
  5. Предсказания , остатки . Сумма остатков равна нулю — вторая проверка.
  6. Ошибка подгонки: .

Полный разброс баллов вокруг среднего: . Модель объяснила , и доля объяснённого разброса —

97% разброса баллов объясняется часами подготовки; для парной модели R² равен квадрату r

Оговорка о размере выборки: пять точек минус два оценённых параметра — всего три степени свободы на ошибку. R² на маленьких выборках смещён вверх: даже чистый шум при пяти точках и одном факторе даёт в среднем около 0,25 объяснённого разброса. Поэтому заявленный 0,973 — характеристика этой пятёрки, а не гарантия; на сотне точек с тем же шумом то же значение было бы куда более весомым.

Интерпретация на словах. : каждый дополнительный час подготовки в среднем добавляет три балла. : ожидаемый балл при нуле часов, то есть базовый уровень знаний. Тонкость: ноль часов в данных не встречался — минимум x равен 1, так что сам по себе лёгкая экстраполяция, и опираться на него стоит меньше, чем на наклон. И главное: обе цифры — средние тенденции по этой выборке, а не закон природы; пять точек не доказывают причинность, они её только подсказывают.

Чем прогноз при x = 10 отличается от прогноза при x = 15?#

Прогноз — это подстановка: баллов. Но взгляните на диапазон данных: x менялся от 1 до 9, значит x = 10 — уже экстраполяция, выход за наблюдённую зону на один шаг. Один шаг — терпимо: линия на графике прямая, остатки крошечные, и прогноз 80 обоснован — с оговоркой, что это ожидание, а не обещание.

Зачем МНК матричная запись со столбцом единиц?#

Свободный член можно приравнять к обычному коэффициенту, если добавить фиктивный регрессор : модель превращается в , где каждый столбец матрицы X — свой фактор. Все коэффициенты становятся равноправными, и парная регрессия оказывается частным случаем одной матричной формулы:

X — матрица 5 × 2: столбец единиц и столбец часов; β = (b₀; b₁)
  1. Собираем суммы: , , — отсюда .
  2. Правая часть: , , то есть .
  3. Нормальные уравнения: и ; определитель .
  4. По Крамеру: и — совпало с парными формулами, как и обязано.

Смысл затеи не в пересчёте того же ответа, а в масштабировании: добавили столбец — модель стала множественной, механика не изменилась. Как решать такие задачи с двумя и более факторами — в уроке множественная регрессия; там же объяснено, почему при многих факторах R² перестаёт быть главным судьёй. Определители и действия с матрицами, если подзабылись, — в уроках определители и матрицы и операции, а сам приём решения систем — в термине система линейных уравнений.

Где матричная запись спасает жизнь — проверка вырожденности. Определитель равен 200: ненулевой, система решается однозначно. А если бы столбцы X оказались пропорциональны — скажем, кто-то продублировал часы, переведённые в минуты, — определитель обнулился бы, обратной матрицы не существует, коэффициенты неопределимы. Это мультиколлинеарность, главный враг множественной регрессии. Парная модель защищена сама по себе: столбец единиц и столбец часов пропорциональными не бывают.

Как читать R² и где проходят его границы?#

R² — доля объяснённого разброса, но «хорошее» значение зависит от области: шум социальных данных и шум физического эксперимента — разные шумы. Ориентиры:

R²Социально-экономические данныеФизика и техника
≈ 0,2слабо, но бывает: поведение людей и рынков шумное, модель уже полезнее среднегоплохо: искать пропущенный фактор, нелинейность или грубую ошибку
≈ 0,5рабочий уровень для опросов, продаж, успеваемости: половина разброса объясненасредне: аккуратный эксперимент обычно даёт больше
≈ 0,8сильно; проверьте, не дублируют ли факторы друг другахорошо: закономерность схвачена, остатки почти чистые
одно и то же R² в разных науках значит разное — сравнивайте модели внутри своей области

Три честные оговорки. R² ничего не говорит о причинности: высокая доля объяснённого разброса совместима со скрытым третьим фактором. R² молчит о прогнозе за пределами данных — предупреждение из прошлого раздела никуда не делось. И в парной модели R² — просто квадрат корреляции: , никакого отдельного волшебства.

  1. Нанесите точки на плоскость: глаз ловит кривизну и выбросы раньше любой формулы.
  2. Посчитайте суммы , , , и средние; убедитесь, что суммы отклонений от средних равны нулю.
  3. Найдите и ; наклон , свободный член .
  4. Проверки: прямая проходит через , сумма остатков равна нулю.
  5. Качество: по остаткам, , .
  6. Прогноз подстановкой в уравнение; отдельно скажите, лежит ли точка внутри диапазона данных.
  7. Вывод словами: смысл и , размер R², оговорки про причинность и диапазон.
Проверь себя+15 XP

, , , . Чему равны и ?

Проверь себя+15 XP

SST = 370, SSE = 10, r = 0,986. Чему равен R² и что он означает?

Частые вопросы

Чем корреляция отличается от регрессии?

Корреляция — мера тесноты линейной связи, одно число от −1 до 1, симметричное: r(x, y) = r(y, x). Регрессия — уравнение предсказания с направлением: балл по часам и часы по баллу дают разные прямые. Корреляция отвечает «есть ли связь», регрессия — «как именно y зависит от x». Обычно их считают вместе: r подсказывает, стоит ли строить прямую.

Всегда ли линейная модель — лучший выбор?

Нет. Если точки выстраиваются в дугу, прямая систематически ошибается: в центре завышает, по краям занижает. Кандидаты на замену — парабола, логарифм, экспонента — диктуются формой графика. Диагностика простая: постройте остатки против предсказанных значений; изогнутый узор требует сменить модель, даже если R² приличный. Сам МНК при этом не отменяется — он так же минимизирует квадраты, просто по другой форме связи.

Что выброс делает с МНК и как его поймать?

МНК минимизирует квадраты, поэтому один грубый промах тянет прямую на себя: наклон и свободный член съезжают, R² падает. Ловится выброс графически: точка, отстоящая от прямой на несколько остатков, видна сразу. Дальше — расследование: ошибку ввода исправляем, а реальное необычное наблюдение оставляем и показываем модель с ним и без него. Для загрязнённых данных есть устойчивые альтернативы вроде квантильной регрессии.

Как проверить качество построенной модели?

Минимум три. Численная: R² и SSE — сколько шума осталось необъяснённым. Графическая: остатки против предсказаний — изгиб или воронка означают неполную модель. Содержательная: знаки и порядок коэффициентов правдоподобны, прогнозы не выходят за физически возможные границы. Напоследок спрячьте одну точку, постройте прямую по остальным четырём и проверьте, попал ли прогноз в скрытый балл.

Куда дальше: следующий шаг — взять любые пять точек из жизни (цена кофе по дням, шаги по часам) и пройти маршрут целиком. Формулы — в шпаргалке по статистике и гипотезам, матричная техника — в разборе матриц и определителей, задачи с решениями — в разделе вероятности. Если точки легли не по прямой, а по красивой кривой, — это уже вопрос к интерполяции против аппроксимации. А когда факторов станет несколько или данные распадутся на группы, открывайте дисперсионный анализ: там тот же МНК работает на сравнение средних.