Метод наименьших квадратов
англ. Least squares method
Как провести прямую через шумящие точки «наилучшим образом»: минимизируем сумму квадратов отклонений. Две производные, два нуля — и коэффициенты a и b у вас в руках.
Эксперимент дал точки, и точки упрямо не ложатся на прямую — измерения всегда шумят. Но «на глазок» провести прямую — не аргумент, нужен критерий, чья прямая лучше. Метод наименьших квадратов (МНК) предлагает: выбирай ту прямую , у которой сумма квадратов вертикальных отклонений точек минимальна. Квадраты — не каприз: с ними функция гладкая и минимизируется производными, а модуль создаёт излом и всю технику ломает.
Минимизируем честно: две частные производные, приравниваем каждую к нулю — и система нормальных уравнений распадается в готовые формулы: , . Числитель — выборочная ковариация x и y, знаменатель — разброс x. Из формулы для a видно, что прямая МНК всегда проходит через центр масс точек . Проверяем на пятёрке точек (1, 2), (2, 3), (3, 5), (4, 4), (5, 6): , , числитель 9, знаменатель 10, значит , и прямая .
Насколько хороша подгонка? Отвечает коэффициент детерминации — доля разброса y, которую объясняет прямая. Для парной регрессии есть короткий мостик: , квадрат коэффициента корреляции. В нашем примере , значит : прямая съела 81% разброса, остатки (от −0.9 до +1) отвечают за оставшиеся 19%. Контрольная проверка любого МНК-решения: сумма остатков равна нулю — у нас , прямая честно висит на точках.
История солидная: Лежандр опубликовал метод в 1805-м, Гаусс утверждал, что пользовался им с 1795-го — и переизобрёл его для восстановления орбиты астероида Цереры по обрывочным наблюдениям. Сегодня МНК — рабочая лошадка эконометрики, обработки измерений и машинного обучения: линейная регрессия — «hello world» всех моделей. Дальше то же уравнение живёт в многомерном варианте: урок корреляция и регрессия считает его на живых данных, оценки по выборке — в уроке выборка и оценки, все формулы — в шпаргалке по статистике и гипотезам.
Частые вопросы
Почему минимизируют именно квадраты отклонений?
Квадраты дают гладкую функцию: производные существуют, и система решается явно. Модульная версия (медианная регрессия) устойчивее к выбросам, но решается только итерациями. Есть и вероятностная причина: при нормальном шуме МНК-оценка совпадает с оценкой максимального правдоподобия.
Как быстро найти a и b на экзамене?
Алгоритм: посчитайте x̄ и ȳ → числитель Σ(xᵢ−x̄)(yᵢ−ȳ) и знаменатель Σ(xᵢ−x̄)² → b = числитель/знаменатель → a = ȳ − b·x̄. Две проверки: прямая проходит через (x̄, ȳ) и сумма остатков равна нулю.
Что показывает R²?
Долю дисперсии y, объяснённую моделью: 1 — все точки легли на прямую, 0 — прямая не лучше горизонтальной линии на уровне ȳ. Для парной регрессии , где r — коэффициент корреляции Пирсона.