МатВектор

Command Palette

Search for a command to run...

🎲 Тервер

Коэффициент детерминации R²

англ. Coefficient of determination

Доля разброса отклика, объяснённая моделью: R² = 1 − SS_ост/SS_общ. R² = 0,8 значит, что модель забрала 80% изменчивости данных, а 20% остались в остатках.

Провели прямую через точки — насколько она что-то объясняет? Коэффициент детерминации отвечает долей: , где — полный разброс отклика, — нераскрытый остаток. : восемьдесят пять процентов изменчивости объяснено моделью, пятнадцать — шумом и неучтёнными факторами. В парной регрессии совпадает с квадратом коэффициента корреляции: даёт . Диапазон от нуля (прогноз средним не хуже прямой) до единицы (идеальная посадка). Связь с корреляцией — в статье коэффициент корреляции, практикум — в уроке корреляция и регрессия.

Считаем на данных из уравнения регрессии: : , , прогнозы по прямой : . Полный разброс ; остатки дают . Итого : модель схватила девяносто шесть процентов разброса продаж. Гнаться за единицей вслепую не стоит: в множественной регрессии любой добавленный фактор не снижает , даже бессмысленный, — для сравнения моделей используют скорректированную версию со штрафом за параметры.

доля объяснённого разброса; в парной модели совпадает с квадратом корреляции, в множественной требует поправки на число факторов

Частые вопросы

Высокий R² — признак хорошей модели?

Не обязательно. молчит о причинности, не замечает неверную форму зависимости — параболу можно промахнуться прямой с приличным значением — и растёт от любого добавленного фактора. Диагностика: смотреть остатки (нет ли полок и воронки), проверять значимость коэффициентов, сравнивать модели по скорректированному . Уровень «хорошести» задаёт предметная область: в физических опытах — норма, в маркетинговых данных — уже полезный сигнал.

Зачем нужен скорректированный R²?

Обычный монотонно растёт с числом регрессоров: включите «номер дня недели в квадрате» — он не упадёт ни на йоту. Скорректированная версия штрафует за каждый лишний параметр и может снижаться при добавлении балласта — это честный арбитр между моделями разной сложности. При больших поправка исчезает, при малых выборках она существенна. Для прогнозных задач вместо неё чаще применяют кросс-валидацию, но как быстрый фильтр переусложнения скорректированный незаменим.