МОДУЛЬ 04 · Junior · 2 час

Первая модель сэкономила миллионы. Это была линейная регрессия

Прогноз стоимости доставки вместо среднего тарифа по городу. Простая модель, которую можно объяснить финансам по коэффициентам — и она бьёт бейзлайн втрое.

Пройти модуль в симуляторе Все 23 урока

Первые два модуля бесплатны, без карты. Остальные — по подписке $20/мес.

🏢 Ситуация

Логистика Datacore жалуется: стоимость доставки для клиента считается «средним тарифом по городу», и компания теряет деньги на дальних и тяжёлых заказах.

Лена:

«Твоя первая модель! Есть история: 80 000 доставок с фактической стоимостью. Признаки — вес, габариты, расстояние, город, срочность. Начни с линейной регрессии. Да, все хотят сразу нейросети, но правило команды: сначала простой бейзлайн. Если линейная модель даст MAE меньше 60 ₽ — уже сэкономим миллионы. И будь готов объяснить Максу, откуда модель берёт цифру: с "чёрным ящиком" финансы не согласуют.»

🎯 Ваша задача

  1. Понять, как работает линейная регрессия и градиентный спуск.
  2. Обучить модель в scikit-learn, оценить качество через MAE/RMSE.
  3. Интерпретировать коэффициенты для бизнеса.

📚 Теория

Линейная регрессия

Модель предсказывает число как взвешенную сумму признаков:

Обучение — подбор весов w, минимизирующих ошибку на исторических данных. Классическая функция потерь — MSE (средний квадрат ошибки).

Градиентный спуск — как модель «учится»

Это ядро почти всего ML, включая нейросети (Andrew Ng посвящает этому первую неделю курса):

  1. Начинаем со случайных весов.
  2. Считаем ошибку на данных.
  3. Считаем градиент — направление наискорейшего роста ошибки.
  4. Делаем шаг против градиента: w = w − α·∇L, где α — learning rate.
  5. Повторяем до сходимости.
Модель: линия через точки расстояние (км) → стоимость (₽) Обучение: спуск по ошибке итерации → ошибка (loss) ↓ шаг за шагом минимум
Слева — что ищет модель (линию с минимальной ошибкой), справа — как ищет: градиентный спуск шаг за шагом скатывается к минимуму лосса.

Масштабирование признаков

Вес посылки: 0.1–50 кг. Расстояние: 1–9000 км. При таких разных масштабах градиентный спуск сходится плохо, а коэффициенты несравнимы. Решение — стандартизация: x' = (x − mean) / std (StandardScaler).

Метрики регрессии

Метрика Формула (суть) Особенность
MAE среднее |y − ŷ| в тех же единицах (₽), устойчива к выбросам, понятна бизнесу
RMSE корень из среднего (y − ŷ)² сильнее штрафует большие ошибки
доля объяснённой дисперсии 1 — идеал, 0 — не лучше среднего

Если RMSE ≫ MAE — есть отдельные большие промахи, стоит их исследовать.

Train/test split — священное правило

Качество меряют на данных, которые модель не видела при обучении. Иначе вы измеряете память, а не обобщение.


Что запомнить

  • Всегда начинайте с простого бейзлайна и фиксируйте его метрику.
  • Градиентный спуск: шаг против градиента, learning rate решает всё.
  • Масштабируйте признаки; используйте Pipeline, чтобы не допускать утечек.
  • MAE — язык бизнеса; RMSE — детектор больших промахов.

Дальше в модуле: Практика

Открыть модуль →

Соседние уроки

03 Маркетинг спорит: помогла ли скидка? 05 Клиенты уходят: модель оттока

Программа целиком — 23 урока