МОДУЛЬ 05 · Junior · 2 час

Инсайт оказался дороже самой модели

Ретеншен не может обзвонить 200 000 человек — ему нужен ранжированный список. Отсюда и требование к модели: не метка «уйдёт», а вероятность.

Пройти модуль в симуляторе Все 23 урока

Первые два модуля бесплатны, без карты. Остальные — по подписке $20/мес.

🏢 Ситуация

Экстренный синк. Макс показывает график: подписчики финтех-продукта уходят, ежемесячный отток 8%.

«Удержать клиента в 5 раз дешевле, чем привлечь нового. У ретеншн-команды есть бюджет на звонки и бонусы, но звонить всем 200 000 клиентам нельзя. Дайте список: кто уйдёт в ближайшие 30 дней.»

Лена переводит на язык ML:

«Бинарная классификация. Таргет: ушёл ли клиент в течение 30 дней (по истории у нас есть разметка). Признаки Аня собрала: активность, платежи, обращения в поддержку, срок жизни. Начни с логистической регрессии — и вникни, почему её выход это вероятность, ретеншену нужны именно вероятности, чтобы ранжировать, кому звонить первыми.»

🎯 Ваша задача

  1. Понять, чем классификация отличается от регрессии и как работает логистическая регрессия.
  2. Обучить модель оттока и получить вероятности.
  3. Отдать бизнесу ранжированный список клиентов.

📚 Теория

Почему не линейная регрессия?

Таргет — 0 или 1. Линейная регрессия выдаёт любые числа (−0.3, 1.7), которые нельзя трактовать как вероятность. Решение — обернуть линейную комбинацию в сигмоиду:

Сигмоида сжимает любое число в диапазон (0, 1) → выход читается как вероятность класса 1: P(churn | x).

Сигмоида: σ(z) = 1 / (1 + e⁻ᶻ) порог 0.5 (не догма!) 0 1 0.5 z = w·x + b (любое число от −∞ до +∞) z ≪ 0 → P ≈ 0: останется z ≫ 0 → P ≈ 1: уйдёт
Любой выход линейной части сигмоида сжимает в (0, 1) — получаем вероятность оттока, по которой можно ранжировать клиентов.

Функция потерь — log loss

MSE для классификации работает плохо (невыпуклая поверхность). Используется логистическая функция потерь (cross-entropy): она сильно штрафует уверенные ошибки — предсказал 0.99 «останется», а клиент ушёл → огромный штраф.

Порог принятия решения

Модель выдаёт вероятность; решение «звонить / не звонить» появляется после выбора порога:

Интерпретация коэффициентов

Коэффициенты логистической регрессии действуют на log-odds: положительный вес признака повышает вероятность оттока. exp(w) — во сколько раз растут шансы при +1 к признаку. Для бизнеса: «каждое обращение в поддержку с негативом умножает шансы ухода в 1.6 раза».

Регуляризация

При большом числе признаков модель может переобучаться. L2 (Ridge) — прижимает веса к нулю, L1 (Lasso) — зануляет слабые признаки (встроенный отбор). В sklearn параметр Cобратная сила регуляризации: меньше C → сильнее регуляризация.


Что запомнить

  • Логистическая регрессия = линейная модель + сигмоида → вероятность.
  • stratify при сплите, если классы несбалансированы.
  • Порог 0.5 — не догма; часто бизнесу нужен топ-N по вероятности.
  • Коэффициенты объяснимы — это огромный плюс для регулируемых доменов (финансы!).

Дальше в модуле: Практика

Открыть модуль →

Соседние уроки

04 Прогноз стоимости доставки 06 Модель с точностью 99%, которая не работает

Программа целиком — 23 урока