МОДУЛЬ 12 · Middle-track · 2 час

Кластер без имени — не результат, а мусор

Разметки нет, «правильного» ответа не существует. Качество сегментации меряется тем, может ли маркетинг завтра сделать с этими сегментами что-то разное.

Пройти модуль в симуляторе Все 23 урока

Первые два модуля бесплатны, без карты. Остальные — по подписке $20/мес.

🏢 Ситуация

Макс готовит стратегию на следующий год:

«Маркетинг делит клиентов на "новых" и "старых" — это каменный век. Я хочу понять, какие у нас реально типы клиентов, чтобы делать разные продукты и коммуникации. Разметки нет — никто не знает "правильные" сегменты. Это возможно?»

Лена:

«Это unsupervised learning — обучение без учителя. Тут нет таргета и нет "точности": качество сегментации меряется тем, может ли бизнес её использовать. Сделай RFM-признаки, кластеризуй, и главное — опиши сегменты словами. Кластеры без интерпретации — мусор.»

🎯 Ваша задача

  1. Понять K-Means: как работает, как выбрать число кластеров.
  2. Подготовить признаки для кластеризации (масштабирование критично!).
  3. Проинтерпретировать сегменты и отдать бизнесу.

📚 Теория

K-Means за 4 шага

  1. Выбираем K случайных центров.
  2. Каждую точку относим к ближайшему центру.
  3. Пересчитываем центры как средние своих точек.
  4. Повторяем 2–3 до сходимости.

Свойства: быстрый, простой; ищет выпуклые кластеры примерно одного размера; чувствителен к масштабу признаков и выбросам; результат зависит от инициализации (лечится n_init=10, k-means++).

K-Means: точки тянутся к ближайшему центру «Спящие» «VIP» «Охотники за скидками» ✕ — центроид: «средний портрет» сегмента
Каждая точка — клиент в пространстве RFM-признаков. K-Means находит плотные группы; интерпретация и имя сегмента — работа аналитика.

Как выбрать K

Масштабирование — не опция

K-Means меряет евклидово расстояние. Если «выручка» в тысячах, а «частота покупок» в единицах — кластеризация сведётся к выручке. StandardScaler обязателен; скошенные суммы стоит прологарифмировать.

RFM — классика клиентской аналитики

Плюс поведенческие: доля покупок со скидкой, разнообразие категорий, средний чек.

Альтернативы K-Means


Что запомнить

  • Unsupervised = нет таргета; качество = полезность для бизнеса + устойчивость.
  • K-Means требует масштабирования; K выбирается локтем/silhouette и здравым смыслом.
  • Логарифмируйте деньги, стандартизуйте всё.
  • Кластер без имени и действия — не результат.

Дальше в модуле: Практика

Открыть модуль →

Соседние уроки

11 Фрод: 1 мошенник на 1000 честных 13 «С этим товаром покупают»: рекомендации

Программа целиком — 23 урока