🏢 Ситуация
Макс готовит стратегию на следующий год:
«Маркетинг делит клиентов на "новых" и "старых" — это каменный век. Я хочу понять, какие у нас реально типы клиентов, чтобы делать разные продукты и коммуникации. Разметки нет — никто не знает "правильные" сегменты. Это возможно?»
Лена:
«Это unsupervised learning — обучение без учителя. Тут нет таргета и нет "точности": качество сегментации меряется тем, может ли бизнес её использовать. Сделай RFM-признаки, кластеризуй, и главное — опиши сегменты словами. Кластеры без интерпретации — мусор.»
🎯 Ваша задача
- Понять K-Means: как работает, как выбрать число кластеров.
- Подготовить признаки для кластеризации (масштабирование критично!).
- Проинтерпретировать сегменты и отдать бизнесу.
📚 Теория
K-Means за 4 шага
- Выбираем K случайных центров.
- Каждую точку относим к ближайшему центру.
- Пересчитываем центры как средние своих точек.
- Повторяем 2–3 до сходимости.
Свойства: быстрый, простой; ищет выпуклые кластеры примерно одного размера; чувствителен к масштабу признаков и выбросам; результат зависит от инициализации (лечится n_init=10, k-means++).
Как выбрать K
- Метод локтя: график инерции (суммы квадратов расстояний до центров) от K; ищем «перегиб».
- Silhouette score (−1…1): насколько точка ближе к своему кластеру, чем к чужому; выше — лучше.
- Бизнес-критерий (главный): сколько сегментов команда реально сможет обслуживать? 4–7 обычно предел для маркетинга.
Масштабирование — не опция
K-Means меряет евклидово расстояние. Если «выручка» в тысячах, а «частота покупок» в единицах — кластеризация сведётся к выручке. StandardScaler обязателен; скошенные суммы стоит прологарифмировать.
RFM — классика клиентской аналитики
- R (Recency) — дней с последней покупки;
- F (Frequency) — число покупок за период;
- M (Monetary) — суммарные траты.
Плюс поведенческие: доля покупок со скидкой, разнообразие категорий, средний чек.
Альтернативы K-Means
- DBSCAN — кластеры произвольной формы, сам находит выбросы; не требует K, но чувствителен к параметрам плотности.
- Иерархическая — дендрограмма, видно вложенность сегментов.
- Gaussian Mixture — «мягкие» вероятностные кластеры.