🏢 Ситуация
После вашего EDA-отчёта разгорелся спор. Маркетинг: «Скидки увеличили конверсию, мы молодцы!» Макс: «А может, конверсия выросла бы и без скидок — сезон же».
Лена:
«Классика. Спор мнений решается только экспериментом. Маркетинг уже запустил тест: 20 000 пользователей случайно поделили пополам, группе A показывали скидку 15%, группе B — нет. Конверсия A = 6.4%, B = 5.8%. Маркетинг кричит "победа". Твоя задача — проверить, значимо ли различие, или это шум. И объясни Максу результат по-человечески.»
🎯 Ваша задача
- Понять базовую статистику: распределения, среднее vs медиана, дисперсию.
- Разобраться, как устроен A/B-тест и что такое статистическая значимость.
- Дать бизнесу ответ: скидка работает или нет — и какой ценой.
📚 Теория
Распределения — язык данных
Нормальное распределение — симметричный «колокол» (рост людей, ошибки измерений). Скошенные распределения — длинный хвост (доходы, суммы заказов: много мелких, мало огромных).
Практическое следствие: для скошенных данных среднее обманывает. Средний чек 3 400 ₽ при медиане 900 ₽ означает, что «типичный» заказ — 900 ₽, а среднее вытянуто китами. Докладывайте медиану и квантили.
Проверка гипотез на пальцах
- H₀ (нулевая гипотеза): различия нет, разница между группами — случайность.
- H₁ (альтернативная): различие есть.
- p-value — вероятность увидеть такую (или более сильную) разницу, если H₀ верна. Малый p-value (обычно < 0.05) → данные плохо совместимы со «случайностью» → отвергаем H₀.
⚠️ Частые ошибки, за которые бьют на ревью:
- p-value — это не «вероятность, что H₀ верна».
- «Не значимо» ≠ «эффекта нет». Возможно, просто мало данных.
- Статистическая значимость ≠ практическая. Рост конверсии на 0.01% может быть значимым при миллионах пользователей — и бесполезным для бизнеса.
A/B-тест: минимальный чеклист
- Рандомизация: пользователи распределяются случайно (не «A — Москва, B — Питер»!).
- Метрика решения выбрана до запуска (например, прибыль на пользователя, не только конверсия).
- Размер выборки посчитан заранее (power analysis), тест не останавливают в момент, когда «стало значимо» — это подглядывание (peeking) и оно ломает статистику.
- Для конверсий (доля успехов) используется z-тест для пропорций или хи-квадрат; для средних значений — t-тест.