МОДУЛЬ 08 · Junior+ · 2 час

На таблицах бустинг обыгрывает нейросети

Логрег дал 0,834, случайный лес 0,861, бустинг 0,874. Разбираемся, откуда разница и почему на табличных данных деревья сильнее нейросетей.

Пройти модуль в симуляторе Все 23 урока

Первые два модуля бесплатны, без карты. Остальные — по подписке $20/мес.

🏢 Ситуация

Модель оттока из модуля 5 работает месяц. Лена на планировании:

«Логрег дал ROC-AUC 0.83 — хорошо для старта. Ретеншен просит точнее: каждый лишний процент качества — это сотни удержанных клиентов. Пора доставать тяжёлую артиллерию табличного ML: деревья и ансамбли. Сравни Random Forest и градиентный бустинг с нашим логрегом. Спойлер: на табличных данных бустинг почти всегда побеждает нейросети — пойми почему.»

🎯 Ваша задача

  1. Понять, как работает дерево решений и почему одно дерево — слабо.
  2. Разобраться в двух стратегиях ансамблей: бэггинг (Random Forest) и бустинг.
  3. Побить бейзлайн и объяснить прирост.

📚 Теория

Дерево решений

Дерево разбивает данные серией вопросов «признак > порог?», выбирая на каждом шаге разбиение, максимально уменьшающее «нечистоту» (Gini/энтропию). Плюсы: не требует масштабирования, ловит нелинейности и взаимодействия признаков, интерпретируемо. Минус: одно дерево легко переобучается — глубокое дерево запоминает шум.

Ансамбли: мудрость толпы

Идея: много слабых моделей, ошибающихся по-разному, вместе точнее одной сильной.

Бэггинг → Random Forest:

Бустинг → XGBoost / LightGBM / CatBoost:

Бэггинг (Random Forest) деревья независимы, параллельно выборка 1 выборка 2 выборка 3 усреднение голосов ↓ дисперсия, устойчив к переобучению Бустинг (LightGBM/XGBoost) деревья последовательно, каждое чинит ошибки остатки остатки дерево 1 дерево 2: ошибки 1-го дерево 3: ошибки 1+2 взвешенная сумма точнее, но нужен early stopping
Две стратегии ансамблей: лес усредняет независимые деревья, бустинг строит цепочку, где каждое дерево исправляет ошибки предыдущих.
Random Forest Gradient Boosting
Стратегия параллельно, усреднение последовательно, исправление ошибок
Переобучение устойчив требует контроля (early stopping)
Скорость обучения быстрее (параллель) медленнее, но LightGBM очень быстр
Качество на табличках хорошее обычно лучшее

Ключевые гиперпараметры бустинга

Почему на таблицах бустинг > нейросети

Табличные данные разнородны (деньги, счётчики, категории), зависимости кусочно-резкие («просрочка > 30 дней → риск скачком»). Деревья моделируют такие пороги нативно, нейросети — с трудом. Это подтверждено индустрией и Kaggle: для таблиц по умолчанию — градиентный бустинг.


Что запомнить

  • Одно дерево переобучается; сила — в ансамблях.
  • Бэггинг снижает дисперсию усреднением; бустинг последовательно исправляет ошибки.
  • Early stopping по валидации — стандарт работы с бустингом.
  • Для табличных данных градиентный бустинг — дефолтный выбор индустрии.

Дальше в модуле: Практика

Открыть модуль →

Соседние уроки

07 Кредитный скоринг: данные решают всё 09 Инцидент: модель развалилась в проде

Программа целиком — 23 урока