МОДУЛЬ 15 · Middle-track · 2.5 час

Большая модель точнее — и не окупается

Пять тысяч обращений в день и 55 человеко-часов на одну сортировку. Выбираем между тремя решениями не по F1, а по F1 вместе с латентностью и железом.

Пройти модуль в симуляторе Все 23 урока

Первые два модуля бесплатны, без карты. Остальные — по подписке $20/мес.

🏢 Ситуация

Руководитель поддержки приходит к Лене:

«5 000 обращений в день. Операторы тратят первые 40 секунд каждого тикета на то, чтобы понять, куда его отнести: платежи, доставка, возвраты, аккаунт, фрод. Это 55 человеко-часов в день на сортировку!»

Лена:

«Автоклассификация тикетов — идеальная первая NLP-задача. У нас 200 000 исторических тикетов с категориями, проставленными операторами. Начни с TF-IDF + линейной модели, потом сравни с предобученным трансформером. Русский язык, опечатки, сленг — добро пожаловать в реальный NLP.»

🎯 Ваша задача

  1. Понять, как текст превращается в числа: от мешка слов до эмбеддингов.
  2. Построить бейзлайн TF-IDF + логрег.
  3. Сравнить с дообученным трансформером и решить, что тащить в прод.

📚 Теория

Текст → числа: эволюция подходов

  1. Bag of Words: текст = вектор счётчиков слов. Теряет порядок слов.
  2. TF-IDF: счётчики, взвешенные редкостью слова в корпусе. Частое в документе, но редкое в корпусе слово («возврат») важнее, чем частое везде («здравствуйте»). До сих пор сильнейший бейзлайн для классификации.
  3. Word embeddings (word2vec, fastText): слово → плотный вектор; похожие по смыслу слова близки. fastText учит векторы по символьным n-граммам — устойчив к опечаткам.
  4. Трансформеры (BERT и наследники): вектор слова зависит от контекста («карта заблокирована» vs «карта города»). Предобучены на огромных корпусах, дообучаются (fine-tuning) под задачу.
«списали деньги дважды, верните!» Путь 1: TF-IDF мешок слов, взвешенный редкостью [0, 0.8, 0, 0.4, 0, …] — разреженный Путь 2: трансформер вектор слова зависит от контекста [0.21, −0.77, …] — плотный, 312d классификатор softmax по 5 классам Платежи P = 0.93 TF-IDF: 2 мс, CPU, F1 0.86 · Трансформер: 40 мс, F1 0.91 — выбор из требований
Оба пути превращают текст в числа. Бейзлайн TF-IDF обязателен; трансформер добавляет понимание контекста за счёт латентности и сложности.

Пайплайн классического NLP

Когда что использовать

Подход Плюсы Минусы
TF-IDF + линейная модель быстро, дёшево, интерпретируемо, CPU не понимает контекст и синонимы
Fine-tuned трансформер лучшее качество, устойчивость к формулировкам GPU, латентность, сложнее поддержка

Решение — как всегда, из требований: латентность, бюджет, размер выигрыша.


Что запомнить

  • TF-IDF + линейная модель — обязательный бейзлайн NLP-классификации.
  • Лемматизация и n-граммы сильно помогают русскому языку.
  • Трансформеры дают контекст; выбирайте размер модели из требований к латентности.
  • Порог уверенности + ручная очередь = безопасная автоматизация.

Дальше в модуле: Практика

Открыть модуль →

Соседние уроки

14 Склад затоварен: прогноз спроса 16 Знакомство с нейросетями

Программа целиком — 23 урока