ML для менеджера: как живёт ML-проект (жизненный цикл) 🔄
Продолжаем цикл постов ML для менеджера. Часть 1 и Часть 2
Допустим, вы предполагаете, что ML нужен, и у компании есть данные (если их нет, сбор и разметка данных становится отдельным этапом 0).
Этап 1. Сбор и исследование данных
Data scientist'ы забирают данные из разных источников. Дальше идёт разведочный анализ (EDA): считают статистики, рисуют графики, ищут выбросы, пропуски, корреляции. На этом этапе часто выясняется, что данных недостаточно или они не того качества.
Этап 2. Очистка и подготовка данных
Самый трудоёмкий этап. Занимает до 80% времени в ML-проекте. Обработка пропусков, удаление дубликатов, отбор признаков.
Этап 3. Обучение и валидация
Данные делятся на тренировочные и тестовые. Модель учится на первых, проверяется на вторых. Вот тут команда часто уходит в исследовательский раш, перебирает кучу моделей ради сотых долей метрики. Договоритесь заранее о критерии успеха и времени на эксперименты.
Этап 4. Внедрение (инференс)
ML-инженер упаковывает модель в микросервис и поднимает API.
Способы инференса:
Онлайн: запрос пришёл, модель посчитала, ответ вернула (например в чат-боте)
Пакетный (batch): модель считает предсказания раз в сутки (работа с большими объемами данных в исследованиях)
Гибрид: часть предрассчитана, часть считается на лету (например роботы-доставщики, модели в устройстве анализируют загрузку и маршруты в реальном времени, а облачные сервисы оптимизируют маршруты и поведение)
Этап 5. Мониторинг и поддержка
Модель в проде, это не конец. Данные в мире меняются, и модель может устареть. Это называется дрифт.
Дрифт данных, входные данные изменелись. Модель обучалась на данных о квартирах 40–100 м². Когда на рынок вышли микро-студии по 15 м², она продолжила применять старые правила, но новые данные оказались за пределами её понимания.
Дрифт концепта. Изменились зависимости данными и результатом. Рекомендательная модель дает не актуальные рекомендации, потому что новый культурный тренд изменил предпочтения пользователей той же демографической группы.
О чём спрашивать себя и команду на каждом этапе
- На этапе данных: Откуда берутся данные? Можно ли им доверять?
- На этапе обучения: Какая метрика считается успехом?
- На этапе деплоя: Как часто модель будет переобучаться?
- На этапе мониторинга: Как узнаем, что модель испортилась? Есть fallback?
В следующем посте поговорим о рисках и их митигации.
🔮Управление без иллюзий. Подписывайтесь и делитесь с коллегами!
Канал в MAX'e
#материалы #ml
Post #69
167
- ❤ 5