Сегодня вместо туториалов несколько реальных кейсов из жизни ML-щика. Попробуйте предположить, в чём могут быть проблемы 🧐
😔 Кейс 1 (про ранжирование)
Команда построила улучшенную модель (относительно текущей), которая ранжирует статьи на портале по вероятности клика.
Модель обучается как обычный бинарный классификатор: предсказывает вероятность клика для каждой статьи.
Offline-показатели (в т.ч. на валидации) выглядят отлично:
• ROC-AUC выше, чем у предыдущей версии модели
• LogLoss падает, переобучения нет
Но в онлайн-эксперименте CTR почти не вырос:(
👉 В чем проблема этой модели и как её улучшить?
😔 Кейс 2 (про калибровку вероятностей)
Есть модель бинарной классификации (например, обнаружение мошеннических операций). Команда решила откалибровать вероятности.
❤️Напомним: то что предсказывает классификатор - это "степень уверенности модели", а процедура калибровки переводит предсказания в интерпретируемые вероятности в математическом смысле.
После калибровки, на отложенной выборке:
• ROC-AUC почти не изменился
• Recall заметно упал...
👉 Почему это могло произойти и как исправить?
😔 Кейс 3 (прогноз возврата товара)
Модель предсказывает, вернёт ли пользователь товар после покупки. Таргет простой: returned = 1, если пользователь оформил возврат, и 0 - иначе.
Команда разработала улучшенную версию модели, метрики на offline-валидации получились отличными. Чтобы получить как можно лучшие результаты и в A/B-тесте, команда переобучила модель для тестовой группы на самых свежих данных за последнюю неделю.
Однако после запуска A/B-теста онлайн-метрики новой модели стали заметно проигрывать в первую неделю эксперимента...
👉 Где команда просчиталась?
Пишите ваши варианты в комментариях
А если хотите кейсы из NLP или CV - ставьте 🐳
#карьера@data_easy
#classic_ml@data_easy