Держите обещанные кейсы по NLP и CV - попробуйте догадаться, в чём здесь может быть подвох 🧐
😔 Кейс 1 (NLP, RAG)
Компания сделала внутреннего помощника для ответов на вопросы по базе знаний. Пайплайн - типичный RAG:
• сначала по запросу пользователя находятся 10 наиболее релевантных документов,
• а затем LLM формирует финальный ответ на их основе.
По оффлайн-оценкам всё выглядит весьма достойно: нужные документы в 99% случаях попадают в топ-10 при отборе, Recall@k радует.
Но в реальности оказалось:
• около 25% финальных ответов содержат фактические неточности (согласно оценкам пользователей)
• в ~15% случаев модель делает уверенные, но неверные утверждения
👉 Почему же оффлайн-метрики не гарантируют хороший финальный ответ? И что здесь можно улучшить - как в валидации, так и во всём пайплайне?
😔 Кейс 2 (NLP, классификация)
С небольшого форума собрали тексты сообщений. Из особенностей - пользователей не очень много, при этом часть из них довольно активна и пишет много ответов.
Решили обучить на этих данных модель классификации тональности: взяли предобученный BERT и дообучили его на сообщениях с форума. Примеров было достаточно, разметка корректная, дисбаланса нет - в плане данных всё чисто. Далее датасет случайно поделили на train/test, ну и обучили модель.
Результаты на оффлайнекак всегдахороши:
• Accuracy около 0.95
• F1 высокий
• кросс-валидация тоже выглядит стабильно
Но после запуска качество стало заметно проседать.
👉 Почему же оффлайн-оценка оказалась такой оптимистичной и какой важный момент был упущен?
😔 Кейс 3 (CV, детекция)
Команда обучает модель для поиска дефектов на производстве. Модель выдаёт bounding boxes, на оффлайне всё неплохо:
• mAP высокий
• precision и recall тоже выглядят хорошо
Но в проде выясняется, что:
• мелкие дефекты модель часто пропускает
• иногда вместо точной локализации она рисует слишком большие области
👉 Почему метрики снова не отражают реальную эффективность модели? Что бы вы поменяли в постановке задачи или в оценке качества?
😔 Кейс 4 (CV, классификация)
Решаем обычную задачу классификации изображений: сначала датасет немного расширили с помощью аугментаций, дисбаланса не было -> затем набор случайно разделили на train/test -> взяли предобученную модель и дообучили её.
По оффлайн-оценкам всё выглядит почти идеально: accuracy около 99% и ошибок очень мало. Но в онлайне качество почему-то заметно хуже.
👉 Что здесь могло пойти не так?
Ответы придут в пятницу 😏
#dl@data_easy
#nlp@data_easy
#cv@data_easy
#карьера@data_easy