TGViewer
EasyData EasyData @data_easy · 1.37K subscribers
Post #353 1.16K
Привет, друзья!
Держите обещанные кейсы по NLP и CV - попробуйте догадаться, в чём здесь может быть подвох 🧐

😔 Кейс 1 (NLP, RAG)
Компания сделала внутреннего помощника для ответов на вопросы по базе знаний. Пайплайн - типичный RAG:
• сначала по запросу пользователя находятся 10 наиболее релевантных документов,
• а затем LLM формирует финальный ответ на их основе.

По оффлайн-оценкам всё выглядит весьма достойно: нужные документы в 99% случаях попадают в топ-10 при отборе, Recall@k радует.

Но в реальности оказалось:
• около 25% финальных ответов содержат фактические неточности (согласно оценкам пользователей)
• в ~15% случаев модель делает уверенные, но неверные утверждения

👉 Почему же оффлайн-метрики не гарантируют хороший финальный ответ? И что здесь можно улучшить - как в валидации, так и во всём пайплайне?


😔 Кейс 2 (NLP, классификация)
С небольшого форума собрали тексты сообщений. Из особенностей - пользователей не очень много, при этом часть из них довольно активна и пишет много ответов.

Решили обучить на этих данных модель классификации тональности: взяли предобученный BERT и дообучили его на сообщениях с форума. Примеров было достаточно, разметка корректная, дисбаланса нет - в плане данных всё чисто. Далее датасет случайно поделили на train/test, ну и обучили модель.

Результаты на оффлайне как всегда хороши:
• Accuracy около 0.95
• F1 высокий
• кросс-валидация тоже выглядит стабильно

Но после запуска качество стало заметно проседать.

👉 Почему же оффлайн-оценка оказалась такой оптимистичной и какой важный момент был упущен?


😔 Кейс 3 (CV, детекция)
Команда обучает модель для поиска дефектов на производстве. Модель выдаёт bounding boxes, на оффлайне всё неплохо:
• mAP высокий
• precision и recall тоже выглядят хорошо

Но в проде выясняется, что:
• мелкие дефекты модель часто пропускает
• иногда вместо точной локализации она рисует слишком большие области

👉 Почему метрики снова не отражают реальную эффективность модели? Что бы вы поменяли в постановке задачи или в оценке качества?


😔 Кейс 4 (CV, классификация)
Решаем обычную задачу классификации изображений: сначала датасет немного расширили с помощью аугментаций, дисбаланса не было -> затем набор случайно разделили на train/test -> взяли предобученную модель и дообучили её.

По оффлайн-оценкам всё выглядит почти идеально: accuracy около 99% и ошибок очень мало. Но в онлайне качество почему-то заметно хуже.

👉 Что здесь могло пойти не так?


Ответы придут в пятницу 😏

#dl@data_easy
#nlp@data_easy
#cv@data_easy
#карьера@data_easy
  • 🔥 10
  • ❤ 4
  • 👍 4
  • ❤‍🔥 1
More from @data_easy
  1. Sep 25, 2026Привет, друзья! Давайте разберём, как оценивать RAG-пайплайн. Тема довольно острая: наприм…
  2. Sep 20, 2026Привет, друзья! Adam и AdamW правят балом почти десять лет... Претенденты на замену были,…
  3. Aug 30, 2026Привет, друзья! Автор возвращается с каникул с полным мешком пирожков полезных материалов…
  4. Jul 12, 2026Привет, друзья! Представьте: у вас есть паркет на 10 гигов, и надо всего лишь посчитать по…
  5. Jun 28, 2026Привет, друзья! Устали от стандартных учебников по ML? Материалов с каждым месяцем и правд…
  6. Jun 21, 2026Привет, друзья! Сегодняшний рассказ про marimo - реактивный блокнот для Python, который мн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →