TGViewer
Нескучный Data Science Нескучный Data Science @not_boring_ds · 12K subscribers
Post #529 2.69K
Как научиться предсказывать что угодно? 🔮

На видео спикер рассказывает, что его команда научилась за три дня до расставания предсказывать, что девушка бросит парня.

Когда я впервые увидел это в трансляции, то понял только часть проблемы: спикер вообще не шарит, а команда решает странные задачи и пилит такие же фичи 😅 Тогда моего руководительского опыта не хватило, чтобы задуматься о процессах внутри компании — меня просто поразил уровень абсурда.

Причём настолько, что эта история догнала меня даже спустя семь лет.

Но сейчас, когда я строю собственную компанию, меня гораздо больше беспокоит другой вопрос: какие процессы внутри компании привели к тому, что топ-менеджмент рассказывает об этом на конференции как об успешном кейсе? 🤔

Начнём с самого кейса.

Пока я не пересмотрел видео, у меня были разные гипотезы о том, как они собрали целевую переменную:

— может быть, провели опрос?
— спарсили социальные сети?
— а как тогда собрали хард-негативные сэмплы?

Но нет.

Судя по видео, аналитики придумали сегмент на основе набора косвенных признаков.

С какой точностью этот сегмент отражал реальность?

Правильно: никто не знает 🙃

Дальше, вероятно, построили модель, которая научилась предсказывать эту синтетическую целевую переменную.

И здесь появляется ещё один уровень неопределённости.

Сначала мы с неизвестной точностью восстанавливаем целевую переменную по косвенным признакам. Затем с некоторой точностью обучаем модель предсказывать уже эту восстановленную переменную.

То есть модель предсказывает не само расставание, а предположение аналитиков о расставании.

На ошибку при создании таргета накладывается ошибка самой модели. Поэтому итоговое качество относительно реального события становится ещё менее понятным 🎯

Следующий вопрос: как проверяли лики?

Не протекли ли в модель те же признаки, на основе которых изначально восстановили целевую переменную? 🫠

Ну и самое интересное: как измерили эффект?

Никак.

Модель встроили в рекомендательную систему, в которой, судя по рассказу, нет прозрачно рассчитанного финансового эффекта 💸

Итак, рецепт, как научиться предсказывать что угодно:

1. Конструируете целевую переменную с неизвестной точностью.
2. Обучаете модель предсказывать этот синтетический таргет.
3. Получаете два слоя ошибки: в разметке и в самой модели.
4. Встраиваете модель в продукт, где невозможно оценить её эффект в деньгах.
5. Рассказываете об успешном кейсе на конференции.
6. Готово — вы великолепны! 🚀

Всё это звучит смешно ровно до того момента, пока вам самим не приходится собирать такие фантастические сегменты и обучать на них модели.

Напишите в комментариях, если знаете достоверный источник данных для такого сегмента. Особенно интересно, где взять качественные хард-негативные сэмплы 👇
  • 😁 22
  • 🔥 8
  • 🤯 4
  • ❤ 2
  • 👎 2
  • 🤩 1
  • 🐳 1
  • 🤣 1
More from @not_boring_ds
  1. Sep 19, 2026💩 Как улучшить F1-micro и насрать рекламодателю — в прямом смысле Вас тоже бесит, когда в…
  2. Sep 4, 2026Конференция, на которой точно не соскучишься🎙️ 26 сентября Яндекс празднует 10-летие Data…
  3. Sep 3, 2026🎙 Мини-интервью с руководителем ML-департамента рисков в Яндекс Финтехе Владимир Ершов —…
  4. Aug 29, 2026🤣 Как за год заработать банку 50 тысяч 👼 После того как я стал руководителем, мне хотело…
  5. Aug 26, 2026✈️ Альфа оплатит до 20 000 рублей на обеды состоятельным сотрудникам Сбера 🍽 У премиальны…
  6. Aug 25, 2026🐍 Как сделать автоматизацию поддержки 100% одной фразой 🎤 В 2018 году в одной крупной ко…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →