TGViewer
Нескучный Data Science Нескучный Data Science @not_boring_ds · 12.1K subscribers
Post #43 4.91K
Все DSы в моей команде начинают решение задачи с изучения бизнес-процесса, подобно тому, как физик изучает природу. Чтение документации, глубинное интервью с участниками процесса, наблюдение за процессом и даже участие — это не полный список инструментов исследователя. В результате, складывается картина, где, как и в каком объеме модель сможет принести профит компании или, наоборот, приходит осознание бессмысленности затеи. Сейчас это кажется очевидной необходимостью, но это понимание пришло далеко не сразу. Сегодня расскажу об опыте участия в проектах, которые этому научили.

📞 Граф диалогов в колл-центре
Моя первая рабочая задача была довольно масштабная и наукоемкая - требовалось построить граф диалогов операторов колл-центра на основе текстов разговоров. В литературе, как и у конкурентов, отсутствовал опыт решения подобных задач, ведь на дворе был 2016-ый год. Задача решалась с нуля 1.5 джунами на part-time при помощи консультаций научника: были придуманы и реализованы алгоритмы частичного обучения для сегментации текста, размечены данные сначала самостоятельно, затем на аутсорсе разработан интерфейс для разметчиков и развернут в контуре компании, обучен штат асессоров и настроен контроль качество их работы, наконец, обучена модель с хорошим качеством. В ходе решения задачи мы плотно общались с заказчиком, но когда проект был на финальной стадии, оказалось, что дальше «***тесь как хотите» не подходит. В итоге, пришлось потратить еще полгода, и мы нашли пару применений для разработанного алгоритма самостоятельно.
🤔Вывод: убеждайтесь перед стартом проекта, что заказчик действительно знает, как использовать модель и уже произвел оценку потенциального финансового эффекта.

📰Классификация новостей по компаниям
Инвестиции набирали свой оборот «среди домохозяек», а мы в свою очередь количество задач по анализу текстов. Задача была настолько классной и очевидной, что в наших глазах был гарантирован стопроцентный результат. Более того, был подготовлен размеченный по категориям датасет на 100к+ семплов. В результате, за пару месяцев была разработана модель, еще за пару задеплоена и интегрирована в мобильное приложение. Наконец-то мы запустили а/б-тест, по результатам которого генерировались аж десятки тысяч рублей в месяц дополнительной прибыли.
🤔Вывод: продумывайте заранее, где и как будет применяться ваша модель и какой у нее финансовый потенциал.

💬Поделитесь в комментариях историями ваших неудачных проектов чтобы читали не совершали и ваших ошибок.

#mlsysdesign #неудачи
  • 👍 35
  • 🔥 5
  • ❤ 3
  • 🤔 2
More from @not_boring_ds
  1. Sep 19, 2026💩 Как улучшить F1-micro и насрать рекламодателю — в прямом смысле Вас тоже бесит, когда в…
  2. Sep 5, 2026Как научиться предсказывать что угодно? 🔮 На видео спикер рассказывает, что его команда н…
  3. Sep 4, 2026Конференция, на которой точно не соскучишься🎙️ 26 сентября Яндекс празднует 10-летие Data…
  4. Sep 3, 2026🎙 Мини-интервью с руководителем ML-департамента рисков в Яндекс Финтехе Владимир Ершов —…
  5. Aug 29, 2026🤣 Как за год заработать банку 50 тысяч 👼 После того как я стал руководителем, мне хотело…
  6. Aug 26, 2026✈️ Альфа оплатит до 20 000 рублей на обеды состоятельным сотрудникам Сбера 🍽 У премиальны…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →