TGViewer
Channel Public Channel
Нескучный Data Science

Нескучный Data Science

@not_boring_ds

Рассказываю как применять AI на практике
ex. Managing AI Director at Sber,
👨‍💻ex. Head of ML LAB at Alfa
https://www.linkedin.com/in/smirnov-evgeny/

По вопросам сотрудничества @datascience_assist

Регистрации в Роскомнадзор № 5278866657
Subscribers
12K
Photos
361
Videos
16
Links
195
Recent Posts 9 shown
Post #530 1.55K
💩 Как улучшить F1-micro и насрать рекламодателю — в прямом смысле

Вас тоже бесит, когда вы ищете один товар, а рекламный алгоритм настойчиво подсовывает совсем другой? Обычно мы видим эту проблему со стороны пользователя. А сейчас покажу, как она выглядит со стороны рекламодателя, которому алгоритм привёл совсем не тех пользователей.

В @mirabistro нет-нет да заходят люди исключительно ради туалета. Мы находимся в центре, пешеходный трафик огромный. Я думал, что это неизбежные издержки локации. Туалет у нас — комплиментарная услуга для гостей.

👀 Неделю назад сижу в бистро и наблюдаю: заходит человек и сразу направляется в туалет.

У этого сегмента, кстати, есть устойчивый поведенческий паттерн. Они закрывают не только дверь туалета, но и дверь в зону с раковиной. Как будто пришли не руки помыть, а помыться целиком.

Через минуту заходит второй.

Два одинаковых события подряд меня уже насторожили.

💡 И тут меня осенило: дело в таргетинге.

📈 Недавно я купил продвижение в одном картографическом сервисе. Как аналитик, первым делом полез смотреть, как люди находят бистро и по каким запросам переходят в карточку.

Среди запросов был «туалет», хотя мы вообще-то кафе.

Давайте разберёмся, что пошло не так при обучении поискового алгоритма. Достоверно я этого не знаю, но с большой вероятностью — всё было именно так.

1️⃣ Поставили цель на квартал выбить XX% по F1-micro.
2️⃣ В датасет поискового движка долили запросы про туалеты.
3️⃣ Кафе, в которых есть туалет, разметили как релевантные ответы — то есть на уровне таргета фактически приравняли кафе к туалету.
4️⃣ При micro-усреднении все true positive складываются в общую копилку, поэтому новая категория помогла вытянуть итоговый F1

Классический случай: офлайн-метрику оптимизировали, заборы успешно покрасили, менеджеры получили бонусы, а на рекламодателей оказалось насрать — в прямом смысле слова, но хотя бы чужими силами.

😆 Публиковать статистику сервиса я не хотел, но 8% туалетного трафика это уже не смешно.
  • 🤣 38
  • 😭 7
  • 🔥 5
  • ❤ 2
  • 🐳 1
Post #529 2.67K
Как научиться предсказывать что угодно? 🔮

На видео спикер рассказывает, что его команда научилась за три дня до расставания предсказывать, что девушка бросит парня.

Когда я впервые увидел это в трансляции, то понял только часть проблемы: спикер вообще не шарит, а команда решает странные задачи и пилит такие же фичи 😅 Тогда моего руководительского опыта не хватило, чтобы задуматься о процессах внутри компании — меня просто поразил уровень абсурда.

Причём настолько, что эта история догнала меня даже спустя семь лет.

Но сейчас, когда я строю собственную компанию, меня гораздо больше беспокоит другой вопрос: какие процессы внутри компании привели к тому, что топ-менеджмент рассказывает об этом на конференции как об успешном кейсе? 🤔

Начнём с самого кейса.

Пока я не пересмотрел видео, у меня были разные гипотезы о том, как они собрали целевую переменную:

— может быть, провели опрос?
— спарсили социальные сети?
— а как тогда собрали хард-негативные сэмплы?

Но нет.

Судя по видео, аналитики придумали сегмент на основе набора косвенных признаков.

С какой точностью этот сегмент отражал реальность?

Правильно: никто не знает 🙃

Дальше, вероятно, построили модель, которая научилась предсказывать эту синтетическую целевую переменную.

И здесь появляется ещё один уровень неопределённости.

Сначала мы с неизвестной точностью восстанавливаем целевую переменную по косвенным признакам. Затем с некоторой точностью обучаем модель предсказывать уже эту восстановленную переменную.

То есть модель предсказывает не само расставание, а предположение аналитиков о расставании.

На ошибку при создании таргета накладывается ошибка самой модели. Поэтому итоговое качество относительно реального события становится ещё менее понятным 🎯

Следующий вопрос: как проверяли лики?

Не протекли ли в модель те же признаки, на основе которых изначально восстановили целевую переменную? 🫠

Ну и самое интересное: как измерили эффект?

Никак.

Модель встроили в рекомендательную систему, в которой, судя по рассказу, нет прозрачно рассчитанного финансового эффекта 💸

Итак, рецепт, как научиться предсказывать что угодно:

1. Конструируете целевую переменную с неизвестной точностью.
2. Обучаете модель предсказывать этот синтетический таргет.
3. Получаете два слоя ошибки: в разметке и в самой модели.
4. Встраиваете модель в продукт, где невозможно оценить её эффект в деньгах.
5. Рассказываете об успешном кейсе на конференции.
6. Готово — вы великолепны! 🚀

Всё это звучит смешно ровно до того момента, пока вам самим не приходится собирать такие фантастические сегменты и обучать на них модели.

Напишите в комментариях, если знаете достоверный источник данных для такого сегмента. Особенно интересно, где взять качественные хард-негативные сэмплы 👇
  • 😁 22
  • 🔥 8
  • 🤯 4
  • ❤ 2
  • 👎 2
  • 🤩 1
  • 🐳 1
  • 🤣 1
Post #528 2.48K
Конференция, на которой точно не соскучишься🎙️

26 сентября Яндекс празднует 10-летие Data Driven, и празднует с размахом: доклады про AI-first-аналитику, стенды с экспертами, Random Coffee с топовыми аналитиками, а вечером — афтерпати с музыкой, закусками и IT stand-up от аналитиков про наболевшее.

Из докладов особенно ждём: Роман Халкечев расскажет о том, как AI переписывает правила игры при работе с данными, Артём Солоухин покажет MARS — первую мультиагентную рабочую среду Яндекса, а Максим Стаценко поделится, как собрать агента-аналитика, которому можно доверять, — с конкретными шагами.

Москва + онлайн💻, 26 сентября.

Мест офлайн немного — регистрируйтесь по ссылке

Новости конференции
  • 🐳 9
  • ❤ 2
  • 🔥 2
  • 👎 1
Post #520 2.53K
🎙 Мини-интервью с руководителем ML-департамента рисков в Яндекс Финтехе

Владимир Ершов — ex. Visa, Сбер и Alfa-Bank, выпускник МГИМО и IE Business School.

Четыре интересных факта про героя интервью:

1️⃣ Пришёл в ML из экономики: после МГИМО выбрал магистрату по Big Data в испанской IE Business School.
2️⃣ Успел поработать во всех ML-направлениях бизнес-группы Персональных сервисов Яндекса.
3️⃣ Сейчас его команда отвечает за порядка 50 моделей для Сплита, кредитной карты, кредита наличными и B2B-кредитования.
4️⃣ Практически не пишет код уже четыре года, но иногда сам ревьюит самые важные куски.

👉 Подробнее — на карточках.

Ставьте 🔥, если хотите больше интервью с ML-руководителями. Вопросы Владимиру оставляйте в комментариях 👇

#мини_интервью
  • 🔥 38
  • ❤ 17
  • 👍 8
  • 🐳 1
Post #519 3.61K
🤣 Как за год заработать банку 50 тысяч

👼 После того как я стал руководителем, мне хотелось решить как можно больше задач силами своей команды. Мы умели работать с текстами, и эту экспертизу хотелось применить в продуктах банка.

📈 Одна такая задача нашлась в инвестиционном продукте. Новости без категорий было неудобно читать. По крайней мере, так казалось мне — человеку, который умел их классифицировать. Решение выглядело очевидным: давайте сделаем классификатор. Я убедил бизнес, собрал первую модель и передал её джуну на доработку. Мы разметили данные, улучшили качество и показали результат заказчику. Тексты хорошо раскладывались по категориям, заказчик был доволен — договорились внедрять в мобильное приложение.

🗓️ А дальше приложение переделывали, команда менялась, приоритеты уезжали. Так прошёл год.

🎉 Наконец классификатор внедрили, запустили A/B-тест и ещё через месяц подвели итоги. Оказалось, что он приносит банку 50 тысяч рублей в месяц — примерно зарплату джуна, который его допиливал.

🤦‍♂️ Где мы облажались?

- Не спросили, какую продуктовую метрику хотим изменить, за счёт чего и насколько. Мы просто решили, что категоризированные новости — это хорошо.

- Заранее не договорились, как будем измерять эффект. В итоге продакт что-то как-то протестировал, а мы что-то как-то посчитали.

Этот печальный опыт усилил мою аллергию на внедрение технологий по мотивам русских сказок: «Пойди туда, не знаю куда. Внедри затем, не знаю зачем». После этой истории у меня закончился нейросетевой недотрах. 😅

🎯 Прежде чем делать модель, ответьте на два вопроса: какой бизнес-эффект она должна дать и как вы его измерите. До продакшена классификатор мы довезли. До бизнес-эффекта — нет.

А как думаете вы, почему классификатор удалось внедрить только через год? Пишите свои версии в комментариях 👇
  • 🤣 22
  • ❤ 8
  • 🐳 6
  • 🤔 1
Post #518 3.83K
✈️ Альфа оплатит до 20 000 рублей на обеды состоятельным сотрудникам Сбера

🍽 У премиальных клиентов Альфа-Банка есть привилегия: банк компенсирует еду в ресторанах российских аэропортов.

Чтобы не заключать договор с каждым заведением вручную, Альфа подключила дата-сайентистов 👨‍💻 Как рассказали в статье на РБК, алгоритм анализирует карточные операции, сопоставляет их с координатами терминалов и определяет, прошла ли покупка на территории аэропорта.

📱 Подходящие операции автоматически появляются в приложении. Загружать чек обычно не нужно, хотя банк оставляет за собой право запросить билет или подтверждение покупки. Запомним этот момент)

Но недавно у алгоритма обнаружился интересный побочный эффект 😅

Ресторан в офисе Сбера на одном из верхних этажей определяется как ресторан в аэропорту. Возможно, терминалу присвоили неправильные координаты. Возможно, подвели исходные данные. А может быть, ресторан просто оказался слишком близко к небу ☁️

В итоге премиальные клиенты Альфы могут компенсировать там обычные рабочие обеды — как будто едят перед вылетом 🛫

💸 За один чек можно вернуть до 5 000 рублей. При остатках свыше 12 млн рублей количество визитов не ограничено, но действует общий лимит компенсации ресторанов — 20 000 рублей в месяц.

Работаешь в Сбере, держишь деньги в Альфе, а обеды в Сбере оплачивает Альфа. Получается не просто выгодно, а Альфа-Выгодно ❤️

😅😅😅 Если вы работаете в Сбере и соответствуете условиям премиального обслуживания, оформляйте карту Альфа-Банка, пока дата сайентисты в Альфе не исправили баг

А теперь два вопроса:

1️⃣ Технический: какую метрику или алерт вы бы поставили на мониторинг, чтобы быстро выявлять случаи неправильной геопривязки терминалов?

2️⃣ Бизнесовый: как бы вы поступили на месте Альфы — закрыли бы лазейку и исключили ошибочно привязанные терминалы или превратили бы баг в PR-ход для привлечения клиентов с крупными остатками?

👇 Пишите свои варианты в комментариях.
  • 🤣 40
  • 😱 4
  • 🔥 3
  • 🐳 1
Post #517 3.25K
🐍 Как сделать автоматизацию поддержки 100% одной фразой

🎤 В 2018 году в одной крупной компании проходила презентация чат-бота. Команда защищала метрику автоматизации.

Один из топ-менеджеров выслушал доклад и сказал:

— Я знаю, как одной фразой довести вашу автоматизацию до 100%.

📊 В 2020 году уже в другой крупной компании топ-менеджера уволили за то, что он слишком успешно растил автоматизацию.

Автоматизацию растили. Топ-менеджера сократили. Баланс всё-таки нашёлся — просто не там.

🤖 В 2026 году помощь понадобилась одному AI-директору. Он обратился во внутренний хелпдеск, но ответа не получил: годом ранее компания успешно выполнила цели по внедрению AI и сократила поддержку.

AI внедрили. Помогать стало некому.

Когда-то я уже выпускал статью о том, как сделать контактный центр автономным. Похоже, кто-то воспринял слово «автономный» слишком буквально: теперь контактный центр не зависит ни от операторов, ни от обращений, ни от необходимости кому-то отвечать.

Что общего у этих историй?

У метрики автоматизации есть неприятная особенность: она не умеет отличать ситуацию «клиенту помогли» от ситуации «клиент не смог ни до кого достучаться». В обоих случаях оператор не понадобился.

Поэтому автоматизацию нельзя растить без второй метрики, которая показывает, не стало ли клиентам хуже. Иначе вместе с автоматизацией можно незаметно вырастить отток, а повторные покупки и кросс-продажи — так же незаметно сократить.

🐍 Говорят, на змею не действует собственный яд. Но в этой истории в конце концов подействовал. Правда, это был яд других гадюк.

💬 А теперь вопрос: какая одна фраза может сделать автоматизацию чат-бота 100%?

Пишите свои версии в комментариях 👇
  • 🔥 14
  • 🤣 6
  • ❤ 4
  • 👎 1
  • 🐳 1
Post #512 3.91K

Forwarded from BigData Team (BDT)

🚀 50 грантов Tech Orda: специализация AI Agents Engineer

Уникальная возможность для граждан РК от 18 до 45 лет:
1. Получить грант 400 000 ₸ от государства на обучение в IT;
2. С вероятностью 60+% достичь карьерных целей в ближайшие 6 месяцев при обучении с BigData Team.

📌 Как подать заявку? До 6 сентября:
1. Нажать "подать заявку" на портале Astana Hub
2. Зарегистрироваться и пройти тестирование на Learn BDT
3. Подписаться на наш Telegram, чтобы не пропустить новости.
Результаты отбора — на почту; анонсы — здесь.

Особенности 2026

1️⃣ Конечно же ИИ (Agentic Coding и AI Agents)
Не банальный prompt engineering, а фундаментальная база: tools, skills, MCP, окружения (*code*, *claw) или harness. Управление памятью (context, memory, fine-tuning vs RAG, embeddings vs Zettelkasten) и качеством (MAS, ralph-loop, evals, понимание LLMs).

2️⃣ Стоимость
Разработали программу доступную каждому:
— стоимость программы (level 1): 595 000 ₸
— грант Tech Orda: 400 000 ₸
— остаток: 195 000 ₸. Если поделить на 6 месяцев обучения:
🔥 32 500 ₸/месяц

3️⃣ Аналитика зарплат и выпускников от Astana Hub
По нашим выпускникам программы Tech Orda в Казахстане:
— 44% пришли без профильного ИКТ-образования
— 61% достигли карьерных успехов уже в период обучения
💰 1+ млн ₸ средняя зарплата выпускника
Откуда цифры — из налоговой (но анонимно). Подробности читайте в гайде по Data-профессиям.

📌 Ключевая информация
В AI-native эпоху в IT профессии базовых навыков Computer Science уже недостаточно — важно уметь ускорять процессы разработки и аналитики в десятки раз с помощью автономных ИИ-агентов, не теряя контроля над кодовой базой и архитектурой. В 2026 году мы трансформировали программу BDMLE в новый стандарт — AI Agents Engineer (AIE).

🗓 Старт обучения: сентябрь–октябрь
▶️ Видео о школе и программе (10 минут)
🔄 Волны отбора
I волна — до 23 августа, 23:59 🔥
— II волна — до 30 августа, 23:59
— III волна — до 6 сентября, 23:59

Last, but not least

Поспешите! (почему)

📩 Вопросы: личка, комментарии или techorda@bigdatateam.org
🤗 Лайк и репост — у кого-то из ваших знакомых сейчас закроется вопрос "а на что учиться".

BigData Team: the way you learn best
AI Agents | Py4BDA | Python | Machine Learning | Big Data

#study #BigDataTeam #TechOrda #AstanaHub #BDMLE #AIE
  • ❤ 7
  • 👍 4
  • 🥰 3
  • 🐳 2
  • 🗿 1
Post #509 4.08K
🤣 Яндекс сам себя забанил

Помните, я писал, как Тинькофф защитил меня от собственного спама?

Похоже, тг-боты Яндекса это прочитали, решили повторить успех и применили тот же подход к рекламе.

🍽 Хотел купить рекламу для @mirabistro на Яндекс Картах. Написал в чат-бот поддержки. Бот объяснил, что нужно отправить письмо на указанный им адрес, добавить номер телефона и логин — всё сделал по инструкции.

✉️ Причём для надёжности отправлял письмо из Яндекс Почты на аккаунт Яндекса. Текст — практически тот же, который предложил бот.

🛡 Но письмо не ушло: Яндекс решил, что оно похоже на спам, и временно заблокировал отправку.

Итого: бот Яндекса написал инструкцию, я ей последовал, а другой бот Яндекса защитил Яндекс от покупки рекламы в Яндексе.

Вот она — настоящая сквозная автоматизация бизнес-процессов 😅

P.S. @yandex свяжитесь со мной)
  • 🤣 49
  • 😁 6
  • ❤ 4
  • 👍 1
  • 🔥 1
  • 🐳 1
Older posts →

About this channel

How can I read @not_boring_ds without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Нескучный Data Science: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Нескучный Data Science have?
Нескучный Data Science (@not_boring_ds) has 12K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Нескучный Data Science know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →