TGViewer
Channel Public Channel
Симулейтив

Симулейтив

@simulative_official

Мы — образовательная платформа в сфере аналитики Симулейтив: simulative.ru

Создаём курсы-симуляторы, где обучаем на кейсах из реального бизнеса.

Канал по ML: @modprod
Наш уютный чат: @itresume_chat
Поддержка: @simulative_support
Subscribers
7.47K
Photos
2K
Videos
86
Links
1.6K

Showing posts older than #3362 · Back to latest

Older Posts 15 shown
Post #3361 842
[Стрим] A/B-тесты: тонкости подготовки, которые решают всё

Друзья, наши контентные стримы продолжаются! Сегодня в 19:00 по МСК к нам заглянет Александр Грудинин, Lead Data Analyst в AdTech Holding.

💡 О чём поговорим?

За правильным дизайном A/B-теста стоит целый арсенал подходов, и выбор между ними напрямую влияет на то, доверять ли результатам. Разберём по делу:

1️⃣ Аналитический подход — когда он работает и в чём его ограничения;
2️⃣ Monte Carlo — как и зачем моделировать тест до его запуска;
3️⃣ Bootstrap — когда без него не обойтись;
4️⃣ Как выбирать между тремя методами под конкретную задачу;
5️⃣ AA-тест в процессе дизайна — нужен ли он на самом деле?

Всё это — на реальных данных и с живым кодом на Python 🐍

🛎️ Поставить напоминалку в календарь

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 🔥 6
  • ❤ 4
Post #3355 786
5 ошибок, которые аналитики делают при работе с бизнес-задачей

Привет! На связи Михаил Строганов, автор тренажёра аналитика данных, продуктовый аналитик в Magnit OMNI 👋🏻

Кого из нас хоть раз не посещала мысль: «Ну почему они просто не могут сказать, что хотят посчитать?». Согласитесь, работать без чёткого ТЗ бывает сложно, но именно умение собирать контекст задачи с клиента выделяет сильных аналитиков.

В карточках собрал ещё 5 ошибок, которые аналитики делают при работе с бизнес-задачами ⬆️

Большая часть ошибок связаны с пониманием задачи и исправляются только практикой на задачах, где заказчик ненастоящий, а вопросы реальные. В Тренажёре аналитика данных я собрал 15 кейсов из разных сфер бизнеса как раз с такими запросами. Я буду разбирать ваши ответы и проверять не только правильность запроса, но и логику подхода к задаче.


✅ Записывайтесь, стартуем 5 июня: simulative.ru/da-practice

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • ❤ 4
  • 👍 2
  • 🔥 2
Post #3353 791
Симулейтив Вебинары последней недели мая ❤️ На этой неделе погружаемся в конвейер данных и учимся строить эффективные A/B-тесты. Ставьте напоминание в календарь, чтобы не забыть! ⭐️ 25 мая, 19:00 МСК — «Конвейер данных: от сбора до решения» Вместе с Павлом Беляевым…
Конвейер данных — уже сегодня в 19:00 МСК

Сегодня вечером разбираем полный цикл работы с данными вместе с Павлом Беляевым, руководителем группы дата-аналитиков в Яндекс eLama. От сбора и обработки до метрик и реальных решений — то, как это устроено на практике в крупной компании. Подключайтесь!

➡️ Ссылка на трансляцию

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 🔥 4
  • ❤ 2
  • 👍 2
Post #3352 690

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 3
  • ❤ 2
  • 🔥 2
Post #3350 804
Вебинары последней недели мая ❤️

На этой неделе погружаемся в конвейер данных и учимся строить эффективные A/B-тесты. Ставьте напоминание в календарь, чтобы не забыть!

⭐️ 25 мая, 19:00 МСК — «Конвейер данных: от сбора до решения»

Вместе с Павлом Беляевым разберёмся, что из себя представляет конвейер данных и как правильно работать с ним на каждом этапе — сбор, преобразование, визуализация, анализ, решения для бизнеса.

➡️ Поставить напоминание в календарь


⭐️ 28 мая, 19:00 МСК — «A/B-тесты в продуктовой аналитике: от гипотезы до решения»

Решим продуктовый кейс: подготовим метрики для A/B-теста, сформулируем рабочую гипотезу и интерпретируем неоднозначные результаты. Словом, сделаем максимально эффективный A/B-тест для бизнеса.

➡️ Поставить напоминание в календарь


📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • ❤ 5
  • 👍 2
  • 🔥 1
Post #3349 895
Симулейтив 💻💻💻💻💻 Почему ваша нейросеть не работает? Обучили модель, а она не предсказывает ничего полезного. Знакомо? 21 мая вместе с Евгенией Анкудиновой, Data Scientist в Avito, разберём типичные ошибки новичков в Deep Learning: возьмём правдоподобный, но намеренно…
Разбираем ошибки в DL уже сейчас!

Присоединяйтесь к вебинару — Евгения Анкудинова, Data Scientist в Avito, на живом примере покажет, как выглядит сломанный пайплайн изнутри и что именно идёт не так на каждом этапе: от подготовки данных до обучения модели.

Если вы хоть раз получали модель, которая формально обучилась, но в деле не работает — этот вебинар для вас.

🛎️ Подключиться к эфиру

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 🔥 5
  • 👍 3
  • ❤ 2
Post #3348 874
💻💻💻💻💻 Почему ваша нейросеть не работает?

Обучили модель, а она не предсказывает ничего полезного. Знакомо?

21 мая вместе с Евгенией Анкудиновой, Data Scientist в Avito, разберём типичные ошибки новичков в Deep Learning: возьмём правдоподобный, но намеренно сломанный пайплайн и последовательно починим его в прямом эфире.

На вебинаре вы:
➡️ Узнаете, какие ошибки убивают модель ещё до обучения — грязные данные, некорректная разметка, неправильный сплит и data leakage;
➡️ Поймёте, почему модель переобучается или не учится вовсе, и как выбрать архитектуру, гиперпараметры и learning rate, не стреляя наугад;
➡️ Разберёте, в каких задачах Deep Learning вообще не нужен — и как это понять до того, как потратить время и ресурсы.

📆 21 мая, 19:00 МСК, онлайн
❗️ Ссылка на трансляцию

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 🔥 5
  • 👍 2
  • ❤ 1
Post #3347 796
Симулейтив Стрим: рецепты подготовки данных для ML-моделей Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries. 💡 О чём поговорим? Данные в ML решают больше, чем кажется на первый…
❗️ Запись стрима про ML-модели уже на канале!

Смотрите там, где удобно:
➡️ YouTube
➡️ VK Видео

⭐️ А уже в пятницу завершаем набор на обучение на курсы «ML-инженер» и «Дата-сайентист», где Мария выступает ментором. Присоединяйтесь к курсу и учитесь строить эффективные ML-модели от создания до продакшена!

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 👍 4
  • ❤ 3
  • 🔥 2
Post #3346 751
Друзья, стрим с Марией уже идёт!

Разбираем подготовку данных для ML-моделей — вы ещё успеваете подключиться и задать вопросы в прямом эфире.

➡️ Подключиться к трансляции ⬅️
  • ❤ 4
  • 👍 3
  • 🔥 2
Post #3345 702
Симулейтив Стрим: рецепты подготовки данных для ML-моделей Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries. 💡 О чём поговорим? Данные в ML решают больше, чем кажется на первый…
⚡️ Друзья, стрим начинаем уже через час!

Мария Жарова расскажет, как на практике выглядит подготовка данных для ML-моделей: дубликаты, пропуски, выбросы, кодирование признаков и типичные ошибки, которые незаметно роняют качество модели.

Подключайтесь — будет практично и по делу!

➡️ Подключиться к трансляции

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 👍 5
  • ❤ 2
  • 🔥 2
Post #3344 652

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 👍 5
  • ❤ 2
  • 🔥 1
Post #3343 764
Стрим: рецепты подготовки данных для ML-моделей

Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries.

💡 О чём поговорим?

Данные в ML решают больше, чем кажется на первый взгляд. Разберём, как выглядит подготовка датасетов в реальных проектах — без теории, только практический взгляд изнутри.

Пошагово пройдём по базовой «рутине» дата-сайентиста:

1️⃣ Дубликаты, пропуски, выбросы — что с ними делать на практике;
2️⃣ Подготовка признаков для модели — кодирование и масштабирование;
3️⃣ Частые ошибки — утечки данных, мультиколлинеарность, нестабильность и другие вещи, которые тихо ломают качество модели.

Мария поделится лайфхаками и разберёт реальные кейсы из своей работы в команде рекомендаций. Будет много практики, примеров и ответов на ваши вопросы.

❗️ Не пропустите! Ссылку на подключение к трансляции пришлём за 1 час до её начала.

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • ❤ 7
  • 🔥 4
  • 👍 2
Post #3342 751
Как мы спасли текст, который съедала LLMSherpa: гибрид для парсинга

Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻

Делюсь кейсом, который отлично показывает, что в обработке документов нет универсального инструмента.

Для сервиса парсинга мы взяли библиотеку LLMSherpa. Она идеально считывала заголовки, таблицы, списки и сохраняла логическую структуру текста. Это казалось идеальным решением, но со временем мы обнаружили неочевидную вещь. Часть текста просто пропадала, если фрагмент переходил на следующую страницу и был небольшим.

Терять структуру нельзя. Терять содержимое — тем более. Как быть?

Пришлось писать кастомный парсер-гибрид:

➖ Взяли LLMSherpa как источник структурного скелета.
➖ Подключили сырой экстрактор (pdfplumber/textract/python-docx) для полного покрытия текста.
➖ Написали алгоритм мержа: если расхождение по длине выводов превышает порог (например, >= 30 символов), скрипт построчно сравнивает результаты двух библиотек, находит совпадения, а пропуски заполняет текстом из сырого источника, строго сохраняя порядок строк.

В результате у нас получились чанки с идеальной структурой и ~100% покрытием текста. Мы перестали терять контекст на стыках страниц, сохранив при этом представление о форматировании документа.

Какие выводы из этого можно сделать:
🔶 Ни одна библиотека не универсальна. Структурный парсер вместе с сырым экстрактором оказались надёжнее, чем по отдельности.
🔶 Нужна валидация на стыке компонентов. Сравнение длины, хэши или посимвольный чек экономят часы дебага в проде.
🔶 Кастомный мерж-алгоритм иногда проще и быстрее, чем ожидание обновления библиотеки. Не бойтесь строить обвязку самостоятельно!

А вы сталкивались с тем, что готовые инструменты теряли часть данных? Делитесь кейсами в комментариях ⬇️

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • 🔥 4
  • ❤ 2
Post #3340 812
Симулейтив 💻💻💻💻💻 Data Science, ML и глубокое обучение: в чём разница и когда что применять? Сегодня вместе с Марией Жаровой, ML-инженером команды рекомендаций в Wildberries, разберёмся, чем Data Science отличается от Machine и Deep Learning — через сравнение на реальной…
⚡️ Разбираемся в аббревиатурах DS, ML, DL уже сегодня!

Присоединяйтесь в 19:00 по МСК к вебинару — Мария Жарова, ML-инженер команды рекомендаций в Wildberries, объяснит, чем отличаются Data Science, Machine Learning и Deep Learning и покажет, как выбор метода влияет на результат.

На примере датасета вы увидите, как одну и ту же задачу решают классический ML-алгоритм и нейросеть — и сами сделаете вывод, когда что работает лучше.

🛎️ Эфир начнется тут

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
  • ❤ 7
  • 🔥 2
Post #3339 710

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 5
  • 👍 3
  • 🔥 3
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →