TGViewer
Channel Public Channel
Убежище аналитика

Убежище аналитика

@shelter_analytics

О математике, бизнесе и их симбиозе

Автор: @VSheremetev
Subscribers
1.14K
Photos
39
Videos
0
Links
35
Recent Posts 14 shown
Post #80 588

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 9
  • 🔥 5
  • 💯 1
Post #78 722

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • ❤ 14
  • 🔥 9
Post #77 1.08K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🔥 29
Post #76 1.24K

This post (sticker, poll or similar) has no web preview. Open in Telegram

  • 🔥 38
  • ❤ 8
  • 👨‍💻 5
Post #75 1.53K
🚨🚨🚨AI в Causal Inference - это хайп или полезный инструмент?

Всем привет!🤟

Сегодня наткнулся на новую статью Netflix про использование AI-агентов для Causal Inference.

В статье разбирается реальный кейс оценки влияния нового типа контента на удержание пользователей.

Сначала задачу просто отдают в клод, где наивная модель строит регрессию, получает красивую оценку эффекта и выдаёт результат, который оказывается завышенным на 75%.

Почему?

Потому что модель не учла проблему отбора: первые пользователи нового продукта отличаются от остальных пользователей. Они активнее, вовлечённее и чаще возвращаются в сервис независимо от самого продукта.

Netflix видит проблему не в самой модели. Проблема в том, что полученный результат никто не попытался критически проверить.

Надеюсь, что все будут согласны с тезисом:
Хорошее исследование — это не исследование, которое быстро выдаёт красивый результат, а исследование, которое прошло через несколько раундов критики и диагностических проверок.

Поэтому в их агентской архитектуре разделение исследовательских обязанностей сделано явно:

Есть Principal — человек, который формулирует исследовательский вопрос, описывает контекст и основные риски смещения.

Есть Actor — он читает написанный человеком план анализа и предлагает спецификацию: воздействие, результат, ковариаты и оцениваемые величины.
Детерминированный ноутбук выполняет эту спецификацию, используя doubly robust learner из EconML, оценивание через AIPW, проверки баланса ковариат и placebo-тесты. При этом LLM вообще не получает прямого доступа к данным.

Есть Critic — второй агент, анализирует статистические результаты, выявляет проваленные диагностики и предлагает улучшения.
Затем Actor обновляет спецификацию, после чего цикл повторяется.

Т.е. мы видим как генерация идей, стратегий передается на агентов, когда как вычисления проводятся в строгом детерминированном контуре (провалидированным человеком кодом).

Для оценки качества они используют данные соревнования ACIC 2016. Для каждого из 77 процессов генерации данных (DGP) случайным образом выбираются три датасета, в результате чего получается 231 задача для оценки качества алгоритма. Полученные оценки сравниваются с 44 методами-участниками конкурса ACIC. Они получают, что их методология конкурентоспособна по сравнению с этими эталонными показателями: она достигает достаточно низкого значения RMSE и хорошо откалиброванных доверительных интервалов, которые охватывают истину примерно в 95% случаев генерации данных.

Понятно, что речь идёт о синтетических данных и до полноценного использования таких систем в продакшене ещё далеко.

Тем не менее сама идея выглядит очень здраво: доверять агенту генерацию гипотез, спецификаций и интерпретацию результатов, а вычисления и статистические проверки оставлять детерминированному коду.

Для задач causal inference такой подход выглядит гораздо реалистичнее, чем попытка полностью заменить аналитика одной LLM.

Рекомендую ознакомиться с их постом.

P.s. также они публикуют в открытом доступе автономную версию oci-agentа.
  • 🔥 18
  • 🗿 5
  • ❤ 3
  • 👍 1
Post #74
Убежище аналитика pinned «Привет! 🤟 Добро пожаловать в «Убежище аналитика». ❓Кто автор? Меня зовут Влад. Я прошёл путь от деревни в Тульской губернии до стен факультета математики Московского университета (МГУ), получив там степень специалиста. Параллельно я закончил школу аналитики…»
Post #73 1.45K
Привет! 🤟

Добро пожаловать в «Убежище аналитика».

❓Кто автор?

Меня зовут Влад.

Я прошёл путь от деревни в Тульской губернии до стен факультета математики Московского университета (МГУ), получив там степень специалиста.

Параллельно я закончил школу аналитики Авито:
https://start.avito.ru/academy

Карьеру начинал в X5 Tech, позже работал продуктовым аналитиком в Авито, а затем вернулся в X5 Tech в команду персонализированного промо.

Во время работы в Авито (вертикаль Работа, команда ASD B2B) помогал с курсами по статистике и экспериментам, участвовал в шестом наборе школы аналитики:
— составлял задачи
— проверял решения
— проводил собеседования финалистов

Подробнее про мой опыт:
из Авито обратно в X5

❓Зачем этот канал?

Мне хотелось создать место, где сложные темы из аналитики и статистики объясняются не «академически ради академичности», а через практику и реальные продуктовые кейсы.

Здесь вы найдёте:
— разборы статей
— математическую интуицию
— код и симуляции
— объяснение сложных тем «на пальцах»
— кейсы из реальных A/B-тестов

📚 Навигация по постам

📈 Временные ряды

1. Введение
2. STL
3. MSTL

🧪 A/B-тесты и статистика

1. Дельта-метод. Часть 1
2. Дельта-метод. Часть 2
3. t-тест, t1-тест и нормальность
4. Заметки по t1-тесту
5. Размер выборки и MDE
6. Логарифмирование метрик в A/B

🚀 CUPED

1. CUPED под микроскопом. Главы 1–2
2. CUPED под микроскопом. Главы 3–4
3. CUPED под микроскопом. Главы 5–7

🧩 Множественная проверка гипотез

1. Почему возникает проблема множественной проверки
2. Decision rules в A/B. Как делать поправки в проде.
3. Decision rules. Продолжение

🌐 Сетевые эффекты и кластерные эксперименты

1. Региональные / кластерные A/B-тесты
2. Аналитику нужно знать нейросети?

🧠 ML, метрики и математика

1. Bias-variance decomposition и MSE
2. Ошибка базовой ставки
3. Закон Бенфорда
4. Ошибка выборки
5. MAPE и SMAPE

💼 Кейсы и продуктовая аналитика

1. Оценка эффективности менеджеров в B2B
2. Кейс про отток клиентов
3. Кейс про CRM-рассылку тарифов
4. Кейс про LLM-генерацию резюме
5. Промо для pro-клиентов Авито и как выбирал группы клиентов для промо

🎓 Собеседования и обучение

1. Как аналитику проходить собеседования
2. Где изучать новое в A/B и статистике

🧬 Causal inference

1. Главное предположение A/B-тестов
2. AI в Causal Inference

Для продактов и тех, кто только начинает изучать:

3. Causal Inference на пальцах. Часть 1
4. Causal Inference на пальцах. Часть 2
5. Causal Inference на пальцах. Часть 3
6. Causal Inference на пальцах. Часть 4

🔬 Статистика вне IT
1. Медицина и аналитика

(меню будет постепенно пополняться по мере выхода новых постов)

❓Чем ещё могу помочь?

Если хотите:
— подтянуть статистику и A/B-тесты
— подготовиться к аналитическим собеседованиям
— разобрать резюме
— потренировать кейс-интервью

то подробнее можно посмотреть здесь:
https://sheremetevmentor.ru/

P.S. В канале работает бот для удаления спама и ботов, поэтому иногда комментарии могут случайно удаляться. Если такое произошло — заранее извиняюсь, просто напишите мне в личные сообщения.
  • 🔥 45
  • ❤ 10
  • ⚡ 2
Post #72 1.1K
Всем привет! 🤟

Мы продолжаем разбирать, как множественное тестирование связано с реальными правилами принятия решений в A/B-тестах 📊

Ранее мы уже обсуждали:
— почему возникают множественные проверки гипотез;
— что такое UI/IU testing;
— как success- и guardrail-метрики влияют на корректировки α и мощности;
— и почему классические поправки «в лоб» часто плохо отражают реальные продуктовые процессы.

Но всё это всё ещё было довольно упрощённой моделью.

В реальных A/B-тестах компании почти никогда не принимают решение только по одной success-метрике.

Обычно одновременно требуется:
✅ чтобы хотя бы одна ключевая метрика выросла;
❌ чтобы не появилось статистически значимого ухудшения;
🛡 чтобы сам эксперимент был проведён корректно.

Deterioration- и quality-тесты начинают влиять не только на контроль ошибки I рода, но и напрямую на требуемую мощность эксперимента.

В новом посте разбираю:
• как формализовать production-grade decision rules;
• как корректно распределять α между success-, deterioration- и quality-тестами;
• откуда возникает поправка для β;

Сгенерировал короткие выводы поста в виде картинки - можно забирать и использовать (тестировать).

👉 https://telegra.ph/Mnozhestvennaya-proverka-gipotez-v-AB-Glava-3-CHast-2-05-06

Всем хороших выходных!
  • 🔥 12
  • ⚡ 5
  • ❤ 4
Post #69 1.27K
Всем привет! 👋

Давайте представим, что мы работаем в приложении крупного ретейлера 🛒 Перед нашей командой стоит задача упростить процесс оформления заказа.

Прибегает продакт и предлагает, как ему кажется, крутую идею: сократить процесс оформления заказа с пяти шагов до трёх ⚡️ Интуитивно кажется, что это должно повысить конверсию в покупку — пользователям станет проще и быстрее оформлять заказ.

Но как понять, действительно ли изменение улучшило продукт? 🤔

Достаточно ли посмотреть только на рост покупок? А что если одновременно выросло количество возвратов? 📦 Или просел средний чек? 💸 Или пользователи начали чаще писать в поддержку? 😅

Именно здесь начинается настоящая теория экспериментов 📊

— какие метрики вообще нужны в АБ-тесте;
— чем отличаются success-, guardrail-, deterioration- и quality-метрики, исследовательские метрики;
— почему возникают проблемы множественного тестирования;
— и почему классические поправки «в лоб» часто не соответствуют реальным правилам принятия решений в продукте.

В новом посте разбираю:
• как компании с сильной аналитической культурой на практике строят правила принятия решений в экспериментах;
• что такое UI/IU testing;
• почему для разных типов метрик нужны разные корректировки;
• и как всё это связано с FWER, мощностью и дизайном эксперимента 🧠

👉 https://telegra.ph/Mnozhestvennaya-proverka-gipotez-v-AB-Glava-3-05-01
  • 🔥 18
  • ❤ 4
  • 🤯 2
Post #68 1.27K
Всем привет! 🤟🔥

Вы запускаете A/B-тест, смотрите на несколько метрик — и одна из них «прокрашивается». 📊✨
Звучит как успех. Но с высокой вероятностью — это просто случайность. 🎲

Оказывается, если смотреть на несколько метрик, сегментов или вариантов, вероятность «найти эффект» быстро становится близкой к 100% — даже если его на самом деле нет. 📈😈

В этом посте разбираю, как возникает эта ошибка, показываю её на простых вероятностных примерах и ввожу ключевые подходы к контролю: FWER, FDR и классические поправки. 🧠📐

В следующем посте перейдём к самому важному — как формализовать правило принятия решения в АБ и уже из него корректно выстраивать логику множественной проверки. ⚙️
То есть как уйти от «слепого» применения поправок и учитывать финальное правило принятия решения об успешности фичи. 🎯

👉 https://telegra.ph/Mnozhestvennaya-proverka-gipotez-04-25
  • ❤ 18
  • 🔥 4
  • 👍 2
  • 🤯 1
Post #67 1.54K
Всем привет! 🤟

Сегодня быстрый сюжет, в котором мы разберём известный «лайфхак»:

Для средних чеков и метрик с «длинными хвостами» попробуйте логарифмирование данных


Я решил быстро расписать математику такого подхода и показать, что за логарифмированием скрывается несколько предположений и разложений в ряд Тейлора, которые явно влияют на корректность ваших выводов в A/B-тестах и вообще на применимость такого подхода.

Мини-статья по ссылке: https://telegra.ph/Logarifmirovanie-metrik-v-AB-04-05
Telegraph Логарифмирование метрик в АБ. Всем привет! Вы вероятно встречались с таким "лайфхаком":
  • 🔥 19
  • ❤‍🔥 2
  • 🤔 1
  • 🤯 1
Post #66 1.69K
Всем привет!🤟

Сегодня хочется обсудить один небольшой, но очень важный сюжет из планирования A/B-экспериментов. Многие его знают, но на практике о нём могут забывать.

Речь про расчёт размера выборки через всем известную формулу MDE.

Предположим, что:

- дисперсия известна и равна σ² = 1

- α = 0.05

- β = 0.2 (мощность 80%)

- MDE = 0.03

Я спрошу у вас:
Какой размер выборки нужен?🤔

Многие ответят примерно так.

(z_{1−α/2} + z_{1−β})² = (1.96 + 0.84)² = 2.8² = 7.84

Тогда

n = 7.84 · 1 / 0.03² = 8 711

Кажется логично.

Но если вы проведёте симуляции, то увидите неожиданную вещь:
реальная мощность будет не 80%, а около 50.8%.

Почему так происходит?

Потому что в расчёте забыли одну важную деталь.

Эксперимент у нас двухвыборочный, а не одновыборочный.
Следовательно дисперсия оценки эффекта равна

Var(Ȳ_T − Ȳ_C) = σ² / n₁ + σ² / n₂

Отсюда в формуле появляется дополнительный множитель 2 (если группы равные).

Поэтому реальный необходимый размер выборки:

17 422 наблюдения, а не 8 711.

Теперь запишем более общую формулу.

Если предположить, что нет HTE эффектов, то

MDE = (z_{1−α/2} + z_{1−β}) · √(σ²/n₁ + σ²/n₂)

или

MDE = (z_{1−α/2} + z_{1−β}) · σ · √((n₁ + n₂)/(n₁ · n₂))

Пусть общий размер выборки равен n_total,
а r = n₁ / n_total.

Тогда выражение под корнем можно переписать так:

(n₁ + n₂)/(n₁ · n₂) = 1 / (r · (1 − r) · n_total)

И получаем финальную формулу для общего случая (с разным сплитом):

n_total = (z_{1−α/2} + z_{1−β})² · σ² / (MDE² · r · (1 − r))

В нашем примере:

n_total = 7.84 / (0.03² · r · (1 − r))

Если:

r = 0.5 → n_total = 34 844
r = 0.9 → n_total = 96 790



Не допускайте таких искажений! 😉

Всем спасибо за внимание!

Хороших выходных! ☀️

А всех подписчиц моего канала поздравляю с 8 марта! 🌷
Пусть в вашей жизни будет больше радости, тепла и вдохновения — как в работе, так и вне её.
Желаю вам ярких идей, интересных проектов, уверенности в себе и побольше моментов, которые делают каждый день по-настоящему счастливым 💐

С праздником! ✨
  • 🔥 27
  • ❤ 3
Post #59 1.72K
Всем привет! 🤟

Кажется, мы добрались до финальной точки нашего большого путешествия по миру CUPED.

Если честно, я сам не ожидал, что из «простого метода снижения дисперсии» получился такой мощный инструмент😅. А вы?

Итак, в последнем посте:

- Узнаем, как "поженить" CUPED с ratio-метриками
- Узнаем, что CUPED является обобщением стратификации
- Откроем новую особенность - борьба с перекосами при сэмплировании (или пост-нормировка).

Продолжаю традицию короткого саммари поста в картинках — но предупреждаю: внутри поста инсайдов будет заметно больше 😉

🚀: https://telegra.ph/CUPED-pod-mikroskopom-Glavy-5-6-02-21

Буду ждать ваших реакций к посту и впечатлений по трем сюжетам о CUPED👀👀👀
  • 👍 13
  • ❤ 9
  • 🤯 2
Older posts →

About this channel

How can I read @shelter_analytics without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Убежище аналитика: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Убежище аналитика have?
Убежище аналитика (@shelter_analytics) has 1.14K subscribers on Telegram, refreshed roughly every 30 minutes.
Does Убежище аналитика know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →