TGViewer
Статистика и R в науке и аналитике Статистика и R в науке и аналитике @stats_for_science · 5.56K subscribers
Post #234 3.8K
Топ каверзных вопросов по статистике с собеседований. Часть 1

Сегодня разберем самые интересные, на мой взгляд, вопросы и типичные ловушки. В изначальной версии получилось довольно много, поэтому мне посоветовали разделить пост на два.
Правильные ответы спрятала под спойлером, попробуйте сначала ответить сами.
Здесь не будет вопросов "что такое p-value" или "что такое доверительный интервал". Хотя они могут встретиться на HR-скринингах, на техническом интервью обычно вопросы поинтереснее. Отмечайте, сколько из этих вопросов вам уже попадалось 👇

Поехали!

🟡От чего зависит размер выборки? Иногда могут спросить формулу MDE, что в числителе, а что в знаменателе.

Можно назвать сразу все 4 параметра: MDE (минимально детектируемый эффект), дисперсия, уровень значимости и мощность. Обычно уровень значимости и мощность фиксированы, размер выборки в основном зависит от дисперсии и MDE. Для непрерывных метрик, таких как ARPPU, характерна высокая дисперсия из-за длинного хвоста, что увеличивает время проведения тестов. Для непрерывных метрик дисперсия и среднее это независимые параметры.

Бонусный вопрос: как считается дисперсия для конверсионных метрик?
Для биномиального распределения дисперсия напрямую зависит от значения среднего по формуле `p(1−p)`.

🟡Что такое ошибка первого и второго рода и какая из них хуже на практике? Как связаны ошибка первого рода и уровень значимости?

Ошибка первого рода — ложноположительный результат (нашли эффект, которого нет), ошибка второго рода — ложноотрицательный результат, не обнаружили реальный эффект (тут моя любимая картинка-мнемоническое правило).

Какая ошибка хуже зависит от конкретного кейса, нельзя дать универсальный ответ. В медицинской диагностике ложноположительный результат почти всегда более безопасен, чем ложноотрицательный, лучше перепровериться, чем пропустить болезнь. В A/B тестировании по-разному, не заметить положительный эффект фичи может быть хуже чем раскатить нейтральную, а может и наоборот, нейтральные фичи усложняют поддержку, кодовую базу, а влияние на метрики не имеют.

Уровень значимости - верхняя граница вероятности ошибки первого рода. Подробнее про это и связь их между собой
здесь.

🟡Приготовили дизайн A/B, но тест идет долго, например больше месяца, продакт просит ускорить его. Что делать?

Есть ряд способов ускорения A/B, например через снижение дисперсии: CUPED и стратификация. Кроме этого, можно использовать последовательное тестирование, но с этим есть нюансы, планирую разобрать это в одном из следующих постов. Еще один способ - рассмотреть вариант с прокси-метриками.
В крайнем случае можно увеличить MDE, сократив выборку и ускорив тест, но продакта нужно предупредить, что мелкие изменения теперь не засечем. На тему ускорения A/B можно делать не один пост, здесь будет только нужная информация для старта.


Вторая часть с вопросами выйдет завтра, накидайте лайков, если формат понравился ❤️ Пишите в комментарии вопросы, с которыми сталкивались!

#analytics #собес_PA
  • ❤ 53
  • 🔥 19
  • 👍 15
  • 🎉 5
  • 👎 2
More from @stats_for_science
  1. Sep 20, 2026Поведенческая секция: «Расскажите о случае, когда вы не согласились с продактом» Продолжае…
  2. Sep 12, 2026Узнали, согласны? Собрала немного обычных моментов из жизни биолога и A/B тестера, но все…
  3. Sep 1, 2026Коллеги-биостатистики опубликовали статью "Мифологизация статистики в биомедицинских иссле…
  4. Aug 30, 2026С днем рождения меня! 🎉 У меня из недавнего интересного - получила приз лучший сотрудник…
  5. Aug 28, 2026Последовательное тестирование: почему это не волшебная таблетка Сегодня обсудим матчасть м…
  6. Aug 23, 2026Когда мера становится целью: закон Гудхарта В прошлый раз разбирали как прокси-метрики мог…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →