И снова на диване.
Давай разберем задачи из поста выше. ⤴️
🔜 Задача 1. Одновременно бросают 3 кубика с шестью гранями. Какова вероятность, что хотя бы хотя бы на двух из трёх кубиков выпадет одно и то же число?
Сначала найдем общее кол-во исходов. Так как у нас 3 кубика с 6 гранями, то всего исходов будет 6 * 6 * 6 = 216. Проще всего найти вероятность противоположного события, а затем вычесть её из 1. В данном случае противоположное событие - это все три числа разные.
Посчитаем число исходов, когда все 3 кубика показывают разные числа, учитывая, что у нас 6 вариантов для первого кубика, затем 5 вариантов для второго, так как он не должен совпасть с первым кубиком, и 4 варианта для третьего кубика, так как он не должен совпасть с первыми двумя.
Считаем 6 * 5 * 4 = 120 исходов. Вычитаем из 1 и получаем искомую вероятность:
1 - 120/216 = 96/216 = 4/9 или примерно 0,44.
Здесь можно посчитать и по-другому - просто подобрать все подходящие варианты, не вычитая из 1. Нам подходят все варианты, где числа на 3-х кубиках одинаковые - это 6 исходов.
Плюс нам подходят те, где числа одинаковые на 2-х кубиках. Чтобы не считать здесь перебором, давай порассуждаем. Сначала выбираем число, которое будет повторяться, например, 1, а на 3-ем кубике учтем любое другое. Затем учтем перестановки.
Вариантов пар, которые совпадут на двух кубиках всего 6. На третьем кубике может выпасть 5 возможных чисел, чтобы они не совпали с парой кубиков. И еще нам нужно учесть все перестановки - то есть когда пара выпадет не на первых двух кубиках, а еще на 2-ом и 3-ем или на 1-ом и 3-ем. Возможных перестановок 3. Посчитаем:
6 * 5 * 3 = 90 исходов
Сложим исходы 6 + 90 и получим 96/216 или 4/9.
🔜 Задача 2. В A/B-тесте продуктовая команда смотрит 4 независимые метрики. Для каждой метрики изменение считают стат. значимым, если p-value < 0,05. Какова вероятность получить стат. значимое изменение хотя бы по одной метрике, если на самом деле эффекта нет ни по одной метрике?
Это классическая задача на множественное сравнение в АВ-тестах и критически важная, чтобы не допустить ложных выводов по итогам АВ. Здесь нам тоже проще посчитать противоположное событие и вычесть его из 1.
Нам нужно посчитать вероятность ошибки I рода хотя бы по одной метрике при условии, что все нулевые гипотезы истинны. Это то же самое, что из 1 вычесть вероятность, что по всем 4 метрикам мы не получим ложноположительного результата.
Давай по шагам. Для одной метрики вероятность не сделать ложноположительный вывод равна:
1 - 0,05 = 0,95
Метрики независимы, поэтому чтобы посчитать, что все 4 не покажут ложноположительный результат, нам нужно 0,95 перемножить 4 раза:
0,95^4 ≈ 0,8145
Теперь вычтем из единицы и получим вероятность хотя бы одного ложноположительного результата:
1 - 0,8145 = 0,1855
Итак, вероятность получить хотя бы одно значимое изменение по 4-м метрикам при отсутствии реального эффекта равна почти 20%. Помни об этом в АВ-тестах! На примере задачи отчетливо видно, что эта вероятность повышается при росте числа метрик.
🔜 Задача 3. В городе 5% жителей болеют редким вирусом. Врачи разработали тест, который даёт положительный результат с вероятностью 90% (чувствительность = 90%), если человек болен. Если человек здоров, тест ошибочно даёт положительный результат с вероятностью 5% (специфичность = 95%). Алекс сдал тест, и результат оказался положительным. Какова вероятность, что Алекс действительно болен?
Здесь классическая задача на теорему Байеса. Давай распишем условие задачи:
P(болен) = 0.05
P(здоров) = 0.95
P(положит. тест∣болен) = 0.9 (чувствительность теста)
P(положит. тест∣здоров) = 0.05 (ложноположительный результат)
Нужно найти P(болен∣положит. тест)
Посчитаем вероятнсость, что Алекс болен и получил положительный тест:
0,9 * 0,05 = 0.045
Теперь считаем полную вероятность положительного теста:
P(+) = P(+∣болен) * P(болен)+ P(+∣здоров) * P(здоров) = 0.9 * 0.05 + 0.05 * 0.95 = 0.045 + 0.0475 = 0.0925
Теперь разделим одно на другое:
0,045/0,0925 ≈ 0.4865
То есть вероятность около 50%. Не очень надежный тест)