Про продуктовую аналитику в IT, мысли, методы анализа и алгоритмы. Всё, что ты хотел знать, но стеснялся спросить.
ЛС тут: @de_kn
Post #53
541
Я @datadeepdive
Showing posts older than #54 · Back to latest

Нулевая гипотеза Т-теста предполагает, что средние значения переменной в выборках равны. Отклонение гипотезы (p-value < 0.05) это наша желаемая цель.
Нулевые гипотезы всех критериев похожи, они предполагают, что дисперсии в выборках равны. Т.е. нам эту гипотезу отклонять не хочется (цель p-value > 0.05).
library(car) # библиотека с тестом Левена
bartlett.test(metric ~ var, df) # тест Бартлетта
leveneTest(metric ~ var, df) # тест Левена
fligner.test(metric ~ var, df) # тест Флигнера-Килина
from scipy.stats import bartlett, fligner, levene
# тест Бартлетта
bartlett_result = bartlett(df[df['var'] == 'A']['metric'], df[df['var'] == 'B']['metric']).pvalue
# тест Левена
levene_result = levene(df[df['var'] == 'A']['metric'], df[df['var'] == 'B']['metric']).pvalue
# тест Флигнера-Килина
fligner_result = fligner(df[df['var'] == 'A']['metric'], df[df['var'] == 'B']['metric']).pvalue

power.prop.test(), в Python statsmodels.NormalIndPower(). В конце поста ссылка на пример.
Кстати, генерирование гипотез по итогам рисёрча отличает хорошего аналитика от не. Новички, как правило, вообще не заморачиваются с выводами. Итак таблицы есть — заказчик разберётся (спойлер — не разберётся).
ДТ все заполняют по разному, кто как. Структура, которую я покажу здесь, моя авторская, я начинал её делать года 4 назад, она постепенно эволюционировала, и вот финальная версия на сегодня. Моим командам нравится, пользуйтесь и в своих 🙂

В этой серии постов мы опустим нюансы разработки платформы для тестирований, т.к. обычно этим занимаются дата-инженеры или команда разработки продукта. Обсудим только нашу часть.
8 из 10 АБ-тестов не показывают статистической значимости.

Когда мера становится целью, она перестаёт быть хорошей мерой.
Взаимосвязи, наблюдаемые в исторических данных, не могут считаться структурными или причинными.



— Эй, GPT, для t-критерия нужно равномерное распределение?
— Да, всё верно, нужно.
— Но ведь не нужно, это миф из-за косяка перевода источника.
— Да, вы правы, оно не нужно.
— Но ведь нужно равномерное распределение выборочных средних!
— Да, простите за ошибку, оно всё же нужно.


df_1 <- df %>% filter(col1 %in% df_2$col1) 
