Утреннее напоминание: через 11 дней лето 😊
А пока дайджест.
В блоге Towards Data Science (VPN) наткнулся на исчерпывающий гайд, как провести исследовательский анализ данных (EDA) для прогнозирования временных рядов. Статья приводит шесть этапов анализа: применение описательной статистики, построение временного и сезонного графиков, бокс-плот, декомпозиция временного ряда и анализ задержки. Автор разбирает каждый из этапов на примере данных о почасовом энергопотреблении, а также приводит питоновский скрипт и получившиеся графики. Статью можно использовать как комплексный шаблон для работы.
Следующая статья на Medium (VPN) обозревает важные статистические тесты и их применение: t-критерий Стьюдента, хи-квадрат, дисперсионный анализ (ANOVA), корреляция Пирсона и тест Манна-Уитни. Автор объясняет каждый статистический тест и показывает, как его рассчитать и реализовать на Python. Он также предлагает идеи пет-проектов, в которых вы сможете отработать знания на практике.
Когда мы анализируем два альтернативных варианта, то прибегаем к А/B тестированию. А если выборок больше, то мы сталкиваемся со множественным тестированием. Продуктовый аналитик из Тинькофф сравнила два метода множественного тестирования: тест, основанный на попарных сравнениях и тест, основанный на предельном распределении. Последний метод выигрывает. Он позволяет ошибаться ровно с той вероятностью, которую мы закладываем. При этом количество выборок не влияет на продолжительность теста. Метод пригодиться, например, когда требуется выбрать из пяти баннеров в приложении лучший по конверсии продаж. Автор прикрепила Python-библиотеку с функциями для тестирования по описанному алгоритму.
#дайджест
Post #169
2.47K

- ❤ 16
- 🔥 7