Почему у статистики не лучшие времена
Мое наблюдение: машинное обучение и нейронные сети стремительно развиваются, а статистика как будто движется по спирали и падает в состояние хаоса 📉🔥. Конечно, известные теоретические результаты не потеряли актуальности. Однако с точки зрения применения все очень и очень запутано.
Во-первых, мы перешли в эпоху больших данных. Во-вторых, сильно расширилась область применения статистики.
В старых областях, например в медицине и биологии 💊, есть устоявшиеся дизайны экспериментов и наборы методов. У научных журналов из этих областей есть гайдлайны по статистическому анализу (пример из Clinical Neurophysiology, в котором я публиковался, когда занимался ML в Neuroscience).
В случае бизнеса все не так. На мой взгляд стабилизировался только подход к проведению базовых интерфейсных АВ-тестов в интернет компаниях с достаточно большим количеством трафика. Дальше начинаются сложности 🛒. Методы повышения чувствительности тестов и различные дизайны описываются в научных статьях и обсуждаются на конференциях. Тут каждая компания ведет свою разработку, единственного правильного решения нет. Кстати, Антон недавно рассказывал про нашу систему сплит-тестов на Датафесте. Очень горжусь, что мы ее разработали 💪, рекомендую посмотреть, если вам интересна область экспериментов.
В связи с появлением новых методов возникает другая проблема статистики - отсутствие объективного контроля. Нельзя явно проверить ошибся ли статистический тест или нет. Поэтому статистические методы нужно муторно валидировать на тестовых датасетах, а это тоже сложный процесс.
В итоге аналитики и ds-ы мечутся между большим наборов методов 🥳 которым не понятно, можно ли доверять?
Поэтому я думаю, что статистика находится не в лучшей форме 😳. Она ждет появления новых стандартов и стабилизации.
Что думаете?
#tech
Post #202
1.32K
- 🤔 6
- 👍 3
- 🥰 2
- ❤ 1