Активность, кстати, хоть и спонтанная, но круто, что мы ее разберем, потому что буквально на прошлой неделе у нас внутри команды возникла похожая задачка.
Для ГС 6484 (аудитория канала Андрона) размер репрезентативной выборки для определения доли признака (в нашем случае категории читателя) при уровне доверия 95% и погрешности 5% составляет 363 читателя.
НА 22.22 проголосовало - 376 человек, т.е. в заданных параметрах структура голосования статистически значимо отражает структуру всей аудитории подписчиков Андрона.
@Va1errCa абсолютно верно посчитал — для моего канала репрезентативной выборкой можно считать 363 ответа. У нас уже больше 550, так что по логике мы на 100% изучили свою аудиторию.
Выборка нерепрезентативная. Отражает только готовых отвечать на опросы и просто тыкнувших
Далее @alla_chee выдвигает сперва неочевидный, но вполне резонный тезис: а может быть такое распределение работает только для тех, кто тыкает в опрос.
Проголосовала примерно половина из просмотревших. можно ли считать, что вторая половина проголосовала бы так же?
@GenuineSpirit дополняет: а те, кто не тыкнули — они вообще могут быть другими, и мы их никак не изучили.
И это все абсолютно верно! Ведь выборка будет репрезентативной, если ты выбираешь ее случайно из генеральной совокупности. А т.к. мы смотрим на ответы только а) активной аудитории (кто зашел в канал) б) еще более активной аудитории (кто еще и тыкнул на опросник), у нас может быть сильный bias (искажение) в том, как у нас сформировалась эта подвыборка.
Получается, все это зря? Не совсем, есть способ с этим бороться. Нужно выборочно (случайно!) опросить тех, кто не ответил и посмотреть — а там распределение будет такое же? Чисто статистически можно использовать, например, критерий согласия Хи-квадрат Пирсона.
Остается последний вопрос — сколько человек нужно опросить, чтобы все-таки гарантировать, что сдвига нет и результаты действительно статистически значимые. На самом деле не много — для расчета можно воспользоваться коэффициентом Коэна для Хи-квадрат теста. И тогда для довольно достоверной оценки будет достаточно 50-100 рандомных подписчиков опросить. В целом, посильно)
Вторгаться в вашу личку я, пожалуй, не буду, но, надеюсь, этот кейс был вам полезен — такая штука актуальна практически для любых опросов)
🔥 — супер, зашло!)
✍️ — взял на карандашик
😑 — кто такой этот ваш Пирсон?