#статистика #методы
Мы заметили, что стоит нам написать пост о каком-то известном эксперименте, как нам в чат тут же пишут, что его «опровергли» или он «не подтвердился». Действительно, многие закономерности, обнаруженные в одних исследованиях, не обнаруживаются другими. Значит ли это, что ученные — просто жулики, а результаты их исследований можно выбросить на помойку? Чтобы разобраться, почему так случается, мы уже начали разговор о статистической мощности исследований и статистической значимости результатов.
Сначала мы бросали кубики, чтобы проверить, что чаще всего на двух кубиках в сумме выпадает семерка. Мы выяснили, что эту закономерность несложно обнаружить, если бросить кубики раз 50. А вот если бросить их всего раз 5, то есть шанс обнаружить, что чаще выпадает какое-то другое число, и сделать неверный вывод. Таким образом, мы выяснили, что размер имеет значение. Размер выборки в исследовании, конечно.
Во втором примере мы пытались выяснить, различаются ли значимо зарплаты у мужчин и женщин. И в социальной, и в экспериментальной психологии значимость различий между группами — это один из самых частых вопросов, на который пытаются найти ответ исследователи. И тут мы выяснили, что важна дисперсия. Дисперсия — это разброс значений в каждой группе и в выборке в целом, их отличие от среднего (по-английски variance, что намного понятнее). Если разброс значений большой — например, кто-то и среди мужчин, и среди женщин получает по 25 тысяч, а кто-то 250 — различие между группами скорее всего окажется незначимым. А вот если в каждой группе значения близки друг другу (т.е. дисперсия данных внутри группы небольшая), а значения между группами сильно различаются — например, все женщины в нашей выборке получают около 100 тысяч, а все мужчины около 50-ти — то такое различие будет статистически значимо.
А теперь внимание. Чем меньше разброс значений в каждой группе, тем меньше нам нужно данных, чтобы обнаружить значимое различие между ними. Взяли пять женщин с зарплатой в 100 тысяч, нашли пять мужчин с зарплатой в 50 — и значимая взаимосвязь у нас в кармане! Но выбрали случайно тысячу женщин и также случайно тысячу мужчин — и уже не факт, что значимое различие мы найдем. Что же это означает для научных исследований? Ведь должны же мы разобраться, можно им доверять или нет!
Отвечай «да» или «нет»: гипотеза в научных исследованиях
Тут пришло время признаться, что научные исследования обычно немного сложнее наших примеров. В примере мы задумались о разнице в зарплатах и сразу же пошли опрашивать знакомых и искать статистику по средним зарплатам в интернете, т.е. собирать данные. Но даже если мы их соберем и без каких-либо ошибок проанализируем с помощью самого крутого статистического пакета — такое исследование ни один приличный журнал не опубликует. Почему?
Во-первых, научное исследование должно учитывать установленные ранее взаимосвязи. Первый раздел любой научной статьи — это обзор и анализ предыдущих исследований на интересующую тему. Поэтому, заинтересовавшись какой-то темой, первым делом мы должны
Но недостаточно сформулировать гипотезу. Не все гипотезы – как и йогурты – одинаково полезны. Для того, чтобы стать основой научного исследования, гипотеза должна быть фальсифицируема, т.е. опровержима. Другими словами, гипотеза должна быть сформулирована таким образом, чтобы этот самый вывод – "верно" или "не верно" - можно было сделать на основе анализа эмпирических данных. Вернемся к четырём гипотезам - какие из них фальсифицируемы (могут быть проверены на эмпирических данных), а какая - нет?