В статистике в рамках исследования все начинается с нулевой гипотезы как о предположении о выборке (ее параметрах, таких как среднее или самом распределении). Но предположения можно сделать ровно 2, случай two-sample:
1. Параметр выборки А (допустим среднее) равен параметру выборки B
2. Параметр выборки А НЕ равен параметру выборки B
Для нулевой гипотезы берут именно 1-ое, а 2-ое оставляют для альтернативной (гипотезы). Есть ли в этом что-то особенное? Ну, какая разница же, вроде, да? На самом деле особенное есть, то есть это неслучайно. И менять местами 1-ое со 2-ым было бы ошибкой.
Есть спорный, но в рамках статистики крайне подходящий принцип Карла Поппера: "Только та гипотеза/теория научна, которую возможно опровернуть", точнее - та, над которой можно провести эксперимент и далее по его результатам возможно и опровергнуть. Красиво это называется как "фальсифицируемость".
Важно понимать, что под научностью имеют в виду вообще возможность исследовать. Поэтому теорию, которую нельзя проверить (во всяком случае сейчас, при нынешнем уровне развития), называют ненаучной, но НЕ имеют в виду, что она - лженаучна. Ненаучная и лженаучная - это разное! Лженаучная теория противоречит фактам, ненаучная просто на данный момент непроверяема в том смысле, что ее не сделать предметом исследования. Но и научная и ненаучная имеют ряд фактический посылок. Тут, думаю, разобрались.
Так вот. Статистика вывела ряд замечательных распределений: z-нормальное распределение средних, t-распределение и еще множественный ряд прочих, которые лежат в рамках других тестов. Все эти распределения об одном и том же по сути: распределение статистики теста (z-статистики, t-статистики и пр.), когда РАЗНИЦЫ нет. Разницы средних, разницы в распределении в той или иной форме.
Отсюда статистика берет только 1-ое предположение, потому что, используя эти распределения в зависимости от тестируемого предмета (параметр или распределение), может проверить и потенциально опровергнуть. 2-ое предположение она проверить не может, так как у нее нет для этого соответствующего инструментария: нет распределений для отличий.
Можно ли такие альтернативные распределения построить? Думаю, да, в теории (я просто не пробовал), в эпоху-то компуктеров должно быть возможно. Например, посмотреть, какое будет t-распределение, симулируя выборки из разных популяций. Проблема в том, что они не будут являться универсальными как классические распределения стат. тестов. А потому, чтобы убедиться в верности ваших выводов как исследователя, любому ученому нужно было сначала разобраться в этой альтернативщине.
То есть:
1. Параметр выборки А (допустим среднее) равен параметру выборки B - НАУЧНО
2. Параметр выборки А НЕ равен параметру выборки B - НЕНАУЧНО (непроверяемое, нет распределений, куда приземлять значения статистик)
Поэтому, когда видите, что в дизайне теста кто-то выдвинул нулевую гипотезу о РАЗЛИЧИИ, знайте - это ошибка. Но не судите строго, понять, почему это ошибка сложно, думаю (это крайне смелое предположение), даже ряд профессоров не отдали бы себе отчета, почему это так. Хотя казалось бы, да?
P.S. Конечно, не все распределения, которые говорят об отсутствии различий, универсальны. Тоже t-распределение в плане своей формы чувствительно к размеру выборок: t-таблица довольно красочно об этом говорит. И все же оперировать ею легче, чем строить еще 100500 таких таблиц под каждый случай различия
Post #9
443
- 👍 1