Статистической гипотезой называется предположение о каком-либо свойстве (величине параметра, форме распределения) генеральной совокупности, которое можно проверить, опираясь на данные выборки. Гипотезы о параметрах генеральной совокупности называются параметрическими, о распределениях – непараметрическими.
Нулевая и альтернативная гипотезы
- Нулевая гипотеза (H₀): утверждает отсутствие изменений или различий между группами. Это можно выразить как H₀: μ1 = μ2.
- Альтернативная гипотеза (H₁): предполагает наличие изменений или различий. Соответственно, это выражается как H₁: μ1 ≠ μ2. Нулевая и альтернативная гипотезы являются взаимоисключающими.
Тестирование гипотезы
Тестирование гипотезы - процедура, в которой мы решаем, принять гипотезу или отвергнуть. Это происходит с помощью статистических критериев.
Нулевая гипотеза считается верной до тех пор, пока доказательства не укажут на обратное. Во время анализа возникает риск совершения двух типов ошибок: ложноположительных и ложноотрицательных результатов (ошибки I и II типа).
В классическом подходе к проверке гипотез единственным критерием является сравнение p-значения и α-значения:
если p < α → отвергаем H₀, иначе - не отвергаем
Но этого часто недостаточно для надёжных выводов, особенно при сложных зависимостях и параллельном тестировании нескольких гипотез. Вот какие дополнительные критерии можно применять для увеличения надёжности выводов при проверке гипотез:
-
Коррекция на множественные сравнения
При тестировании сразу нескольких гипотез растёт суммарная вероятность ложноположительного результата для одной или нескольких из них (семейная ошибка, FWER). Чтобы этого избежать, вместо “p < α” на каждом шаге используют методы контроля семейной ошибки (FWER) и ожидаемую долю ложных обнаружений (FDR). -
Требование минимальной практической значимости (effect size)
Даже если p-значение статистически значимо (скажем, p = 0.03 при α = 0.05), результат воздействия (разница средних, коэффициент корреляции и т. п.) может быть настолько мал, что не имеет прикладного смысла. Жёсткий критерий может предусматривать, что результат воздействия должен превышать заранее оговорённый порог (например, d Коэна (Cohen’s d) ≥ 0.5 для умеренной значимости). -
Ограничения по ширине доверительного интервала
Вместо одного p-значения требуют, чтобы доверительный интервал для параметра был не только не пересекал “нулевое” значение, но и был достаточно узким - так, чтобы оценка результата воздействия была достаточно точной. Например:“95%-доверительный интервал разницы средних лежит в пределах [0.8; 2.1]“
Здесь важно, чтобы интервал не был слишком широк, иначе результат будет мало применим для практических выводов. -
Байесовские критерии
Вместо или наряду с p-значением используют, например, фактор Байеса (BF): если BF > 10, доказательства в пользу альтернативной гипотезы считаются “сильными”. Это позволяет прямо сравнивать правдоподобие H₀ и H₁, а не просто контролировать частоту ошибок. -
Предварительная регистрация дизайна (pre-registration)
Чёткое описание гипотез, критериев включения/исключения данных и плана анализа до начала эксперимента исключает “постфактумную подстройку” анализа под желаемый результат. Это дисциплинирует исследователя и уменьшает степень свободы в принятии решений, влияющих на p-значения. -
Адаптивные и гибридные дизайны
При промежуточных анализах могут корректировать план исследования (например, увеличивать объём выборки), но делают это по заранее оговорённому протоколу с учётом α-спендинга, чтобы не нарушить общий уровень ошибок.