α-спендинг - способ распределить заранее выбранную вероятность ошибки I рода между несколькими промежуточными и итоговой проверками одной статистической гипотезы. Он применяется в исследованиях, где данные анализируют несколько раз до завершения набора.
Допустим, исследователь планирует набрать 1000 участников и сравнить два варианта методики коррекции речи за счёт гранта. Иногда ждать набора всех 1000 участников слишком долго, или необходимо предоставлять промежуточные результаты грантовому фонду. Поэтому заранее планируют проверки, например после 250, 500, 750 и 1000 участников (интерим-анализы). Проблема возникает из-за того, что одну и ту же гипотезу проверяют несколько раз.
α-спендинг задаёт, какая часть общего может быть использована к каждому моменту анализа, чтобы сохранить общий риск ложноположительного вывода примерно на заранее выбранном значении (например 5% при α = 0.05 соответственно).
Почему повторные проверки увеличивают риск ошибки
При одной проверке с α = 0.05 мы допускаем вероятность ложноположительного вывода в 5%. Если при каждой промежуточной проверке снова снова сравнивать p-значение с , вероятность хотя бы однажды случайно получить «значимый» результат становится выше 5% - то есть суммарная вероятность ложноположительного вывода возрастёт:
Предположим, что одна истинная проверяется пять раз и каждая проверка имеет порог . Если бы проверки были независимы, вероятность хотя бы одного ложноположительного результата составила бы:
Это около 22.6% вместо запланированных 5%.
При промежуточном анализе одних и тех же накапливающихся данных проверки зависимы, поэтому данная формула не даёт точного результата. Однако повторное применение порога 0.05 всё равно повышает общую вероятность ошибки I рода. Проблема возникает даже тогда, когда исследователь не публикует промежуточные результаты. Достаточно остановить исследование при первом подходящем p-значении. Без заранее заданного правила такая остановка может стать вариантом P-хакерства.
Общее правило расходования α
Пусть общий допустимый риск ошибки I рода равен . Вводится правило , где - доля накопленной информации:
Правило должно выполнять условия:
Значение показывает максимальную накопленную вероятность ошибки I рода, которую разрешено использовать к проверке .
Часть, добавленная между двумя проверками, равна:
Суммарно к окончанию исследования расходуется не больше заранее выбранного .
Доля информации
Доля информации показывает, какая часть запланированной точности уже получена к моменту проверки:
где - накопленная информация, а - информация, ожидаемая при завершении исследования.
При одинаковой информативности наблюдений долю информации иногда приближённо рассчитывают через размер выборки:
Такое приближение подходит не всегда. При разном числе событий, неодинаковых дисперсиях, кластерах и пропущенных данных доля информации может заметно отличаться от доли набранных участников.
Границы остановки
На каждой проверке рассчитывают статистику, например , и сравнивают её с заранее заданной границей :
Границы выбираются совместно так, чтобы вероятность хотя бы одного ошибочного отклонения не превышала общего .
Важно: приращение обычно не является готовым порогом для p-значения на проверке . Промежуточные статистики связаны между собой, поэтому номинальные p-границы рассчитывают с учётом всей последовательной схемы.
Распространённые правила α-спендинга
Подход О’Брайена-Флеминга
В начале исследования расходуется очень малая часть . Для ранней остановки требуется крайне убедительное различие. Основная часть допустимой ошибки сохраняется для итогового анализа.
Особенности подхода:
- строгие границы на первых проверках
- близкий к обычному порог на итоговой проверке
- малая вероятность остановки по случайному раннему колебанию
- возможность рано завершить исследование при очень крупном различии
Подход Покока
Допустимая ошибка распределяется между проверками более равномерно. Ранние границы мягче, чем при подходе О’Брайена-Флеминга, но итоговая граница строже обычного порога 0.05.
Особенности подхода:
- большая готовность к ранней остановке
- более строгая итоговая проверка
- близкие номинальные границы на разных этапах
Подход Лана-ДеМетса
Подход Лана-ДеМетса задаёт расходование через непрерывное правило . Точные моменты проверок могут немного отличаться от запланированных. Граница пересчитывается по фактически накопленной доле информации.
Этот подход удобен, когда скорость набора участников или событий заранее известна неточно.
Степенное правило
Простой пример правила расходования:
где определяет момент основного расходования:
- при большая часть сохраняется на поздние проверки
- при накопленное растёт пропорционально доле информации
- при относительно большая часть расходуется рано
Степенное правило удобно для объяснения принципа, но в реальном исследовании границы необходимо рассчитывать совместно для выбранного статистического критерия.
Пример расчёта расходования
Исследователь сравнивает тренировку памяти с контрольным заданием. Основной показатель - число слов из списка, воспроизведённых через 20 минут. Планируется набрать 240 участников и провести проверки после 60, 120, 180 и 240 завершённых наблюдений.
Выбран общий двусторонний и правило:
При одинаковой информативности участников получаются следующие значения:
| Проверка | Накопленное | Новая часть | ||
|---|---|---|---|---|
| 1 | 60 | 0.25 | 0.003125 | 0.003125 |
| 2 | 120 | 0.50 | 0.012500 | 0.009375 |
| 3 | 180 | 0.75 | 0.028125 | 0.015625 |
| 4 | 240 | 1.00 | 0.050000 | 0.021875 |
На ранних проверках расходуется малая часть допустимой ошибки. К завершению исследования накопленное значение достигает 0.05.
Числа в последнем столбце нельзя напрямую использовать как пороги p-значения. Точные границы и соответствующие номинальные p-значения рассчитываются для последовательной схемы с учётом зависимости между проверками.
Досрочная остановка
Исследование может завершаться досрочно по нескольким причинам:
- получены достаточно убедительные данные в пользу
- дальнейший набор с малой вероятностью изменит вывод
- обнаружена проблема безопасности
- продолжение исследования невозможно по организационным причинам
Граница в пользу связана с расходованием . Граница бесперспективности обычно предназначена для остановки при малой вероятности получить убедительный результат к окончанию исследования.
Остановка по бесперспективности не доказывает . Она показывает, что продолжение исследования в рамках текущего плана считается малоцелесообразным. Правила такой остановки и её обязательность нужно задавать заранее.
α-спендинг и множественные сравнения
α-спендинг контролирует повторные проверки одной гипотезы во времени. FWER и FDR чаще применяются к нескольким гипотезам или показателям.
Если исследование проверяет три основных показателя на четырёх промежуточных этапах, требуется учитывать обе структуры:
- повторение каждой проверки во времени
- одновременную проверку нескольких показателей
Нельзя исправить множественные показатели только α-спендингом. Коррекция Бонферрони по числу всех запланированных проверок тоже может контролировать общий риск, но часто получается излишне строгой и не учитывает фактически накопленную долю информации. α-спендинг позволяет связать границы с последовательным планом и зависимостью промежуточных статистик.
α-спендинг и мощность
Строгие ранние границы уменьшают вероятность случайной остановки, но для их пересечения требуется больше данных в пользу . Более мягкие ранние границы повышают вероятность раннего завершения, но оставляют меньше для итоговой проверки.
Выбранное правило влияет на мощность, ожидаемый размер выборки и вероятность остановки на каждом этапе. Эти характеристики рассчитывают до начала исследования для нескольких предполагаемых величин различий, чтобы ограничить вероятность ошибки II рода.
Итоговый максимальный размер выборки при последовательном плане может быть немного больше, чем при единственной проверке. При наличии реального различия среднее число участников может оказаться меньше за счёт досрочной остановки.
Как спланировать α-спендинг
- сформулировать и
- выбрать общий
- указать одностороннюю или двустороннюю проверку
- определить максимальный размер выборки или число событий
- задать плановые моменты промежуточных анализов
- определить способ расчёта доли информации
- выбрать правило расходования
- рассчитать границы для каждой проверки
- определить правила остановки в пользу и по бесперспективности
- рассчитать мощность и ожидаемый размер выборки
- определить, кто получает доступ к промежуточным данным
- закрепить план при предварительной регистрации
Изменение числа или времени проверок допустимо только по правилам, предусмотренным выбранным методом. Добавление незапланированной проверки после просмотра данных нарушает контроль ошибки I рода.
Что указывать в отчёте
- общий выбранный
- одностороннюю или двустороннюю направленность
- проверяемую гипотезу и основной показатель
- выбранное правило
- способ расчёта доли информации
- запланированное и фактическое число проверок
- плановые и фактические моменты проверок
- критические границы и номинальные p-значения
- правила досрочной остановки
- причину фактической остановки
- размеры выборки на каждой проверке
- использованную статистическую программу
- отклонения от зарегистрированного плана
- оценку величины различий и доверительный интервал
Важные замечания
- Нельзя многократно применять порог 0.05 без коррекции
- Новая часть не равна автоматически p-границе проверки
- Точный календарный момент менее важен, чем накопленная информация
- Незапланированная проверка требует пересмотра всей схемы
- Ранняя статистическая значимость не сообщает практическую важность различий
- Остановка по бесперспективности не подтверждает
- α-спендинг не исправляет смещённую выборку, ненадёжные измерения или неверный критерий
α-спендинг позволяет несколько раз анализировать накапливающиеся данные, сохраняя заранее выбранную вероятность ошибки I рода. Его надёжность зависит от точного планирования, корректного расчёта границ и прозрачного описания всех проведённых проверок.