Сегодня по плану небольшой исторический экскурс в историю методов последовательного тестирования. Это перекликается с моей любимой темой о поправках на множественное тестирование и об истории A/B тестов, является логическим продолжением обеих тем. История открытия проблемы показалась мне довольно занимательной, делюсь ей с вами.
Представьте, что вы — статистик, и к вам приходит университетская лаборатория с результатами: за несколько лет тысячи испытуемых угадывали карты значительно чаще, чем позволяет случайность. Никакого мошенничества, всё под протоколом, всё воспроизводимо. Пойнт был в том, что якобы у участников есть экстрасенсорные способности.
Именно так выглядела лаборатория парапсихологии Дюкского университета в 1930-х под руководством Дж. Б. Райна, и именно она невольно подарила миру один из важнейших принципов последовательного анализа данных.
Экстрасенсорика и карты Зенера
Методика была следующая: испытуемому показывали колоду из 25 карт с пятью символами (круг, крест, волны, квадрат, звезда — их называют картами Зенера, по имени коллеги Райна, который их придумал), и он пытался угадать порядок, не видя карт. Шанс угадать одну карту — 1 к 5. Но лаборатория не просто фиксировала результат единственного прогона — она наблюдала за испытуемым сериями, и как только суммарный результат начинал выглядеть статистически значимым, серию останавливали и засчитывали как успех.
Думаю, вы уже догадались, в чем проблема такого подхода. В A/B тестировании это будет аналогично проверке p-value каждый день теста и остановке при первом значимом результате. В науке что-то подобное было бы, если после проведения эксперимента добирать еще данные, оценивать значимость, потом еще добирать данные и так до тех пор, пока искомый значимый результат не будет обнаружен.

Пример на симуляции
Вот симулятор той самой ситуации, где угадывание происходит случайным образом. Каждое подглядывание на ползунке ниже — это одна честно доигранная колода из 25 карт: после окончания одной колоды лаборатория смотрит на накопленный итог и решает, продолжать или нет.
Вопрос такой: если подглядывать за этим итогом несколько раз по ходу серии и выбирать первый стат значимый результат, как часто вы поймаете ложное доказательство телепатии?
Смотрите симуляцию ниже 👇
При оценке результата после 1 колоды (это и есть классический тест) доля ложных срабатываний держится около 5%, как и должно быть. Но уже при пяти подглядываниях она приближается к 14%, и при увеличении тестов будет стремиться к 100%. То есть при достаточном терпении “статистически значимую телепатию” можно получить у кого угодно, просто наблюдая достаточно долго и останавливаясь в удобный момент.

Именно это происходило в лаборатории Райна. Методика теста позволяла найти эффект, там где его нет, в то время как формально выглядело все корректно.
1940: Статистический анализ Феллера
Разбираться пришлось Уильяму Феллеру, известному математику и автору книг по теории вероятностей. В 1940 году он опубликовал статью в Journal of Parapsychology под названием “Statistical Aspects of ESP” (то есть статистические аспекты экстрасенсорных способностей) и математически показал: при такой практике наблюдения результат, который выглядит сколь угодно значимым, можно получить просто за счёт достаточно долгого ожидания — без всякого реального эффекта.
NoteПочему так происходит (закон повторного логарифма)
Под H0 накопленная сумма отклонений — это, по сути, случайное блуждание:
\[S_n = \sum_{i=1}^{n}(X_i - \mu_0)\]
Это мартингейл: приращения независимы, среднее равно нулю. По закону повторного логарифма (LIL):
\[\limsup_{n \to \infty} \frac{S_n}{\sqrt{2\sigma^2 n \cdot \log\log n}} = 1 \quad \text{almost sure}\]
Смысл простой и коварный: стандартизованная кумулятивная сумма отклонений почти наверное рано или поздно пересечёт любую фиксированную границу. Обычный тест на уровне значимости 5% рассчитан на единственный взгляд в конце. Если же смотреть на ту же границу многократно по ходу накопления данных, траектория обязательно её пересечёт, просто в силу случайности, а не благодаря наличию эффекта.
Три десятилетия спустя, в 1969 году, Armitage, McPherson и Rowe формализовали это уже для клинических испытаний и дали ту самую конкретную цифру: при alpha = 5% и 5 промежуточных проверках фактическая вероятность ложноположительного результата достигает ≈14%.
1945: Sequential Probability Ratio Test Вальда
Строгое решение этой проблемы появилось всего через пять лет после статьи Феллера, но клиническая статистика узнает об этом лишь спустя почти четверть века. В 1945 году, разрабатывая метод для военного контроля качества (совершенно не думая об экстрасенсах), Абрахам Вальд предложил Sequential Probability Ratio Test — способ анализировать данные последовательно, не теряя контроль над ошибками.
Note
Между прочим, Абрахам Вальд — это тот самый статистик из истории про ошибку выжившего.
История известная, напомню буквально в двух словах. Во время Второй мировой Вальд работал в Statistical Research Group при Колумбийском университете и разбирал данные о пробоинах на бомбардировщиках, вернувшихся с боевых вылетов. Военные хотели укрепить броню там, где пробоин было больше всего. Вальд был против, так как пробоины на вернувшихся машинах показывают места, где самолет может быть поврежден и всё равно вернуться. Тогда как усиливать нужно именно те участки, где пробоин не видно, потому что самолёты с попаданием туда до базы не долетали.

NoteМатчасть: SPRT Вальда
Строим логарифм отношения правдоподобий:
\[\Lambda_n = \sum_{i=1}^n \log\frac{f_1(x_i)}{f_0(x_i)}\]
и продолжаем наблюдение, пока
\[\log\frac{\beta}{1-\alpha} < \Lambda_n < \log\frac{1-\beta}{\alpha}\]
Как только траектория пересекает верхнюю границу — отвергаем H0, нижнюю — принимаем H0. Благодаря мартингейльному свойству \(\Lambda_n\), SPRT контролирует ошибки I и II рода ровно на заданном уровне независимо от момента остановки, в отличие от наивного подглядывания за обычным тестом.
Ограничение: SPRT требует зафиксировать конкретную альтернативу — конкретный размер эффекта, под который строятся границы. На практике эффект заранее неизвестен, и это долго мешало массовому применению SPRT вне узких инженерных задач, для которых Вальд его и разрабатывал.
1977–1983: дальнейшая проработка методов
SPRT был математически безупречен, но требовал знать эффект заранее, что редко бывает возможно на практике. Следующие 40 лет статистики, в основном в контексте клинических испытаний, искали компромисс: как смотреть на данные несколько раз по ходу исследования, не требуя точного знания эффекта и не раздувая alpha.
1977, Стюарт Покок (Stuart Pocock): фиксируем число промежуточных точек анализа заранее и используем одинаковую границу на каждой. Для 5 точек эта граница — z≈2.41 (номинальный p<0.016 на каждом взгляде), а не наивные 1.96: именно с такой границей вероятность хотя бы одного ложного срабатывания за все 5 взглядов держится ровно на 5%. Кстати, это заметно мягче, чем поправка Бонферрони “в лоб” (0.05/5=0.01 на взгляд) — Покок использует известную корреляцию между взглядами (все они считаются по общей накапливающейся выборке), а не игнорирует её, как это делает Бонферрони.
Просто и понятно — но за раннюю остановку приходится платить: граница на финальном взгляде — тот же z≈2.41, а не привычные 1.96, то есть она строже, чем в обычном тесте с фиксированной выборкой, а значит теряется мощность. Чтобы удержать те же 90% мощности при 5 точках анализа, максимальный размер выборки нужно увеличить примерно на 20% по сравнению с обычным тестом.
1979, O’Brien и Fleming: вместо одинаковой границы — асимметричная. Очень жёсткая в начале (остановиться рано почти нереально, даже при крупном эффекте) и почти номинальная в конце. За счёт этого мощность теста остаётся практически такой же, как у обычного теста с фиксированной выборкой — именно поэтому O’Brien-Fleming стал самым популярным дизайном в клинических испытаниях.
1983, Lan и DeMets: и Покок, и O’Brien-Fleming требовали жёстко фиксировать число промежуточных анализов заранее. Lan и DeMets сняли это ограничение, введя функцию расходования alpha, \(\alpha^*(t)\), где \(t\) — доля набранной информации. Граница зависит только от уже пройденных точек и текущей доли информации, а не от того, сколько взглядов запланировано впереди — это позволяет реализовать поведение и а-ля Pocock, и а-ля O’Brien-Fleming, но без жёсткой заранее прописанной схемы.
Что дальше
За 43 года — от статьи Феллера про карты Зенера до гибкой alpha-spending функции Lan-DeMets — статистики решили проблему для мира, где число промежуточных анализов небольшое и заранее спланированное. Но в продуктовой аналитике продакт смотрит на дашборд каждый день, а не 3-5 раз за квартал. В части 2 разберём, как эту проблему решили уже в 2010-х: mSPRT и always-valid p-values — методы, которые позволяют смотреть на результат когда угодно и сколько угодно раз, не боясь ложного срабатывания (также разберем нюансы этого метода).
Ссылки на литературу
- Feller, W. (1940). Statistical Aspects of ESP. Journal of Parapsychology, 4(2), 271–298 — статья про карты Зенера.
- Armitage, P., McPherson, C.K., Rowe, B.C. (1969). Repeated Significance Tests on Accumulating Data. Journal of the Royal Statistical Society: Series A, 132(2), 235–244.
- Wald, A. (1945). Sequential Tests of Statistical Hypotheses. Annals of Mathematical Statistics, 16(2), 117–186.
- Pocock, S.J. (1977). Group Sequential Methods in the Design and Analysis of Clinical Trials. Biometrika, 64(2), 191–199.
- O’Brien, P.C., Fleming, T.R. (1979). A Multiple Testing Procedure for Clinical Trials. Biometrics, 35(3), 549–556.
- Lan, K.K.G., DeMets, D.L. (1983). Discrete Sequential Boundaries for Clinical Trials. Biometrika, 70(3), 659–663.
Подписывайтесь на канал, пишите комментарии здесь или в чате тг!
