Последовательное тестирование: история и проблематика

Часть 1: от карт Зенера до альфа-спендинга

statistics
analytics
AB_tests
Author

Elena U

Published

August 10, 2026

Сегодня по плану небольшой исторический экскурс в историю методов последовательного тестирования. Это перекликается с моей любимой темой о поправках на множественное тестирование и об истории A/B тестов, является логическим продолжением обеих тем. История открытия проблемы показалась мне довольно занимательной, делюсь ей с вами.

Представьте, что вы — статистик, и к вам приходит университетская лаборатория с результатами: за несколько лет тысячи испытуемых угадывали карты значительно чаще, чем позволяет случайность. Никакого мошенничества, всё под протоколом, всё воспроизводимо. Пойнт был в том, что якобы у участников есть экстрасенсорные способности.

Именно так выглядела лаборатория парапсихологии Дюкского университета в 1930-х под руководством Дж. Б. Райна, и именно она невольно подарила миру один из важнейших принципов последовательного анализа данных.

Экстрасенсорика и карты Зенера

Методика была следующая: испытуемому показывали колоду из 25 карт с пятью символами (круг, крест, волны, квадрат, звезда — их называют картами Зенера, по имени коллеги Райна, который их придумал), и он пытался угадать порядок, не видя карт. Шанс угадать одну карту — 1 к 5. Но лаборатория не просто фиксировала результат единственного прогона — она наблюдала за испытуемым сериями, и как только суммарный результат начинал выглядеть статистически значимым, серию останавливали и засчитывали как успех.

Думаю, вы уже догадались, в чем проблема такого подхода. В A/B тестировании это будет аналогично проверке p-value каждый день теста и остановке при первом значимом результате. В науке что-то подобное было бы, если после проведения эксперимента добирать еще данные, оценивать значимость, потом еще добирать данные и так до тех пор, пока искомый значимый результат не будет обнаружен.

Карты Зенера

Пример на симуляции

Вот симулятор той самой ситуации, где угадывание происходит случайным образом. Каждое подглядывание на ползунке ниже — это одна честно доигранная колода из 25 карт: после окончания одной колоды лаборатория смотрит на накопленный итог и решает, продолжать или нет.

Вопрос такой: если подглядывать за этим итогом несколько раз по ходу серии и выбирать первый стат значимый результат, как часто вы поймаете ложное доказательство телепатии?

Смотрите симуляцию ниже 👇

При оценке результата после 1 колоды (это и есть классический тест) доля ложных срабатываний держится около 5%, как и должно быть. Но уже при пяти подглядываниях она приближается к 14%, и при увеличении тестов будет стремиться к 100%. То есть при достаточном терпении “статистически значимую телепатию” можно получить у кого угодно, просто наблюдая достаточно долго и останавливаясь в удобный момент.

картинка со звуком

Именно это происходило в лаборатории Райна. Методика теста позволяла найти эффект, там где его нет, в то время как формально выглядело все корректно.

1940: Статистический анализ Феллера

Разбираться пришлось Уильяму Феллеру, известному математику и автору книг по теории вероятностей. В 1940 году он опубликовал статью в Journal of Parapsychology под названием “Statistical Aspects of ESP” (то есть статистические аспекты экстрасенсорных способностей) и математически показал: при такой практике наблюдения результат, который выглядит сколь угодно значимым, можно получить просто за счёт достаточно долгого ожидания — без всякого реального эффекта.

Под H0 накопленная сумма отклонений — это, по сути, случайное блуждание:

\[S_n = \sum_{i=1}^{n}(X_i - \mu_0)\]

Это мартингейл: приращения независимы, среднее равно нулю. По закону повторного логарифма (LIL):

\[\limsup_{n \to \infty} \frac{S_n}{\sqrt{2\sigma^2 n \cdot \log\log n}} = 1 \quad \text{almost sure}\]

Смысл простой и коварный: стандартизованная кумулятивная сумма отклонений почти наверное рано или поздно пересечёт любую фиксированную границу. Обычный тест на уровне значимости 5% рассчитан на единственный взгляд в конце. Если же смотреть на ту же границу многократно по ходу накопления данных, траектория обязательно её пересечёт, просто в силу случайности, а не благодаря наличию эффекта.

Три десятилетия спустя, в 1969 году, Armitage, McPherson и Rowe формализовали это уже для клинических испытаний и дали ту самую конкретную цифру: при alpha = 5% и 5 промежуточных проверках фактическая вероятность ложноположительного результата достигает ≈14%.

1945: Sequential Probability Ratio Test Вальда

Строгое решение этой проблемы появилось всего через пять лет после статьи Феллера, но клиническая статистика узнает об этом лишь спустя почти четверть века. В 1945 году, разрабатывая метод для военного контроля качества (совершенно не думая об экстрасенсах), Абрахам Вальд предложил Sequential Probability Ratio Test — способ анализировать данные последовательно, не теряя контроль над ошибками.

Note

Между прочим, Абрахам Вальд — это тот самый статистик из истории про ошибку выжившего.

История известная, напомню буквально в двух словах. Во время Второй мировой Вальд работал в Statistical Research Group при Колумбийском университете и разбирал данные о пробоинах на бомбардировщиках, вернувшихся с боевых вылетов. Военные хотели укрепить броню там, где пробоин было больше всего. Вальд был против, так как пробоины на вернувшихся машинах показывают места, где самолет может быть поврежден и всё равно вернуться. Тогда как усиливать нужно именно те участки, где пробоин не видно, потому что самолёты с попаданием туда до базы не долетали.

Строим логарифм отношения правдоподобий:

\[\Lambda_n = \sum_{i=1}^n \log\frac{f_1(x_i)}{f_0(x_i)}\]

и продолжаем наблюдение, пока

\[\log\frac{\beta}{1-\alpha} < \Lambda_n < \log\frac{1-\beta}{\alpha}\]

Как только траектория пересекает верхнюю границу — отвергаем H0, нижнюю — принимаем H0. Благодаря мартингейльному свойству \(\Lambda_n\), SPRT контролирует ошибки I и II рода ровно на заданном уровне независимо от момента остановки, в отличие от наивного подглядывания за обычным тестом.

Ограничение: SPRT требует зафиксировать конкретную альтернативу — конкретный размер эффекта, под который строятся границы. На практике эффект заранее неизвестен, и это долго мешало массовому применению SPRT вне узких инженерных задач, для которых Вальд его и разрабатывал.

1977–1983: дальнейшая проработка методов

SPRT был математически безупречен, но требовал знать эффект заранее, что редко бывает возможно на практике. Следующие 40 лет статистики, в основном в контексте клинических испытаний, искали компромисс: как смотреть на данные несколько раз по ходу исследования, не требуя точного знания эффекта и не раздувая alpha.

1977, Стюарт Покок (Stuart Pocock): фиксируем число промежуточных точек анализа заранее и используем одинаковую границу на каждой. Для 5 точек эта граница — z≈2.41 (номинальный p<0.016 на каждом взгляде), а не наивные 1.96: именно с такой границей вероятность хотя бы одного ложного срабатывания за все 5 взглядов держится ровно на 5%. Кстати, это заметно мягче, чем поправка Бонферрони “в лоб” (0.05/5=0.01 на взгляд) — Покок использует известную корреляцию между взглядами (все они считаются по общей накапливающейся выборке), а не игнорирует её, как это делает Бонферрони.

Просто и понятно — но за раннюю остановку приходится платить: граница на финальном взгляде — тот же z≈2.41, а не привычные 1.96, то есть она строже, чем в обычном тесте с фиксированной выборкой, а значит теряется мощность. Чтобы удержать те же 90% мощности при 5 точках анализа, максимальный размер выборки нужно увеличить примерно на 20% по сравнению с обычным тестом.

1979, O’Brien и Fleming: вместо одинаковой границы — асимметричная. Очень жёсткая в начале (остановиться рано почти нереально, даже при крупном эффекте) и почти номинальная в конце. За счёт этого мощность теста остаётся практически такой же, как у обычного теста с фиксированной выборкой — именно поэтому O’Brien-Fleming стал самым популярным дизайном в клинических испытаниях.

1983, Lan и DeMets: и Покок, и O’Brien-Fleming требовали жёстко фиксировать число промежуточных анализов заранее. Lan и DeMets сняли это ограничение, введя функцию расходования alpha, \(\alpha^*(t)\), где \(t\) — доля набранной информации. Граница зависит только от уже пройденных точек и текущей доли информации, а не от того, сколько взглядов запланировано впереди — это позволяет реализовать поведение и а-ля Pocock, и а-ля O’Brien-Fleming, но без жёсткой заранее прописанной схемы.

Что дальше

За 43 года — от статьи Феллера про карты Зенера до гибкой alpha-spending функции Lan-DeMets — статистики решили проблему для мира, где число промежуточных анализов небольшое и заранее спланированное. Но в продуктовой аналитике продакт смотрит на дашборд каждый день, а не 3-5 раз за квартал. В части 2 разберём, как эту проблему решили уже в 2010-х: mSPRT и always-valid p-values — методы, которые позволяют смотреть на результат когда угодно и сколько угодно раз, не боясь ложного срабатывания (также разберем нюансы этого метода).

Ссылки на литературу

Подписывайтесь на канал, пишите комментарии здесь или в чате тг!