Почему 2 недели A/B-теста часто мало для статистической значимости
Соблазн остановить тест раньше
«Проведение тестов с корректным расчётом статистической значимости» — отдельный, явно выделенный пункт в CRO-услуге, и он существует не просто для полноты списка. На практике самая частая ошибка в A/B-тестировании — остановить тест, как только один из вариантов вырывается вперёд визуально, не дожидаясь, пока накопится статистически достаточный объём данных. Это интуитивно понятное, но методологически опасное решение: случайные колебания на небольшой выборке легко создают иллюзию явного победителя, который при продолжении теста возвращается к паритету или даже меняется местами.
Почему именно объём и время имеют значение
Статистическая значимость зависит не от календарного срока теста самого по себе, а от накопленного объёма трафика и числа конверсий в каждом варианте — просто чем меньше трафика на сайте, тем дольше физически нужно ждать, чтобы набрать статистически достаточную выборку. Для сайта с высоким трафиком и частыми конверсиями двух недель может хватить с запасом; для нишевого B2B-продукта с редкими сделками и небольшим потоком посетителей двух недель может не хватить и на месяц вперёд — и это нормально, а не признак плохо спроектированного теста.
Ещё один фактор — недельная цикличность поведения пользователей: будние дни и выходные, а иногда и день зарплаты в месяце, могут заметно менять поведение аудитории. Тест короче полного недельного цикла (а лучше нескольких циклов) рискует зафиксировать не реальный эффект изменения, а особенность конкретного отрезка времени, случайно попавшего в выборку.
Что мы делаем вместо остановки «на глаз»
Перед запуском теста мы рассчитываем минимально необходимый размер выборки исходя из текущей конверсии сайта клиента и ожидаемого минимального эффекта, который вообще имеет смысл считать значимым для бизнеса. Это даёт ориентировочный срок теста ещё до его старта — вместо того чтобы решать «пора ли останавливать» интуитивно в процессе. Если по истечении расчётного срока результат остаётся статистически неопределённым, мы прямо говорим клиенту об этом, а не выдаём случайное текущее лидерство одного варианта за окончательный вывод.
Почему это важно для бизнеса, а не только для методологической чистоты
Внедрение варианта, который на самом деле не был статистически лучше старого, — это не нейтральное решение: это упущенная возможность протестировать реальную следующую гипотезу вместо того, чтобы закрепить случайность как «победу». В накопительном эффекте цикла постоянных гипотез (о котором мы рассказываем отдельно) каждая ложно засчитанная победа сдвигает весь последующий roadmap тестов в сторону, которая не подкреплена реальными данными о поведении пользователей.
Вернуться в блог.