InnovateSoft

Почему 2 недели A/B-теста часто мало для статистической значимости

Соблазн остановить тест раньше

«Проведение тестов с корректным расчётом статистической значимости» — отдельный, явно выделенный пункт в CRO-услуге, и он существует не просто для полноты списка. На практике самая частая ошибка в A/B-тестировании — остановить тест, как только один из вариантов вырывается вперёд визуально, не дожидаясь, пока накопится статистически достаточный объём данных. Это интуитивно понятное, но методологически опасное решение: случайные колебания на небольшой выборке легко создают иллюзию явного победителя, который при продолжении теста возвращается к паритету или даже меняется местами.

Почему именно объём и время имеют значение

Статистическая значимость зависит не от календарного срока теста самого по себе, а от накопленного объёма трафика и числа конверсий в каждом варианте — просто чем меньше трафика на сайте, тем дольше физически нужно ждать, чтобы набрать статистически достаточную выборку. Для сайта с высоким трафиком и частыми конверсиями двух недель может хватить с запасом; для нишевого B2B-продукта с редкими сделками и небольшим потоком посетителей двух недель может не хватить и на месяц вперёд — и это нормально, а не признак плохо спроектированного теста.

Ещё один фактор — недельная цикличность поведения пользователей: будние дни и выходные, а иногда и день зарплаты в месяце, могут заметно менять поведение аудитории. Тест короче полного недельного цикла (а лучше нескольких циклов) рискует зафиксировать не реальный эффект изменения, а особенность конкретного отрезка времени, случайно попавшего в выборку.

Что мы делаем вместо остановки «на глаз»

Перед запуском теста мы рассчитываем минимально необходимый размер выборки исходя из текущей конверсии сайта клиента и ожидаемого минимального эффекта, который вообще имеет смысл считать значимым для бизнеса. Это даёт ориентировочный срок теста ещё до его старта — вместо того чтобы решать «пора ли останавливать» интуитивно в процессе. Если по истечении расчётного срока результат остаётся статистически неопределённым, мы прямо говорим клиенту об этом, а не выдаём случайное текущее лидерство одного варианта за окончательный вывод.

Почему это важно для бизнеса, а не только для методологической чистоты

Внедрение варианта, который на самом деле не был статистически лучше старого, — это не нейтральное решение: это упущенная возможность протестировать реальную следующую гипотезу вместо того, чтобы закрепить случайность как «победу». В накопительном эффекте цикла постоянных гипотез (о котором мы рассказываем отдельно) каждая ложно засчитанная победа сдвигает весь последующий roadmap тестов в сторону, которая не подкреплена реальными данными о поведении пользователей.

Вернуться в блог.

Похожие статьи

Гайды по услугам4 мин чтения

Зачем сайту нужна структура до дизайна: как мы проектируем UX от целей бизнеса, а не от шаблона

Красивый макет — не то же самое, что работающий сайт. Рассказываем, почему любой наш проект начинается с проработки структуры и пользовательских сценариев, а не с открытия Figma.

Гайды по услугам4 мин чтения

Почему мы строим сайты на Next.js/React: что это реально даёт бизнесу, а не просто «современный стек»

Frontend на современном стеке — не просто модная фраза в презентации. Разбираем, что конкретно даёт Next.js/React с точки зрения скорости загрузки и SEO — и когда этот выбор действительно имеет значение.

Гайды по услугам4 мин чтения

Какие интеграции нужны сайту на старте, а какие можно добавить позже: CRM, платежи, аналитика, почта

Backend и интеграции — не опциональная надстройка «для галочки», а то, что превращает сайт в рабочий инструмент отдела продаж и маркетинга. Разбираем, какие интеграции закладываются на старте, а какие можно подключить позже без переделки.