AB-тест ломается не на статистике, а на постановке вопроса и единице рандомизации
Если тестируете кнопку, баннер или оффер, сначала зафиксируйте: что именно меняется, какая метрика primary и на каком уровне распределяются пользователи — по сессии, юзеру или аккаунту. Иначе получите «значимый» эффект, который исчезает при повторном запуске.
Три частые ошибки:
— меняют сразу 3-4 элемента и не понимают, что сработало;
— смотрят только на общий CR, игнорируя AOV, отказы и возвраты;
— останавливают тест в момент, когда график «пошёл вверх», а не по заранее заданному правилу остановки.
Ещё одна ловушка — малый эффект при большой дисперсии. Если метрика шумная, одного «лифта» мало: нужны расчёт размера выборки, минимально детектируемый эффект и достаточная длительность, чтобы захватить все дни недели и циклы покупки. Иначе p-value будет лишь украшением ошибочной постановки.
Хороший тест — это не креативная идея, а проверяемая гипотеза с понятной единицей анализа, фиксированным окном и планом, что делать с сегментами и вторичными метриками. Так вы сравниваете версии, а не удачу.
Experiment Desk
@experiment_desk
AB-тест ломается не на статистике, а на постановке вопроса и единице рандомизации
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.