Эксперименты ломаются не на статистике, а на постановке вопроса
Гипотеза должна быть проверяемой: один фактор, один ожидаемый эффект, одна метрика успеха. Если в тесте одновременно меняют заголовок, CTA и порядок блоков, вы не узнаете, что именно сработало.
Перед запуском зафиксируйте:
— primary metric и guardrails;
— минимально значимый эффект;
— правило остановки;
— сегменты, которые исключаете заранее.
Иначе «победитель» легко окажется шумом или эффектом состава трафика.
Следующая типовая ошибка — недостаточная длительность. Короткий тест ловит день недели, акцию у конкурента или случайный перекос по источникам. Если трафик сезонный, сравнивайте не только суммарный uplift, но и поведение по кластерам: новые/возвратные, mobile/desktop, paid/organic.
Не доверяйте одной p-value. Смотрите на доверительный интервал: если он широкий и пересекает ноль, вывод о росте преждевременен. Если сегментный эффект есть только в одной группе, это не «универсальная победа», а повод проверить, повторяется ли паттерн на другом трафике.
Хороший эксперимент отвечает на один вопрос и оставляет после себя понятное правило, которое можно повторить без магии.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на статистике, а на постановке вопроса
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.