Эксперименты ломаются не на p-value, а на плохой постановке гипотезы
Если тест не отвечает на один конкретный вопрос, его результат почти всегда бесполезен. Формулируйте гипотезу так, чтобы в ней были: изменение, ожидаемый механизм и метрика, которая должна сдвинуться.
Перед запуском проверьте базовые вещи:
— есть ли у метрики чувствительность к изменению;
— не пересекаются ли тесты по одной и той же аудитории;
— хватает ли трафика на минимально заметный эффект;
— не зависит ли результат от дня недели, устройства или канала входа.
Дальше смотрите не только на «значимо / незначимо». Полезнее оценивать доверительный интервал и практический эффект: иногда рост на 3% при узком интервале важнее, чем скачок на 12% в шумной выборке. Если метрика вторична, а первичная молчит, тест не «почти сработал» — он не подтвердил гипотезу.
Ещё одна частая ошибка — остановка теста в момент удачного спайка. Фиксируйте заранее длительность, правило остановки и сегменты, которые будете проверять отдельно.
Хороший эксперимент — это не магия, а дисциплина: сначала вопрос, потом дизайн, потом вывод.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на p-value, а на плохой постановке гипотезы
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.