Эксперименты ломаются не на p-value, а на плохой постановке гипотезы
Если тест стартует с фразы «а давайте проверим», у него почти всегда слабая логика. Нормальная гипотеза отвечает на 3 вещи: что меняем, на какую метрику влияем, почему эффект вообще должен появиться. Без этого вы получаете шум, а не знание.
Перед запуском проверьте:
— одна основная метрика, а не пять «на всякий случай»;
— заранее заданный минимально значимый эффект;
— сегменты, где эффект может отличаться;
— правила остановки теста, чтобы не смотреть на график каждый час.
Частая ошибка — резать трафик слишком мелко и ждать «значимости» по 2–3 дня. Если вариант видит мало сессий, доверительный интервал остаётся широким, а победитель меняется от перезапуска к перезапуску. Это не инсайт, это недомером.
Ещё одна ловушка — делать вывод по средней конверсии, игнорируя распределение. Иногда общий uplift появляется только за счёт одной группы, а у остальных вариант хуже. Тогда масштабировать тест опасно.
Сильный эксперимент — это не красивый процент в отчёте, а заранее понятная связь между гипотезой, метрикой и решением. Если этой связи нет, тест лучше не запускать.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на p-value, а на плохой постановке гипотезы
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.