Эксперименты ломаются не на статистике, а на постановке гипотезы и метрики
Если тест запускают «на всякий случай», он почти всегда даёт шум. Хорошая гипотеза отвечает на три вопроса: что меняем, какую метрику двигаем и почему это должно сработать именно здесь. Без этого вы получаете не эксперимент, а генератор случайных выводов.
Перед стартом проверьте:
— одна основная метрика, не три;
— один пользовательский сценарий, а не весь продукт;
— сегмент, где эффект реально виден, а не размазан по всей базе;
— заранее заданный MDE: минимальный эффект, который вообще имеет смысл ловить.
Самая частая ошибка — остановить тест, когда «победитель уже очевиден». Если смотреть на результаты каждый день, ложноположительные находки резко растут. Для нормального вывода нужны заранее фиксированные длительность, критерий остановки и правило про сезонность/дни недели.
Ещё один фильтр: вопрос не «выросла ли конверсия», а «выросла ли она достаточно, чтобы перекрыть риск и стоимость внедрения». Иногда лифт есть, но он меньше шума или держится только в одном сегменте.
Хороший эксперимент не обещает чудо — он сокращает неопределённость. Если гипотеза не проходит этот фильтр до запуска, лучше не тратить трафик.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на статистике, а на постановке гипотезы и метрики
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.