Эксперименты ломаются не на статистике, а на постановке гипотезы и метрики
Если тест запускают без одной главной метрики, он почти всегда превращается в спор вкусов. Для любого A/B сначала фиксируйте:
— одну целевую метрику;
— 1–2 guardrail-метрики;
— критерий успеха до старта.
Иначе вы найдёте «рост» там, где просто перераспределился трафик между экранами.
Вторая типовая ошибка — тестировать слишком много изменений сразу. Когда в вариации и заголовок, и оффер, и цена, и порядок блоков, вы получаете не эксперимент, а кашу из факторов. В таком дизайне нельзя понять, что именно дало эффект, а что только шумело.
Третья проблема — остановка теста «когда уже красиво». Если смотреть на результат каждый день и останавливать при первом плюсе, ложноположительных находок станет больше. Планируйте размер выборки заранее и не меняйте правило остановки по ходу теста.
Ещё один частый провал — игнорировать сегменты. Общий uplift может скрывать, что новички выиграли, а возвращающиеся пользователи проиграли. Проверяйте разрезы, но не объявляйте победителем сегмент, если он маленький и эффект неустойчив.
Хороший эксперимент — это не про удачную цифру в конце, а про воспроизводимую процедуру: одна гипотеза, одна главная метрика, заранее заданная выборка и честная интерпретация.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на статистике, а на постановке гипотезы и метрики
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.