Эксперименты ломаются не на статистике, а на постановке гипотезы и единице рандомизации
Если в одном тесте меняются и оффер, и визуал, и порядок блоков — вы не узнаете, что сработало. Одна гипотеза = один механизм влияния: меньше трения в форме, заметнее ценность, выше доверие.
Вторая ошибка — рандомизировать не там, где возникает эффект. Если пользователь видит вариант A на десктопе и B в мобильном приложении, это уже не эксперимент, а смесь разных контекстов. Единица теста должна совпадать с тем, как клиент реально принимает решение.
Третья проблема — смотреть только на средний uplift. Важно заранее зафиксировать: primary metric, guardrails и минимальный размер эффекта, который вообще имеет смысл ловить. Иначе тест может «выиграть» на конверсии, но проиграть по марже, возвратам или качеству лидов.
Ещё один полезный фильтр: перед запуском опишите, что именно должно измениться в поведении. Если гипотеза не объясняет механизм, её трудно интерпретировать после результата.
Хороший эксперимент не доказывает «идею», он либо подтверждает механизм, либо отправляет его в архив.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на статистике, а на постановке гипотезы и единице рандомизации
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.