Эксперименты ломаются не на статистике, а на постановке гипотезы
Если тест запускают «проверить кнопку», он почти всегда даёт шум. Гипотеза должна отвечать на три вопроса: какой пользовательский барьер меняем, какое поведение ждём, по какому метрику судим.
Перед стартом проверьте:
— один тест = одна основная метрика;
— сегменты и триггеры определены заранее;
— есть план остановки: минимум выборки и срок, а не «как только p-value позеленеет»;
— у варианта и контроля одинаковая логика трекинга.
Дальше смотрите не только на uplift, но и на разброс. Если эффект держится только в одном сегменте, а в общей массе исчезает, это часто признак переобучения на шум. Для лендингов и checkout особенно важно разделять клики, старт формы и завершение покупки: одна метрика часто маскирует провал в следующем шаге.
Ещё одна частая ошибка — менять сразу несколько элементов: заголовок, CTA и порядок блоков. Тогда победа есть, а причина неизвестна.
Хороший эксперимент — это не «победил вариант B», а ответ: какой механизм сработал, где он воспроизводим и при каких условиях его не стоит масштабировать.
Experiment Desk
@experiment_desk
Эксперименты ломаются не на статистике, а на постановке гипотезы
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.