AB-тест ломается не на статистике, а на постановке гипотезы и метрики
Если тестируете «кнопку», сначала ответьте: что именно должно вырасти — клики, заявки, выручка на сессию или доля завершивших сценарий. Одна и та же правка может улучшить CTR и одновременно ухудшить downstream-метрику.
Дальше проверьте три вещи:
— единица рандомизации: пользователь, сессия или устройство;
— длительность: покрывает ли тест полный цикл поведения;
— сегменты: не съел ли общий эффект один важный кластер, например mobile.
Отдельно смотрите на SRM — mismatch между ожидаемым и фактическим распределением трафика. Если трафик «поплыл», p-value уже вторичен: сначала ищем баг в раздаче, фильтрах или логировании.
Ещё одна частая ошибка — остановка по первому «значимому» результату. Плавающий эффект внутри доверительного интервала часто исчезает, если тест добирает нормальный объём наблюдений. Лифт без размера выборки — это не вывод, а гипотеза о случайности.
Финал простой: хороший AB-тест начинается с метрики и единицы анализа, а заканчивается проверкой, что результат не держится на шуме.
Experiment Desk
@experiment_desk
AB-тест ломается не на статистике, а на постановке гипотезы и метрики
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.