Почему «значимый» A/B-тест всё равно может быть бесполезным для продукта
Статзначимость говорит только: результат не похож на шум при выбранной модели. Она не доказывает, что эффект важен для бизнеса, стабилен и повторится на другом трафике.
Перед запуском зафиксируйте три порога:
— MDE: минимальный эффект, который имеет смысл ловить;
— размер выборки на вариант;
— правило остановки, а не «закончим, когда станет красиво».
После теста смотрите не только p-value, но и доверительный интервал. Лифт 4% с интервалом от −1% до +9% — это неопределённость. Интервал от +0,2% до +0,8% может быть статистически чистым, но слишком маленьким для дорогой разработки.
Сегменты полезны: новые и вернувшиеся, мобильный и десктоп, источники трафика. Но победа в одном «красивом» сегменте без заранее заданной гипотезы — это уже не вывод, а поиск удачи.
Хороший эксперимент не обязан дать плюс. Он должен снизить неопределённость и показать, какое решение принимать.
Experiment Desk
@experiment_desk
Почему «значимый» A/B-тест всё равно может быть бесполезным для продукта
Этот пост опубликован в Telegram-канале Experiment Desk. Подписаться можно по ссылке: @experiment_desk.