Эксперименты и A/B-тесты

Гомоскедастичность и гетероскедастичность: почему A/B-тест врёт

Гомоскедастичность и гетероскедастичность: почему A/B-тест врёт

Термин из арсенала аналитика, который часто всплывает в отчётах о A/B-тестах (экспериментах с разделением аудитории на группы) и редко объясняется по-человечески. Речь про постоянство дисперсии — разброса значений метрики внутри групп.

Гомоскедастичность — это когда дисперсия метрики одинакова во всех сравниваемых группах. Например, конверсия варьируется примерно в одном диапазоне и в контроле, и в тесте. Стандартный t-критерий Стьюдента и его аналоги в этом случае работают корректно: доверительные интервалы (диапазоны, в которые попадает истинное значение с заданной вероятностью) и p-value (вероятность получить наблюдаемый эффект при отсутствии реального различия) не врут.

Гетероскедастичность — дисперсия разная. Классический случай: тестируем новый чекаут (процесс оформления заказа) на дорогом сегменте, где средний чек высокий, а в контроле оставили дешёвый трафик. Разброс заказов в тесте кратно шире. Применяем обычный t-критерий — получаем «значимый» результат, которого на самом деле нет, или наоборот пропускаем реальный эффект.

Чем опасно:
— Слишком оптимистичные p-value при росте дисперсии
— Заниженная статистическая мощность (способность теста обнаружить реальный эффект) в группе с большим разбросом
— Ложные выводы при агрегированных метриках вроде среднего чека без сегментации

Типичные ошибки:
— Считать гетероскедастичность только «для средних». Она встречается в конверсиях, выручке, времени на странице, retention (удержании пользователей)
— Игнорировать эффект, когда дисперсия меняется из-за самого воздействия. Если тест увеличил разброс поведения — это тоже сигнал, а не только статистический шум
— Применять Welch’s t-test (модификация критерия для неравных дисперсий) и считать задачу решённой. Он устойчивее, но не лечит проблему малых выборок

Что делать на практике:
— Смотреть не только средние, но и стандартные отклонения и квантили метрики по группам
— Использовать непараметрические методы (бутстрап, перестановочные тесты — статистические подходы, не требующие предположений о нормальности распределения) при больших хвостах
— Для ratio-метрик (конверсия, ARPU — средняя выручка на пользователя) — дельта-метод или бакетизация, усреднение по сегментам вместо одной большой дроби

Пример: тестируем два варианта лендинга (посадочной страницы). Контроль даёт конверсию 3% с равномерным распределением. Тест даёт те же 3%, но у 1% пользователей случается всплеск до 15% — удачный таргетинг (настройка показа рекламы). Средние равны, дисперсии разные. Любой честный аналитик скажет: тест не «равен контролю», он ведёт себя иначе, и для решения нужно смотреть на распределение, а не только на средние.

— @ExperimentationRoom
Этот пост опубликован в Telegram-канале Эксперименты и A/B-тесты. Подписаться можно по ссылке: @ExperimentationRoom.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.