Гомоскедастичность и гетероскедастичность: почему A/B-тест врёт
Термин из арсенала аналитика, который часто всплывает в отчётах о A/B-тестах (экспериментах с разделением аудитории на группы) и редко объясняется по-человечески. Речь про постоянство дисперсии — разброса значений метрики внутри групп.
Гомоскедастичность — это когда дисперсия метрики одинакова во всех сравниваемых группах. Например, конверсия варьируется примерно в одном диапазоне и в контроле, и в тесте. Стандартный t-критерий Стьюдента и его аналоги в этом случае работают корректно: доверительные интервалы (диапазоны, в которые попадает истинное значение с заданной вероятностью) и p-value (вероятность получить наблюдаемый эффект при отсутствии реального различия) не врут.
Гетероскедастичность — дисперсия разная. Классический случай: тестируем новый чекаут (процесс оформления заказа) на дорогом сегменте, где средний чек высокий, а в контроле оставили дешёвый трафик. Разброс заказов в тесте кратно шире. Применяем обычный t-критерий — получаем «значимый» результат, которого на самом деле нет, или наоборот пропускаем реальный эффект.
Чем опасно:
— Слишком оптимистичные p-value при росте дисперсии
— Заниженная статистическая мощность (способность теста обнаружить реальный эффект) в группе с большим разбросом
— Ложные выводы при агрегированных метриках вроде среднего чека без сегментации
Типичные ошибки:
— Считать гетероскедастичность только «для средних». Она встречается в конверсиях, выручке, времени на странице, retention (удержании пользователей)
— Игнорировать эффект, когда дисперсия меняется из-за самого воздействия. Если тест увеличил разброс поведения — это тоже сигнал, а не только статистический шум
— Применять Welch’s t-test (модификация критерия для неравных дисперсий) и считать задачу решённой. Он устойчивее, но не лечит проблему малых выборок
Что делать на практике:
— Смотреть не только средние, но и стандартные отклонения и квантили метрики по группам
— Использовать непараметрические методы (бутстрап, перестановочные тесты — статистические подходы, не требующие предположений о нормальности распределения) при больших хвостах
— Для ratio-метрик (конверсия, ARPU — средняя выручка на пользователя) — дельта-метод или бакетизация, усреднение по сегментам вместо одной большой дроби
Пример: тестируем два варианта лендинга (посадочной страницы). Контроль даёт конверсию 3% с равномерным распределением. Тест даёт те же 3%, но у 1% пользователей случается всплеск до 15% — удачный таргетинг (настройка показа рекламы). Средние равны, дисперсии разные. Любой честный аналитик скажет: тест не «равен контролю», он ведёт себя иначе, и для решения нужно смотреть на распределение, а не только на средние.
— @ExperimentationRoom
Эксперименты и A/B-тесты
@ExperimentationRoom
Гомоскедастичность и гетероскедастичность: почему A/B-тест врёт
Этот пост опубликован в Telegram-канале Эксперименты и A/B-тесты. Подписаться можно по ссылке: @ExperimentationRoom.