Isolation Forest ловит не ботов, а их следы в распределении кликов и сессий
Давайте поднимем логи и посмотрим правде в глаза. Фрод почти никогда не выглядит как один «плохой» параметр: он прячется в связке IP→UA→ASN→время→глубина сессии. Именно здесь Isolation Forest полезен: он не ищет правила, а изолирует точки, которые слишком легко отделяются от массы.
Рабочий набор фич для старта:
• inter-click delay и variance по сессии
• ratio кликов к просмотрам/скроллам
• повторяемость UA, CIDR, device fingerprint
• time-to-conversion и длина цепочки редиректов
• доля событий без движения мыши или touch-событий
Модель не ставят «вместо» фильтров, а поверх них. Сначала режете мусор по жёстким сигнатурам: прокси, дата-центры, пустые заголовки, невозможные комбинации. Потом Isolation Forest получает уже очищенный поток и начинает подсвечивать тонкие аномалии: слишком ровные интервалы, одинаковые паттерны навигации, кластерные выбросы по одной подсети. Ботнеты эволюционируют, но паттерны их поведения остаются прежними.
Критично не кормить модель сырым шумом из всех кампаний сразу: сегментируйте по источнику, GEO и типу плейсмента. Иначе вы получите красивую математику, которая путает дорогой бренд-трафик с мусорным инвентарём. Вот технический разбор того, как именно уплывает ваш рекламный бюджет: аномалия — это не «низкий CTR», а точка, которая нарушает совместное распределение признаков.
Если у вас есть логи, начните с 20–30 признаков и порога, который отправляет в ручную проверку только верхний хвост скоринга. Машинное обучение здесь работает как триаж: не ищет истину, а быстро отделяет подозрительное от нормального.
Защита от фрода в рекламе
@ad_fraud_shield_arb
Isolation Forest ловит не ботов, а их следы в распределении кликов и сессий
Этот пост опубликован в Telegram-канале Защита от фрода в рекламе. Подписаться можно по ссылке: @ad_fraud_shield_arb.