Как отличить бот поисковика или модератора от живого пользователя по цепочке запроса
Анализ логов показывает: «живой» трафик и проверяющий бот почти всегда расходятся не по одному признаку, а по связке. Смотрим не на один User-Agent, а на пакет: IP-репутация, reverse DNS, поведение по referer, порядок загрузки ресурсов, частоту запросов и глубину обхода.
У поискового бота обычно стабильная модель: ровные интервалы, предсказуемый обход внутренних ссылок, одинаковые заголовки, минимальная вариативность fingerprint. Модераторские системы чаще палятся на коротком сеансе: один-два хита, резкий заход на посадочную, отсутствие «человеческого шума» вроде скролла, кликов по вторичным элементам и повторного визита с той же сессией.
Разберем техническую составляющую реализации: держите серверную корреляцию по IP, ASN, заголовкам, cookie и TLS-fingerprint. Если видите совпадение User-Agent с публичным браузером, но при этом пустой Accept-Language, странный порядок Accept-Encoding и отсутствие referer там, где он должен быть, перед вами не пользователь, а скрипт или прокси-цепочка с плохой маскировкой.
Практика простая: логируйте последовательность запросов, а не только факт визита. Бот почти всегда экономит трафик и не любит нестабильные редиректы, а живой пользователь их пережевывает без идеальной геометрии. Проверка цепочки прохождения запроса здесь важнее «магического» списка User-Agent. Конфиг готов, можно деплоить.
Клоакинг: разборы
@cloaking_lab_arb
Как отличить бот поисковика или модератора от живого пользователя по цепочке запроса
Этот пост опубликован в Telegram-канале Клоакинг: разборы. Подписаться можно по ссылке: @cloaking_lab_arb.