Как резать серверные затраты и анти-капчу, не убивая throughput скрапера
Первый слив денег — лишние ретраи. Если у тебя нет лимитов на 429/5xx, оркестратор молотит одни и те же URL, раздувая CPU, очередь и анти-капчу. Нормальная схема: таймауты по классу домена, backoff с джиттером, дедуп по fingerprint ответа.
Второй источник перерасхода — тупой параллелизм. Не гони 200 воркеров в один хост, если таргет режет по IP и поведению. Лучше распределить нагрузку по пулам: ротация прокси, отдельные сессии на кластеры доменов, жесткий лимит запросов на хост. Масштабируй автоматизацию или умри в рутине.
Анти-капча тоже считается как переменная, а не как магия. Сначала выжимай страницу без нее: снижай частоту, повторно используй куки, прогревай сессию, убирай лишние клики и рендер там, где хватает HTML. Если CAPTCHA все равно всплывает, дешевле ловить её на раннем этапе пайплайна и отправлять в отдельную ветку, чем сжигать headless на каждом запросе.
Бенчмарк для здравого смысла: меряй не только RPS, но и стоимость одного успешного документа. Смотри на долю пустых ответов, время до блокировки, процент повторной доставки и цену обхода на единицу контента. Анализируем структуру, а не смыслы.
Если throughput растет, а стоимость юнита — тоже, значит у тебя не скрапинг, а симулятор сжигания бюджета.
Scrape & Spin
@scrape_spin_war_ubt
Как резать серверные затраты и анти-капчу, не убивая throughput скрапера
Этот пост опубликован в Telegram-канале Scrape & Spin. Подписаться можно по ссылке: @scrape_spin_war_ubt.