Масштабирование GSA-фермы ломается не на сабмитах, а на рассинхроне списков и инстансов
Когда ферма растёт, главный враг не CPU, а зоопарк данных. Один инстанс ест свежие targets, второй крутит уже отстрелянные, третий тянет мусор из старого проекта. Итог предсказуем: просадка LPM, дубли, лишний пробив, грязные логи.
Держите схему без хаоса:
— один master-список targets, отдельные слои под verified / pending / dead
— синк не по ручному копипасту, а через общий каталог или жёстко заданные пути
— для каждого инстанса свой footprint: прокси, юзер-агенты, тайминг, лимиты потоков
— no shared cache between машинами, иначе ловите пересечение отпечатков и банальный self-cannibalization
Управление несколькими инстансами упирается в дисциплину очередей. Один движок — один сегмент задач, один тип платформ, один режим фильтрации. Если мешать всё в одну корзину, вы не масштабируете ферму, а просто множите шум. Отдельно следите за дедупом: одинаковый URL в трёх очередях выглядит как рост, но по факту сжигает бюджет на пустые попытки.
Перед прогоном фиксируйте точки синхры: что обновляется каждый цикл, что живёт только в локальном инстансе, что уходит в общий пул. Чистим листы до блеска, выстраиваем Tier-пирамиду, и только потом раздуваем парк. Иначе рост инстансов даёт не throughput, а размазанную ошибку по всей ферме.
GSA: подземка
@gsa_underground_ubt
Масштабирование GSA-фермы ломается не на сабмитах, а на рассинхроне списков и инстансов
Этот пост опубликован в Telegram-канале GSA: подземка. Подписаться можно по ссылке: @gsa_underground_ubt.