Свой парсер креативов на Playwright и Selenium: где обычно ломается сбор
Если нужен не обзор чужой библиотеки, а свой spy_tools-парсер креативов, связка Playwright + Selenium закрывает две разные задачи: первый быстрее и удобнее для headless-скрейпа, второй иногда проще там, где страница капризничает и требует «человеческих» действий.
На практике полезно разделять роли:
• Playwright — для массового обхода каталогов, фильтров и бесконечной подгрузки.
• Selenium — для страниц с тяжёлой логикой, старым DOM и нестандартными кликами.
• Скриншот/видео/HTML лучше забирать отдельно, а не надеяться на один универсальный метод.
Главные практические подвохи: lazy-load не всегда подгружается скроллом вниз, часть креативов лежит в iframe, а ссылки на медиа часто живут в атрибутах, а не в видимом тексте. Ещё одна ошибка — сразу парсить только DOM: рекламные библиотеки часто дорисовывают карточку позже, и пустой результат выглядит как «ничего нет», хотя данные просто не дождались.
Для стабильности парсеру нужны таймауты, повторные попытки и нормальная дедупликация по id, url и хэшу креатива. Иначе один и тот же объявленный блок будет дублироваться после каждого скролла или возврата на страницу.
Если делать свой обзор инструмента без лишней магии, начинайте с одного сценария: поиск, открытие карточки, сбор медиа и текста, сохранение метаданных. Когда этот путь стабилен, уже можно добавлять антидубли, очередь и экспорт в adlib.
Spy Tools Arsenal: AdHeart, BigSpy, Publer
@spy_tools_arsenal
Свой парсер креативов на Playwright и Selenium: где обычно ломается сбор
Этот пост опубликован в Telegram-канале Spy Tools Arsenal: AdHeart, BigSpy, Publer. Подписаться можно по ссылке: @spy_tools_arsenal.