Как автоматом находить битые ссылки на edu-доменах и не тратить день на ручной парсинг
Проверим, что отдает сервер, а не что написано в гайде.
Схема простая: собираешь edu-страницы по footprints, вытаскиваешь все внешние href и прогоняешь их через массовую проверку статусов. Не нужен «умный» софт — нужен нормальный пайплайн: парсер HTML, дедупликация URL, проверка ответов 200/301/404/410/5xx. Битая ссылка — это не только 404, но и редиректная петля, таймаут или мусорный 302 на несуществующий ресурс.
Дальше фильтруешь шум:
• отсекай mailto:, javascript:, PDF и соцсети;
• отдельно помечай ссылки с параметрами — там чаще ломается трекинг;
• игнорируй internal anchors, если задача именно в исходящих донорских;
• проверяй, есть ли у страницы несколько дублей: одна и та же битая цель часто размазана по десяткам кафедр.
Самый жирный пласт — старые resource pages, списки литературы, каталоги лабораторий и страницы факультетских архивов. Они долго живут без ревизии и дают ссылки, которые умерли еще до того, как кто-то вспомнил про редиректы. Ссылка с профиля .edu — это не просто траст, это математика.
Дальше уже рутина: сохраняешь URL страницы-донорa, анкор, статус цели и тип битости. Потом вручную добиваешь только те, где есть шанс на замену. В этой нише выживают только те, кто умеет находить неочевидные точки входа.
Scholar-ссылки
@scholar_links_ubt
Как автоматом находить битые ссылки на edu-доменах и не тратить день на ручной парсинг
Этот пост опубликован в Telegram-канале Scholar-ссылки. Подписаться можно по ссылке: @scholar_links_ubt.