robots, sitemap, canonical и индексация: как не запутать поисковик в структуре сайта
У этих терминов разные роли:
— robots.txt управляет обходом страниц, но не гарантирует удаление URL из индекса.
— sitemap.xml сообщает поисковику, какие адреса сайта важны для обнаружения.
— canonical указывает предпочтительную версию страницы среди похожих URL.
— Индексация — попадание страницы в поисковую базу, откуда она может участвовать в выдаче.
Рабочая логика такая: в sitemap добавляют доступные и полезные страницы, в robots.txt не закрывают от обхода нужные разделы, а canonical ставят на основную версию контента. Если страницу нужно исключить из индекса, одного запрета в robots.txt недостаточно: поисковик может узнать о URL из внешних ссылок или sitemap.
Типовые ошибки:
— закрыть в robots.txt страницу, на которой размещён canonical;
— добавить в sitemap URL с редиректом, ошибкой или запретом индексации;
— поставить всем страницам сайта canonical на главную;
— оставить несколько версий одного материала без понятного основного адреса;
— считать наличие URL в sitemap гарантией индексации.
Проверяйте связку целиком: URL должен открываться для поискового робота, отдавать корректный ответ сервера, иметь релевантный canonical и попадать в sitemap только при необходимости. После изменений смотрите не на один файл, а на результат обхода и статус конкретных страниц.
Главное правило: robots отвечает за обход, sitemap — за подсказку, canonical — за выбор версии, а индексация зависит от качества и доступности страницы.
Кустов и технический SEO
@kustov_seo_technical
robots, sitemap, canonical и индексация: как не запутать поисковик в структуре сайта
Этот пост опубликован в Telegram-канале Кустов и технический SEO. Подписаться можно по ссылке: @kustov_seo_technical.