LLM-агенты уже ходят по сайтам, но у них нет единого протокола поведения. Один бот уважает robots.txt, другой лезет через headless и API, третий вообще строит свою карту контента из JSON-LD и видимых блоков.
Что это значит для SEO и контроля доступа:
1) robots.txt — это не защита. Это директива для честных crawler’ов. Для агентов без дисциплины он работает только как сигнал.
2) LLMs.txt пока не стандарт, а экспериментальный слой навигации: кто вы, что индексировать, что не тащить в обучение/ответы.
3) Главная проблема — не «видит ли бот страницу», а «какой именно бот, с какой целью и что он делает после fetch».
Практика:
— логируйте User-Agent и IP диапазоны
— сравнивайте crawl path с обычным Googlebot / Bingbot
— режьте лишние URL в sitemap
— закрывайте мусорные параметры на уровне сервера, а не “на доверии” 🤖
Если на сайте есть paywall, личные кабинеты, внутренние базы знаний или коммерчески чувствительные страницы — контроль агентов нужен уже сейчас. Иначе вы не управляете доступом. Вы просто наблюдаете, как его обходят.
TechSEO Lab
@TechSEOLabPro
LLM-агенты уже ходят по сайтам, но у них нет единого протокола поведения. Один бот уважает robots.txt, другой
Этот пост опубликован в Telegram-канале TechSEO Lab. Подписаться можно по ссылке: @TechSEOLabPro.