ИИ-агенты уже не просто «сканируют сайт», а пытаются потреблять его как источник данных. И вот тут привычный robots.txt внезапно оказывается слишком грубым инструментом.
Из практики я вижу простую схему:
- robots.txt — для классических краулеров и базового запрета на обход
- llms.txt — попытка явно показать, что можно читать, а что лучше не трогать
- server-side контроль — когда важны не декларации, а реальные правила доступа, лимиты и логика по User-Agent
Проблема в том, что у LLM-агента нет одной универсальной «этичной» модели поведения. Один сервис уважает ограничения, другой частично игнорирует, третий вообще приходит через промежуточные запросы. Поэтому на уровне проекта я бы не рассчитывал на один файл в корне сайта как на защиту.
Если сайт — это контент, документация или база знаний, контроль агентов надо проектировать так же, как доступ CRM или API: по слоям. Иначе однажды вы обнаружите, что ваш контент уже «прочитан», но по вашим правилам — нет.
Битрикс Stack
@BitrixStackPro
ИИ-агенты уже не просто «сканируют сайт», а пытаются потреблять его как источник данных. И вот тут привычный r
Этот пост опубликован в Telegram-канале Битрикс Stack. Подписаться можно по ссылке: @BitrixStackPro.