robots.txt решает, какие агенты могут читать ваш контент. Это дешёвая проверка GEO-аудита и частая точка незаметной потери видимости.
Вы хотите попасть в AI-поиск, но не хотите бесплатно отдавать контент в обучение чужих моделей.
В логах десятки user-agent'ов, и непонятно, какой блокировать, а какой пропускать.
robots.txt кажется универсальным рубильником - но часть запросов его игнорирует на законных основаниях.
Тезис: у крупных AI-компаний краулеры разделены по назначению, и блокировать их «оптом» - ошибка. Аргумент: бот для обучения модели и бот для индексации в AI-поиске - это разные user-agent'ы с разной политикой. Доказательство: OpenAI явно рекомендует разрешать OAI-SearchBot для видимости в поиске ChatGPT, но запрещать GPTBot, если вы не хотите попадать в обучающие данные [70].
Тезис: запросы, инициированные пользователем, - отдельная категория. Аргумент: когда человек просит ассистента открыть страницу, это не массовый краул, а действие пользователя. Доказательство: OpenAI отмечает, что для ChatGPT-User «правила robots.txt могут не применяться», а Perplexity прямо пишет, что Perplexity-User «как правило игнорирует robots.txt», поскольку «фетч запросил пользователь» [74].
Оператор: OpenAI. Идентификатор: +https://openai.com/gptbot. Назначение: сбор контента для обучения foundation-моделей. Подчиняется robots.txt: Да - Disallow, чтобы исключить из обучения.
Оператор: OpenAI. Идентификатор: +https://openai.com/searchbot. Назначение: индексация для поиска внутри ChatGPT. Подчиняется robots.txt: Да - Allow для видимости в поиске.
Оператор: OpenAI. Идентификатор: +https://openai.com/bot. Назначение: переход по странице по запросу пользователя. Подчиняется robots.txt: «Может не применяться» (инициирован пользователем).
Оператор: OpenAI. Идентификатор: +https://openai.com/adsbot. Назначение: проверка безопасности рекламных лендингов. Подчиняется robots.txt: применяется к страницам поданных объявлений.
Оператор: Perplexity. Идентификатор: +https://perplexity.ai/perplexitybot. Назначение: индексация и ссылки в поиске Perplexity (не для обучения моделей). Подчиняется robots.txt: Да - рекомендуется Allow.
Оператор: Perplexity. Идентификатор: +https://perplexity.ai/perplexity-user. Назначение: посещение страницы по вопросу пользователя. Подчиняется robots.txt: «Как правило игнорирует» (инициирован пользователем).
Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: сбор веб-контента для обучения и разработки моделей. Подчиняется robots.txt: Да - соблюдает «do not crawl» в robots.txt.
Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: получение сайтов по прямому запросу пользователей Claude. Подчиняется robots.txt: действие пользователя.
Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: индексация для качества результатов поиска. Подчиняется robots.txt: Да.
Оператор: Google. Идентификатор: общий поисковый краулер. Назначение: Поиск, Images, Video, News, Discover (вкл. AI Overviews/AI Mode). Подчиняется robots.txt: Да.
Оператор: Google. Идентификатор: управляет только обучением. Назначение: обучение будущих Gemini и grounding в Gemini Apps / Vertex AI. Подчиняется robots.txt: Да - не влияет на ранжирование и AI Overviews.
Оператор: Google. Идентификатор: generic-краулер. Назначение: разовые исследовательские краулы. Подчиняется robots.txt: Да - не влияет на конкретный продукт.
Оператор: Common Crawl. Идентификатор: CCBot/2.0 (https://commoncrawl.org/faq/). Назначение: открытый веб-датасет (используется в т.ч. для исследований). Подчиняется robots.txt: Да - Disallow для блокировки.
Источники user-agent'ов: OpenAI [70], Perplexity [74], Anthropic [75], Google [76], Common Crawl [77].
Ниже - пример политики, не универсальная рекомендация: подбирайте директивы под свои цели и юрисдикцию.
Пример политики «заблокировать обучение, но остаться в AI-поиске» (директивы перечислены инлайн): «User-agent: GPTBot · Disallow: /» · «User-agent: Google-Extended · Disallow: /» · «User-agent: CCBot · Disallow: /» · «User-agent: OAI-SearchBot · Allow: /» · «User-agent: PerplexityBot · Allow: /».
Пример политики «ограничить нагрузку ClaudeBot вместо полной блокировки» (по документации Anthropic): «User-agent: ClaudeBot · Crawl-delay: 1».
Каждая директива - это компромисс, а не бесплатное улучшение.
Что даёт: privacy и training opt-out - контент не уходит в обучающие датасеты OpenAI и открытый веб-датасет Common Crawl. Чем платите: снижение AI-discoverability вне Google Search - меньше шансов быть процитированным в ChatGPT и продуктах на базе Common Crawl.
Что даёт: opt-out из обучения будущих Gemini и grounding в Gemini Apps / Vertex AI. Чем платите: не влияет на Google Search AI Overviews и ранжирование - то есть не решает задачу «убрать сайт из AI-ответов Google».
Что даёт: видимость и цитирование в поиске ChatGPT и Perplexity. Чем платите: эти платформы продолжают индексировать контент; контроль над тем, как он переформулируется в ответе, остаётся ограниченным.
Тезис: Google-Extended - это не выключатель AI Overviews. Аргумент: Google явно заявляет, что «Google-Extended не влияет на включение сайта в Google Поиск и не используется как сигнал ранжирования». Доказательство: блокировка Google-Extended убирает контент только из обучения Gemini и grounding в Vertex AI, но AI Overviews строятся на основном индексе Googlebot [76]. Это позиция самой платформы Google, а не независимая оценка.
Тезис: robots.txt - это запрос, а не техническая блокировка. Аргумент: соблюдение зависит от добросовестности оператора, а user-инициированные фетчи легально его обходят. Доказательство: OpenAI и Perplexity прямо документируют, что ChatGPT-User и Perplexity-User могут не подчиняться robots.txt, потому что действие инициировано человеком [70, 74].
Тезис: подделка user-agent существует, и блокировка по строке ненадёжна. Аргумент: боты могут маскироваться под легитимные. Доказательство: Common Crawl предупреждает о «краулерах, ложно идентифицирующих себя как CCBot», и предлагает сверять IP по index.commoncrawl.org/ccbot.json; Anthropic аналогично рекомендует проверять подлинность по своему списку IP, а не по IP-блокировке [77, 75].
Официальная документация ботов - Имена и назначение GPTBot/OAI-SearchBot/ChatGPT-User [70].
Официальный гайд по ботам - Политика robots.txt для PerplexityBot/Perplexity-User [74].
Справочная статья поддержки - ClaudeBot/Claude-User/Claude-SearchBot, Crawl-delay [75].
Документация для разработчиков - Google-Extended не влияет на ранжирование [76].
Страница CCBot - User-agent CCBot, блокировка, верификация IP [77].
Все приведённые правила и формулировки - это официальная позиция соответствующих платформ; политики могут меняться, проверяйте первоисточники перед внедрением.
Запретите обучающие боты (GPTBot, Google-Extended, CCBot) и разрешите поисковые (OAI-SearchBot, PerplexityBot). Это разные user-agent'ы с разной политикой.
Нет. Google заявляет, что Google-Extended не влияет на включение в Поиск и ранжирование. AI Overviews строятся на индексе Googlebot, а не на Google-Extended.
Если переход инициировал пользователь (ChatGPT-User, Perplexity-User), robots.txt может не применяться - это документированное поведение OpenAI и Perplexity.
Ненадёжно. Anthropic и Common Crawl предупреждают о подделке user-agent и рекомендуют сверять запросы с официальными списками IP, а не блокировать диапазоны вручную.
OpenAI crawlers and user agents. https://developers.openai.com/api/docs/bots - официальный документ платформы.
How does Perplexity follow robots.txt? https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt - официальный документ платформы.
Does Anthropic crawl data from the web and how can site owners block the crawler? https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler - официальный документ платформы.
Overview of Google crawlers and fetchers. https://developers.google.com/crawling/docs/crawlers-fetchers/overview-google-crawlers - официальный документ платформы.
CCBot documentation. https://commoncrawl.org/ccbot - официальный документ data infrastructure.
Редакция Enigma.
18 мая 2026.
18 мая 2026.
peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением.
ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026).
препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте.
Полный перечень источников и уровни надёжности - в каталоге исследований.