← Research Lab·Research Lab · Технический гайд

Доступ AI-ботов: robots.txt для GPTBot, ClaudeBot, PerplexityBot, CCBot

robots.txt решает, какие агенты могут читать ваш контент. Это дешёвая проверка GEO-аудита и частая точка незаметной потери видимости.

Май 2026·8 мин чтения

Контекст / Проблема

Видимость против обучения

Вы хотите попасть в AI-поиск, но не хотите бесплатно отдавать контент в обучение чужих моделей.

Десятки user-agent'ов

В логах десятки user-agent'ов, и непонятно, какой блокировать, а какой пропускать.

robots.txt не рубильник

robots.txt кажется универсальным рубильником - но часть запросов его игнорирует на законных основаниях.

Ключевое различие: обучение, поиск и запрос пользователя

Тезис: у крупных AI-компаний краулеры разделены по назначению, и блокировать их «оптом» - ошибка. Аргумент: бот для обучения модели и бот для индексации в AI-поиске - это разные user-agent'ы с разной политикой. Доказательство: OpenAI явно рекомендует разрешать OAI-SearchBot для видимости в поиске ChatGPT, но запрещать GPTBot, если вы не хотите попадать в обучающие данные [70].

Тезис: запросы, инициированные пользователем, - отдельная категория. Аргумент: когда человек просит ассистента открыть страницу, это не массовый краул, а действие пользователя. Доказательство: OpenAI отмечает, что для ChatGPT-User «правила robots.txt могут не применяться», а Perplexity прямо пишет, что Perplexity-User «как правило игнорирует robots.txt», поскольку «фетч запросил пользователь» [74].

Таблица user-agent'ов основных AI-краулеров

GPTBot

Оператор: OpenAI. Идентификатор: +https://openai.com/gptbot. Назначение: сбор контента для обучения foundation-моделей. Подчиняется robots.txt: Да - Disallow, чтобы исключить из обучения.

OAI-SearchBot

Оператор: OpenAI. Идентификатор: +https://openai.com/searchbot. Назначение: индексация для поиска внутри ChatGPT. Подчиняется robots.txt: Да - Allow для видимости в поиске.

ChatGPT-User

Оператор: OpenAI. Идентификатор: +https://openai.com/bot. Назначение: переход по странице по запросу пользователя. Подчиняется robots.txt: «Может не применяться» (инициирован пользователем).

OAI-AdsBot

Оператор: OpenAI. Идентификатор: +https://openai.com/adsbot. Назначение: проверка безопасности рекламных лендингов. Подчиняется robots.txt: применяется к страницам поданных объявлений.

PerplexityBot

Оператор: Perplexity. Идентификатор: +https://perplexity.ai/perplexitybot. Назначение: индексация и ссылки в поиске Perplexity (не для обучения моделей). Подчиняется robots.txt: Да - рекомендуется Allow.

Perplexity-User

Оператор: Perplexity. Идентификатор: +https://perplexity.ai/perplexity-user. Назначение: посещение страницы по вопросу пользователя. Подчиняется robots.txt: «Как правило игнорирует» (инициирован пользователем).

ClaudeBot

Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: сбор веб-контента для обучения и разработки моделей. Подчиняется robots.txt: Да - соблюдает «do not crawl» в robots.txt.

Claude-User

Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: получение сайтов по прямому запросу пользователей Claude. Подчиняется robots.txt: действие пользователя.

Claude-SearchBot

Оператор: Anthropic. Идентификатор: claude.com/crawling/bots.json. Назначение: индексация для качества результатов поиска. Подчиняется robots.txt: Да.

Googlebot

Оператор: Google. Идентификатор: общий поисковый краулер. Назначение: Поиск, Images, Video, News, Discover (вкл. AI Overviews/AI Mode). Подчиняется robots.txt: Да.

Google-Extended

Оператор: Google. Идентификатор: управляет только обучением. Назначение: обучение будущих Gemini и grounding в Gemini Apps / Vertex AI. Подчиняется robots.txt: Да - не влияет на ранжирование и AI Overviews.

GoogleOther

Оператор: Google. Идентификатор: generic-краулер. Назначение: разовые исследовательские краулы. Подчиняется robots.txt: Да - не влияет на конкретный продукт.

CCBot

Оператор: Common Crawl. Идентификатор: CCBot/2.0 (https://commoncrawl.org/faq/). Назначение: открытый веб-датасет (используется в т.ч. для исследований). Подчиняется robots.txt: Да - Disallow для блокировки.

Источники user-agent'ов: OpenAI [70], Perplexity [74], Anthropic [75], Google [76], Common Crawl [77].

Готовые директивы robots.txt

Ниже - пример политики, не универсальная рекомендация: подбирайте директивы под свои цели и юрисдикцию.

Пример политики «заблокировать обучение, но остаться в AI-поиске» (директивы перечислены инлайн): «User-agent: GPTBot · Disallow: /» · «User-agent: Google-Extended · Disallow: /» · «User-agent: CCBot · Disallow: /» · «User-agent: OAI-SearchBot · Allow: /» · «User-agent: PerplexityBot · Allow: /».

Пример политики «ограничить нагрузку ClaudeBot вместо полной блокировки» (по документации Anthropic): «User-agent: ClaudeBot · Crawl-delay: 1».

Каждая директива - это компромисс, а не бесплатное улучшение.

Disallow для GPTBot / CCBot

Что даёт: privacy и training opt-out - контент не уходит в обучающие датасеты OpenAI и открытый веб-датасет Common Crawl. Чем платите: снижение AI-discoverability вне Google Search - меньше шансов быть процитированным в ChatGPT и продуктах на базе Common Crawl.

Disallow для Google-Extended

Что даёт: opt-out из обучения будущих Gemini и grounding в Gemini Apps / Vertex AI. Чем платите: не влияет на Google Search AI Overviews и ранжирование - то есть не решает задачу «убрать сайт из AI-ответов Google».

Allow для OAI-SearchBot / PerplexityBot

Что даёт: видимость и цитирование в поиске ChatGPT и Perplexity. Чем платите: эти платформы продолжают индексировать контент; контроль над тем, как он переформулируется в ответе, остаётся ограниченным.

Важная деталь про Google

Тезис: Google-Extended - это не выключатель AI Overviews. Аргумент: Google явно заявляет, что «Google-Extended не влияет на включение сайта в Google Поиск и не используется как сигнал ранжирования». Доказательство: блокировка Google-Extended убирает контент только из обучения Gemini и grounding в Vertex AI, но AI Overviews строятся на основном индексе Googlebot [76]. Это позиция самой платформы Google, а не независимая оценка.

Пределы robots.txt: чего файл не делает

Тезис: robots.txt - это запрос, а не техническая блокировка. Аргумент: соблюдение зависит от добросовестности оператора, а user-инициированные фетчи легально его обходят. Доказательство: OpenAI и Perplexity прямо документируют, что ChatGPT-User и Perplexity-User могут не подчиняться robots.txt, потому что действие инициировано человеком [70, 74].

Тезис: подделка user-agent существует, и блокировка по строке ненадёжна. Аргумент: боты могут маскироваться под легитимные. Доказательство: Common Crawl предупреждает о «краулерах, ложно идентифицирующих себя как CCBot», и предлагает сверять IP по index.commoncrawl.org/ccbot.json; Anthropic аналогично рекомендует проверять подлинность по своему списку IP, а не по IP-блокировке [77, 75].

E-E-A-T: официальные источники

OpenAI

Официальная документация ботов - Имена и назначение GPTBot/OAI-SearchBot/ChatGPT-User [70].

Perplexity

Официальный гайд по ботам - Политика robots.txt для PerplexityBot/Perplexity-User [74].

Anthropic

Справочная статья поддержки - ClaudeBot/Claude-User/Claude-SearchBot, Crawl-delay [75].

Google

Документация для разработчиков - Google-Extended не влияет на ранжирование [76].

Common Crawl

Страница CCBot - User-agent CCBot, блокировка, верификация IP [77].

Все приведённые правила и формулировки - это официальная позиция соответствующих платформ; политики могут меняться, проверяйте первоисточники перед внедрением.

Частые вопросы

Как остаться в AI-поиске, но не попасть в обучение моделей?

Запретите обучающие боты (GPTBot, Google-Extended, CCBot) и разрешите поисковые (OAI-SearchBot, PerplexityBot). Это разные user-agent'ы с разной политикой.

Блокировка Google-Extended уберёт меня из AI Overviews?

Нет. Google заявляет, что Google-Extended не влияет на включение в Поиск и ранжирование. AI Overviews строятся на индексе Googlebot, а не на Google-Extended.

Почему AI-ассистент открыл страницу, закрытую в robots.txt?

Если переход инициировал пользователь (ChatGPT-User, Perplexity-User), robots.txt может не применяться - это документированное поведение OpenAI и Perplexity.

Можно ли блокировать AI-ботов по IP-адресу?

Ненадёжно. Anthropic и Common Crawl предупреждают о подделке user-agent и рекомендуют сверять запросы с официальными списками IP, а не блокировать диапазоны вручную.

Источники (E-E-A-T)

70 · OpenAI, Current version

OpenAI crawlers and user agents. https://developers.openai.com/api/docs/bots - официальный документ платформы.

74 · Perplexity Help Center, Current version

How does Perplexity follow robots.txt? https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt - официальный документ платформы.

75 · Anthropic Support, Current version

Does Anthropic crawl data from the web and how can site owners block the crawler? https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler - официальный документ платформы.

76 · Google Search Central, 2026

Overview of Google crawlers and fetchers. https://developers.google.com/crawling/docs/crawlers-fetchers/overview-google-crawlers - официальный документ платформы.

77 · Common Crawl, Current version

CCBot documentation. https://commoncrawl.org/ccbot - официальный документ data infrastructure.

Как мы проверяли материал

Автор

Редакция Enigma.

Опубликовано

18 мая 2026.

Обновлено

18 мая 2026.

Источники

peer-reviewed, препринты и industry research - тип указан рядом с каждым утверждением.

Сверка

ключевые тезисы сверены с актуальной документацией Google Search Central (май 2026).

Оговорка

препринты и отраслевые отчёты приведены с методологическими ограничениями; проверяйте выводы на своём проекте.

Полный перечень источников и уровни надёжности - в каталоге исследований.