robots.txt впливає на поведінку конкретних краулерів, а не працює як єдиний рубильник. Google-Extended керує використанням контенту для навчання та grounding Gemini Apps і Vertex AI, але НЕ керує включенням у Google Search AI Overviews; для AI-функцій самого Google Search ключовими залишаються Googlebot і eligibility сторінки (індексація плюс можливість показу сніпета). Щоб коректно керувати видимістю, потрібно знати точні імена ботів і розуміти, де правила не діють.
Ви хочете потрапити в AI-пошук, але не хочете безкоштовно віддавати контент у навчання чужих моделей.
У логах десятки user-agent’ів, і незрозуміло, який блокувати, а який пропускати.
robots.txt здається універсальним рубильником, але для деяких user-initiated fetchers правила можуть застосовуватися інакше залежно від політики платформи.
Теза: у великих AI-компаній краулери розділені за призначенням, і блокувати їх «гуртом» - помилка. Аргумент: бот для навчання моделі й бот для індексації в AI-пошуку - це різні user-agent’и з різною політикою. Доказ: OpenAI явно рекомендує дозволяти OAI-SearchBot для видимості в пошуку ChatGPT, але забороняти GPTBot, якщо ви не хочете потрапляти в навчальні дані [70].
Теза: запити, ініційовані користувачем, - окрема категорія. Аргумент: коли людина просить асистента відкрити сторінку, це не масовий краул, а дія користувача. Доказ: OpenAI зазначає, що для ChatGPT-User «правила robots.txt можуть не застосовуватися», а Perplexity прямо пише, що Perplexity-User «як правило ігнорує robots.txt», оскільки «фетч запросив користувач» [74].
Оператор: OpenAI. Ідентифікатор: +https://openai.com/gptbot. Призначення: збір контенту для навчання foundation-моделей. Підкоряється robots.txt: Так - Disallow, щоб виключити з навчання.
Оператор: OpenAI. Ідентифікатор: +https://openai.com/searchbot. Призначення: індексація для пошуку всередині ChatGPT. Підкоряється robots.txt: Так - Allow для видимості в пошуку.
Оператор: OpenAI. Ідентифікатор: +https://openai.com/bot. Призначення: перехід на сторінку за запитом користувача. Підкоряється robots.txt: «Може не застосовуватися» (ініційований користувачем).
Оператор: OpenAI. Ідентифікатор: +https://openai.com/adsbot. Призначення: перевірка безпеки рекламних лендингів. Підкоряється robots.txt: застосовується до сторінок поданих оголошень.
Оператор: Perplexity. Ідентифікатор: +https://perplexity.ai/perplexitybot. Призначення: індексація та посилання в пошуку Perplexity (не для навчання моделей). Підкоряється robots.txt: Так - рекомендується Allow.
Оператор: Perplexity. Ідентифікатор: +https://perplexity.ai/perplexity-user. Призначення: відвідування сторінки за питанням користувача. Підкоряється robots.txt: «Як правило ігнорує» (ініційований користувачем).
Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: збір веб-контенту для навчання та розробки моделей. Підкоряється robots.txt: Так - дотримується «do not crawl» у robots.txt.
Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: отримання сайтів за прямим запитом користувачів Claude. Підкоряється robots.txt: дія користувача.
Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: індексація для якості результатів пошуку. Підкоряється robots.txt: Так.
Оператор: Google. Ідентифікатор: загальний пошуковий краулер. Призначення: Пошук, Images, Video, News, Discover (вкл. AI Overviews/AI Mode). Підкоряється robots.txt: Так.
Оператор: Google. Ідентифікатор: керує лише навчанням. Призначення: навчання майбутніх Gemini і grounding у Gemini Apps / Vertex AI. Підкоряється robots.txt: Так - не впливає на ранжування й AI Overviews.
Оператор: Google. Ідентифікатор: generic-краулер. Призначення: разові дослідницькі краули. Підкоряється robots.txt: Так - не впливає на конкретний продукт.
Оператор: Common Crawl. Ідентифікатор: CCBot/2.0 (https://commoncrawl.org/faq/). Призначення: відкритий веб-датасет (використовується в т.ч. для досліджень). Підкоряється robots.txt: Так - Disallow для блокування.
Джерела user-agent’ів: OpenAI [70], Perplexity [74], Anthropic [75], Google [76], Common Crawl [77].
Нижче - приклад політики, не універсальна рекомендація: підбирайте директиви під свої цілі та юрисдикцію.
Приклад політики «заблокувати навчання, але залишитися в AI-пошуку» (директиви перелічені інлайн): «User-agent: GPTBot · Disallow: /» · «User-agent: Google-Extended · Disallow: /» · «User-agent: CCBot · Disallow: /» · «User-agent: OAI-SearchBot · Allow: /» · «User-agent: PerplexityBot · Allow: /».
Приклад політики «обмежити навантаження ClaudeBot замість повного блокування» (за документацією Anthropic): «User-agent: ClaudeBot · Crawl-delay: 1».
Кожна директива - це компроміс, а не безкоштовне покращення.
Що дає: training opt-out для OpenAI і обмеження майбутнього включення у відкритий веб-датасет Common Crawl; нові краули не мають збирати контент для відповідного призначення. Чим платите: це не означає автоматичного видалення вже зібраних копій або старих архівів; знижуються шанси бути процитованим у ChatGPT і продуктах на базі Common Crawl поза Google Search.
Що дає: opt-out з навчання майбутніх Gemini і grounding у Gemini Apps / Vertex AI. Чим платите: не впливає на Google Search AI Overviews і ранжування - тобто не вирішує задачу «прибрати сайт з AI-відповідей Google».
Що дає: видимість і цитування в пошуку ChatGPT і Perplexity. Чим платите: ці платформи продовжують індексувати контент; контроль над тим, як він переформульовується у відповіді, залишається обмеженим.
Теза: Google-Extended - це не вимикач AI Overviews. Аргумент: Google явно заявляє, що «Google-Extended не впливає на включення сайту в Google Пошук і не використовується як сигнал ранжування». Доказ: блокування Google-Extended прибирає контент лише з навчання Gemini і grounding у Vertex AI, але AI Overviews будуються на основному індексі Googlebot [76]. Це позиція самої платформи Google, а не незалежна оцінка.
Теза: robots.txt - це запит, а не технічне блокування. Аргумент: дотримання залежить від добросовісності оператора, а user-initiated fetchers легально його обходять. Доказ: OpenAI і Perplexity прямо документують, що ChatGPT-User і Perplexity-User можуть не підкорятися robots.txt, тому що дія ініційована людиною [70, 74].
Теза: підробка user-agent існує, і блокування за рядком ненадійне. Аргумент: боти можуть маскуватися під легітимні. Доказ: Common Crawl попереджає про «краулери, які хибно ідентифікують себе як CCBot», і пропонує звіряти IP за index.commoncrawl.org/ccbot.json; Anthropic аналогічно рекомендує перевіряти автентичність за своїм списком IP, а не за IP-блокуванням [77, 75].
Офіційна документація ботів - Імена та призначення GPTBot/OAI-SearchBot/ChatGPT-User [70].
Офіційний гайд по ботах - Політика robots.txt для PerplexityBot/Perplexity-User [74].
Довідкова стаття підтримки - ClaudeBot/Claude-User/Claude-SearchBot, Crawl-delay [75].
Документація для розробників - Google-Extended не впливає на ранжування [76].
Сторінка CCBot - User-agent CCBot, блокування, верифікація IP [77].
Усі наведені правила та формулювання - це офіційна позиція відповідних платформ; політики можуть змінюватися, перевіряйте першоджерела перед впровадженням.
Забороніть навчальні боти (GPTBot, Google-Extended, CCBot) і дозвольте пошукові (OAI-SearchBot, PerplexityBot). Це різні user-agent’и з різною політикою.
Ні. Google заявляє, що Google-Extended не впливає на включення в Пошук і ранжування. AI Overviews будуються на індексі Googlebot, а не на Google-Extended.
Якщо перехід ініціював користувач (ChatGPT-User, Perplexity-User), robots.txt може не застосовуватися - це задокументована поведінка OpenAI і Perplexity.
Ненадійно. Anthropic і Common Crawl попереджають про підробку user-agent і рекомендують звіряти запити з офіційними списками IP, а не блокувати діапазони вручну.
OpenAI crawlers and user agents. https://developers.openai.com/api/docs/bots - офіційний документ платформи.
How does Perplexity follow robots.txt? https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt - офіційний документ платформи.
Does Anthropic crawl data from the web and how can site owners block the crawler? https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler - офіційний документ платформи.
Overview of Google crawlers and fetchers. https://developers.google.com/crawling/docs/crawlers-fetchers/overview-google-crawlers - офіційний документ платформи.
CCBot documentation. https://commoncrawl.org/ccbot - офіційний документ data infrastructure.
Редакція Enigma.
18 травня 2026.
19 травня 2026.
peer-reviewed, препринти та industry research - тип указано поряд із кожним твердженням.
ключові тези звірені з актуальною документацією Google Search Central (травень 2026).
препринти та галузеві звіти наведені з методологічними обмеженнями; перевіряйте висновки на своєму проєкті.
Повний перелік джерел і рівні надійності - у каталозі досліджень.