← Тренди AI-пошуку·Блог · Тренди AI-пошуку

AI-краулери та robots.txt: практичний огляд для власника сайту

robots.txt впливає на поведінку конкретних краулерів, а не працює як єдиний рубильник. Google-Extended керує використанням контенту для навчання та grounding Gemini Apps і Vertex AI, але НЕ керує включенням у Google Search AI Overviews; для AI-функцій самого Google Search ключовими залишаються Googlebot і eligibility сторінки (індексація плюс можливість показу сніпета). Щоб коректно керувати видимістю, потрібно знати точні імена ботів і розуміти, де правила не діють.

Травень 2026·8 хв читання

Контекст / Проблема

Видимість проти навчання

Ви хочете потрапити в AI-пошук, але не хочете безкоштовно віддавати контент у навчання чужих моделей.

Десятки user-agent’ів

У логах десятки user-agent’ів, і незрозуміло, який блокувати, а який пропускати.

robots.txt не рубильник

robots.txt здається універсальним рубильником, але для деяких user-initiated fetchers правила можуть застосовуватися інакше залежно від політики платформи.

Ключова відмінність: навчання, пошук і запит користувача

Теза: у великих AI-компаній краулери розділені за призначенням, і блокувати їх «гуртом» - помилка. Аргумент: бот для навчання моделі й бот для індексації в AI-пошуку - це різні user-agent’и з різною політикою. Доказ: OpenAI явно рекомендує дозволяти OAI-SearchBot для видимості в пошуку ChatGPT, але забороняти GPTBot, якщо ви не хочете потрапляти в навчальні дані [70].

Теза: запити, ініційовані користувачем, - окрема категорія. Аргумент: коли людина просить асистента відкрити сторінку, це не масовий краул, а дія користувача. Доказ: OpenAI зазначає, що для ChatGPT-User «правила robots.txt можуть не застосовуватися», а Perplexity прямо пише, що Perplexity-User «як правило ігнорує robots.txt», оскільки «фетч запросив користувач» [74].

Таблиця user-agent’ів основних AI-краулерів

GPTBot

Оператор: OpenAI. Ідентифікатор: +https://openai.com/gptbot. Призначення: збір контенту для навчання foundation-моделей. Підкоряється robots.txt: Так - Disallow, щоб виключити з навчання.

OAI-SearchBot

Оператор: OpenAI. Ідентифікатор: +https://openai.com/searchbot. Призначення: індексація для пошуку всередині ChatGPT. Підкоряється robots.txt: Так - Allow для видимості в пошуку.

ChatGPT-User

Оператор: OpenAI. Ідентифікатор: +https://openai.com/bot. Призначення: перехід на сторінку за запитом користувача. Підкоряється robots.txt: «Може не застосовуватися» (ініційований користувачем).

OAI-AdsBot

Оператор: OpenAI. Ідентифікатор: +https://openai.com/adsbot. Призначення: перевірка безпеки рекламних лендингів. Підкоряється robots.txt: застосовується до сторінок поданих оголошень.

PerplexityBot

Оператор: Perplexity. Ідентифікатор: +https://perplexity.ai/perplexitybot. Призначення: індексація та посилання в пошуку Perplexity (не для навчання моделей). Підкоряється robots.txt: Так - рекомендується Allow.

Perplexity-User

Оператор: Perplexity. Ідентифікатор: +https://perplexity.ai/perplexity-user. Призначення: відвідування сторінки за питанням користувача. Підкоряється robots.txt: «Як правило ігнорує» (ініційований користувачем).

ClaudeBot

Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: збір веб-контенту для навчання та розробки моделей. Підкоряється robots.txt: Так - дотримується «do not crawl» у robots.txt.

Claude-User

Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: отримання сайтів за прямим запитом користувачів Claude. Підкоряється robots.txt: дія користувача.

Claude-SearchBot

Оператор: Anthropic. Ідентифікатор: claude.com/crawling/bots.json. Призначення: індексація для якості результатів пошуку. Підкоряється robots.txt: Так.

Googlebot

Оператор: Google. Ідентифікатор: загальний пошуковий краулер. Призначення: Пошук, Images, Video, News, Discover (вкл. AI Overviews/AI Mode). Підкоряється robots.txt: Так.

Google-Extended

Оператор: Google. Ідентифікатор: керує лише навчанням. Призначення: навчання майбутніх Gemini і grounding у Gemini Apps / Vertex AI. Підкоряється robots.txt: Так - не впливає на ранжування й AI Overviews.

GoogleOther

Оператор: Google. Ідентифікатор: generic-краулер. Призначення: разові дослідницькі краули. Підкоряється robots.txt: Так - не впливає на конкретний продукт.

CCBot

Оператор: Common Crawl. Ідентифікатор: CCBot/2.0 (https://commoncrawl.org/faq/). Призначення: відкритий веб-датасет (використовується в т.ч. для досліджень). Підкоряється robots.txt: Так - Disallow для блокування.

Джерела user-agent’ів: OpenAI [70], Perplexity [74], Anthropic [75], Google [76], Common Crawl [77].

Готові директиви robots.txt

Нижче - приклад політики, не універсальна рекомендація: підбирайте директиви під свої цілі та юрисдикцію.

Приклад політики «заблокувати навчання, але залишитися в AI-пошуку» (директиви перелічені інлайн): «User-agent: GPTBot · Disallow: /» · «User-agent: Google-Extended · Disallow: /» · «User-agent: CCBot · Disallow: /» · «User-agent: OAI-SearchBot · Allow: /» · «User-agent: PerplexityBot · Allow: /».

Приклад політики «обмежити навантаження ClaudeBot замість повного блокування» (за документацією Anthropic): «User-agent: ClaudeBot · Crawl-delay: 1».

Кожна директива - це компроміс, а не безкоштовне покращення.

Disallow для GPTBot / CCBot

Що дає: training opt-out для OpenAI і обмеження майбутнього включення у відкритий веб-датасет Common Crawl; нові краули не мають збирати контент для відповідного призначення. Чим платите: це не означає автоматичного видалення вже зібраних копій або старих архівів; знижуються шанси бути процитованим у ChatGPT і продуктах на базі Common Crawl поза Google Search.

Disallow для Google-Extended

Що дає: opt-out з навчання майбутніх Gemini і grounding у Gemini Apps / Vertex AI. Чим платите: не впливає на Google Search AI Overviews і ранжування - тобто не вирішує задачу «прибрати сайт з AI-відповідей Google».

Allow для OAI-SearchBot / PerplexityBot

Що дає: видимість і цитування в пошуку ChatGPT і Perplexity. Чим платите: ці платформи продовжують індексувати контент; контроль над тим, як він переформульовується у відповіді, залишається обмеженим.

Важлива деталь про Google

Теза: Google-Extended - це не вимикач AI Overviews. Аргумент: Google явно заявляє, що «Google-Extended не впливає на включення сайту в Google Пошук і не використовується як сигнал ранжування». Доказ: блокування Google-Extended прибирає контент лише з навчання Gemini і grounding у Vertex AI, але AI Overviews будуються на основному індексі Googlebot [76]. Це позиція самої платформи Google, а не незалежна оцінка.

Межі robots.txt: чого файл не робить

Теза: robots.txt - це запит, а не технічне блокування. Аргумент: дотримання залежить від добросовісності оператора, а user-initiated fetchers легально його обходять. Доказ: OpenAI і Perplexity прямо документують, що ChatGPT-User і Perplexity-User можуть не підкорятися robots.txt, тому що дія ініційована людиною [70, 74].

Теза: підробка user-agent існує, і блокування за рядком ненадійне. Аргумент: боти можуть маскуватися під легітимні. Доказ: Common Crawl попереджає про «краулери, які хибно ідентифікують себе як CCBot», і пропонує звіряти IP за index.commoncrawl.org/ccbot.json; Anthropic аналогічно рекомендує перевіряти автентичність за своїм списком IP, а не за IP-блокуванням [77, 75].

E-E-A-T: офіційні джерела

OpenAI

Офіційна документація ботів - Імена та призначення GPTBot/OAI-SearchBot/ChatGPT-User [70].

Perplexity

Офіційний гайд по ботах - Політика robots.txt для PerplexityBot/Perplexity-User [74].

Anthropic

Довідкова стаття підтримки - ClaudeBot/Claude-User/Claude-SearchBot, Crawl-delay [75].

Google

Документація для розробників - Google-Extended не впливає на ранжування [76].

Common Crawl

Сторінка CCBot - User-agent CCBot, блокування, верифікація IP [77].

Усі наведені правила та формулювання - це офіційна позиція відповідних платформ; політики можуть змінюватися, перевіряйте першоджерела перед впровадженням.

Часті питання

Як залишитися в AI-пошуку, але не потрапити в навчання моделей?

Забороніть навчальні боти (GPTBot, Google-Extended, CCBot) і дозвольте пошукові (OAI-SearchBot, PerplexityBot). Це різні user-agent’и з різною політикою.

Блокування Google-Extended прибере мене з AI Overviews?

Ні. Google заявляє, що Google-Extended не впливає на включення в Пошук і ранжування. AI Overviews будуються на індексі Googlebot, а не на Google-Extended.

Чому AI-асистент відкрив сторінку, закриту в robots.txt?

Якщо перехід ініціював користувач (ChatGPT-User, Perplexity-User), robots.txt може не застосовуватися - це задокументована поведінка OpenAI і Perplexity.

Чи можна блокувати AI-ботів за IP-адресою?

Ненадійно. Anthropic і Common Crawl попереджають про підробку user-agent і рекомендують звіряти запити з офіційними списками IP, а не блокувати діапазони вручну.

Джерела (E-E-A-T)

70 · OpenAI, Current version

OpenAI crawlers and user agents. https://developers.openai.com/api/docs/bots - офіційний документ платформи.

74 · Perplexity Help Center, Current version

How does Perplexity follow robots.txt? https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt - офіційний документ платформи.

75 · Anthropic Support, Current version

Does Anthropic crawl data from the web and how can site owners block the crawler? https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler - офіційний документ платформи.

76 · Google Search Central, 2026

Overview of Google crawlers and fetchers. https://developers.google.com/crawling/docs/crawlers-fetchers/overview-google-crawlers - офіційний документ платформи.

77 · Common Crawl, Current version

CCBot documentation. https://commoncrawl.org/ccbot - офіційний документ data infrastructure.

Як ми перевіряли матеріал

Автор

Редакція Enigma.

Опубліковано

18 травня 2026.

Оновлено

19 травня 2026.

Джерела

peer-reviewed, препринти та industry research - тип указано поряд із кожним твердженням.

Звірка

ключові тези звірені з актуальною документацією Google Search Central (травень 2026).

Застереження

препринти та галузеві звіти наведені з методологічними обмеженнями; перевіряйте висновки на своєму проєкті.

Повний перелік джерел і рівні надійності - у каталозі досліджень.