← Research Lab·Research Lab · Технічний гайд

Доступ AI-ботів: robots.txt для GPTBot, ClaudeBot, PerplexityBot, CCBot

robots.txt вирішує, які агенти можуть читати ваш контент. Це найдешевша перевірка GEO-аудиту - і часта точка непомітної втрати видимості.

Трав. 2026·6 хв читання

Різні AI-платформи використовують різні user agents і різні цілі crawling. Заблокований бот не вилучить контент; але robots.txt - це контроль доступу, а не видалення сторінки з Search. Невідповідність robots.txt цілям видимості - типова й дешева для виправлення помилка.

У кожної платформи - свій агент

Немає одного «AI-бота». OpenAI документує власні crawlers: GPTBot (тренувальний) і OAI-SearchBot (для search-сценаріїв) [70]. Anthropic описує ClaudeBot, Claude-User і Claude-SearchBot - окремий search crawler; його блокування може знизити видимість у Claude search-подібних сценаріях [75]. У Perplexity розрізняються PerplexityBot (surfacing/linking, керується robots.txt) і Perplexity-User (user-requested fetch, зазвичай ігнорує robots.txt) [74]. Політику задають по кожному агенту окремо, а не «для AI взагалі».

Що саме робить robots.txt

robots.txt керує доступом краулера до URL, але не утримує сторінку поза індексом. Огляд Google crawlers and fetchers пояснює, які агенти Google використовують для різних задач [76]. Заблокований URL усе одно може зʼявитися без опису, якщо на нього посилаються інші сторінки. Для повного виключення з Search потрібні noindex або password protection - robots.txt тут не інструмент.

Карта основних агентів

GPTBot / OAI-SearchBot

Тренувальний crawler і search-агент OpenAI [70].

ClaudeBot / Claude-User / Claude-SearchBot

Crawling Anthropic; окремий search crawler [75].

PerplexityBot / Perplexity-User

Surfacing/linking (robots.txt) і user-requested fetch (зазвичай ігнорує robots.txt) [74].

Googlebot та fetchers

Різні задачі Google, включно з AI-функціями [76].

Bingbot

База для Microsoft Copilot та AI-search [71].

CCBot (Common Crawl)

Відкритий веб-корпус, що живить багато систем [77].

Чому Common Crawl окремо важливий

Блокування «живих» AI-ботів не дорівнює відсутності в їхніх даних. Common Crawl документує CCBot - інфраструктуру відкритих веб-даних, на яку спираються багато AI-систем і дослідницьких проєктів [77]. Рішення щодо CCBot - окреме стратегічне рішення, відмінне від доступу для GPTBot чи ClaudeBot.

Bing як база Copilot

Видимість у Microsoft-екосистемі починається з класичних правил. Bing Webmaster Guidelines описують вимоги до якості, crawling, indexing і неприпустимі практики [71]. Через звʼязок Bing із Copilot ці правила лишаються базовим рівнем доступу для відповідних AI-продуктів.

Джерела (E-E-A-T)

70 · OpenAI

Crawlers і user agents (GPTBot, OAI-SearchBot). developers.openai.com/api/docs/bots

71 · Microsoft Bing

Webmaster Guidelines (якість, crawling).

74 · Perplexity

PerplexityBot / Perplexity-User і robots.txt.

75 · Anthropic

ClaudeBot / Claude-User / Claude-SearchBot і блокування.

76 · Google Search Central

Огляд краулерів і fetcher-ів.

77 · Common Crawl

Документація CCBot. commoncrawl.org/ccbot

Часті питання

Чи можна сховати сторінку від Google через robots.txt?

Ні. robots.txt керує доступом краулера, але не видаляє URL із Search: заблокований URL може зʼявитися без опису. Для виключення потрібні noindex або password protection [76].

Чи достатньо одного правила «для AI-ботів»?

Ні. GPTBot, ClaudeBot, PerplexityBot, Googlebot і CCBot - різні агенти з різними цілями; політику задають по кожному окремо [70, 74, 75].

Якщо заблокувати ClaudeBot, контент зникне з усіх AI?

Ні. Блокування одного «живого» агента не прибирає контент із відкритих корпусів на кшталт Common Crawl, якими користуються інші системи [77].

З чого почати GEO-аудит доступу?

З перевірки robots.txt і firewall для Google, Bing, OpenAI, Perplexity, Anthropic і CCBot - це одна з перших і найдешевших перевірок [76, 71].