robots.txt вирішує, які агенти можуть читати ваш контент. Це найдешевша перевірка GEO-аудиту - і часта точка непомітної втрати видимості.
Різні AI-платформи використовують різні user agents і різні цілі crawling. Заблокований бот не вилучить контент; але robots.txt - це контроль доступу, а не видалення сторінки з Search. Невідповідність robots.txt цілям видимості - типова й дешева для виправлення помилка.
Немає одного «AI-бота». OpenAI документує власні crawlers: GPTBot (тренувальний) і OAI-SearchBot (для search-сценаріїв) [70]. Anthropic описує ClaudeBot, Claude-User і Claude-SearchBot - окремий search crawler; його блокування може знизити видимість у Claude search-подібних сценаріях [75]. У Perplexity розрізняються PerplexityBot (surfacing/linking, керується robots.txt) і Perplexity-User (user-requested fetch, зазвичай ігнорує robots.txt) [74]. Політику задають по кожному агенту окремо, а не «для AI взагалі».
robots.txt керує доступом краулера до URL, але не утримує сторінку поза індексом. Огляд Google crawlers and fetchers пояснює, які агенти Google використовують для різних задач [76]. Заблокований URL усе одно може зʼявитися без опису, якщо на нього посилаються інші сторінки. Для повного виключення з Search потрібні noindex або password protection - robots.txt тут не інструмент.
Тренувальний crawler і search-агент OpenAI [70].
Crawling Anthropic; окремий search crawler [75].
Surfacing/linking (robots.txt) і user-requested fetch (зазвичай ігнорує robots.txt) [74].
Різні задачі Google, включно з AI-функціями [76].
База для Microsoft Copilot та AI-search [71].
Відкритий веб-корпус, що живить багато систем [77].
Блокування «живих» AI-ботів не дорівнює відсутності в їхніх даних. Common Crawl документує CCBot - інфраструктуру відкритих веб-даних, на яку спираються багато AI-систем і дослідницьких проєктів [77]. Рішення щодо CCBot - окреме стратегічне рішення, відмінне від доступу для GPTBot чи ClaudeBot.
Видимість у Microsoft-екосистемі починається з класичних правил. Bing Webmaster Guidelines описують вимоги до якості, crawling, indexing і неприпустимі практики [71]. Через звʼязок Bing із Copilot ці правила лишаються базовим рівнем доступу для відповідних AI-продуктів.
Crawlers і user agents (GPTBot, OAI-SearchBot). developers.openai.com/api/docs/bots
Webmaster Guidelines (якість, crawling).
PerplexityBot / Perplexity-User і robots.txt.
ClaudeBot / Claude-User / Claude-SearchBot і блокування.
Огляд краулерів і fetcher-ів.
Документація CCBot. commoncrawl.org/ccbot
Ні. robots.txt керує доступом краулера, але не видаляє URL із Search: заблокований URL може зʼявитися без опису. Для виключення потрібні noindex або password protection [76].
Ні. Блокування одного «живого» агента не прибирає контент із відкритих корпусів на кшталт Common Crawl, якими користуються інші системи [77].