Проверка ИИ-краулеров
Узнайте, какие ИИ-краулеры могут попасть на ваш сайт, а какие получают отказ.
| Бот | robots.txt | Живой доступ |
|---|
robots.txt как он был загружен
Что проверяет инструмент
Попадёт ли ИИ-краулер на вашу страницу, решают две отдельные вещи, и отказывают они независимо друг от друга.
Сначала идёт robots.txt, вежливый вахтёр. Это просьба, а не замок, и не каждый агент из этого списка её соблюдает. Затем идёт то, что делает ваш сервер, когда запрос действительно приходит. Это слой файрвола, и именно там живёт большинство случайных блокировок, потому что почти никто не ставит их намеренно. Правило, написанное против скраперов, не отличит скрапер от PerplexityBot.
Этот инструмент проверяет оба слоя. Он читает ваш robots.txt и вычисляет, что разрешено каждому боту, затем загружает страницу с настоящим User-Agent этого бота и сравнивает ответ с тем, что получает обычный браузер. Когда два слоя расходятся, вы узнаёте об этом сейчас, а не через несколько месяцев, когда заметите, что вас никто не цитирует.
Одну вещь нужно сказать прямо. Проверка идёт с наших серверов со строкой User-Agent каждого бота. Настоящие краулеры приходят со своих диапазонов IP, поэтому файрвол, который сверяет IP-адреса, может обращаться с ними иначе. Если вы видите здесь блокировку, она настоящая. Результат «разрешён» стоит читать как сильный сигнал, а не гарантию, и боты, которых обычно проверяют по IP, отмечены в результатах соответствующим образом.
ИИ-краулеры, которые мы проверяем
Не каждый user agent из этого списка делает одно и то же. Одни собирают страницы для обучения. Другие строят индекс, на котором работает поиск ассистента. Третьи появляются только тогда, когда человек просит ассистента открыть ссылку. Блокировка одного и блокировка другого требуют разных решений, и результаты не взаимозаменяемы.
| User agent | Оператор | Что делает | Если его заблокировать |
|---|---|---|---|
GPTBot | OpenAI | Собирает страницы для обучения моделей | Ваш контент не попадает в обучение |
OAI-SearchBot | OpenAI | Строит индекс, на котором работает поиск ChatGPT | Поиск ChatGPT перестаёт вас показывать |
ChatGPT-User | OpenAI | Загружает страницу, когда кто-то просит ChatGPT её открыть | ChatGPT не может прочитать ссылку, которую вставил пользователь |
ClaudeBot | Anthropic | Собирает страницы для обучения моделей | Ваш контент не попадает в обучение |
Claude-SearchBot | Anthropic | Индексирует страницы для результатов поиска Claude | Claude перестаёт цитировать вас в ответах |
Claude-User | Anthropic | Загружает страницу, когда кто-то просит Claude её открыть | Claude не может прочитать ссылку, которую вставил пользователь |
PerplexityBot | Perplexity | Индексирует страницы для ответов Perplexity | Perplexity перестаёт вас цитировать |
Perplexity-User | Perplexity | Загружает страницу в ответ на вопрос | Perplexity не может открыть страницу, о которой спросил пользователь |
Googlebot | Поисковый индекс, который также питает AI Overviews | Вы исчезаете из поиска Google | |
Bingbot | Microsoft | Индекс Bing, который питает Copilot | Вы исчезаете из Bing и из Copilot |
Applebot | Apple | Обеспечивает поиск в Siri, Spotlight и Safari | Ассистенты Apple перестают вас находить |
Meta-ExternalAgent | Meta | Собирает страницы для моделей Meta и часть контента индексирует напрямую | Ваш контент не попадает в обучение Meta |
Meta-WebIndexer | Meta | Индексирует страницы для результатов поиска Meta AI | Meta AI перестаёт цитировать вас и ссылаться на вас |
DuckAssistBot | DuckDuckGo | Питает ответы ассистента DuckDuckGo и не используется для обучения | DuckAssist перестаёт использовать ваши страницы |
MistralAI-Training | Mistral | Собирает страницы для обучения моделей | Ваш контент не попадает в обучение Mistral |
MistralAI-Index | Mistral | Индексирует страницы для поиска, на котором работает ассистент Mistral | Ассистент Mistral перестаёт вас показывать |
MistralAI-User | Mistral | Загружает страницу, когда кто-то просит ассистента Mistral её открыть | Ассистент не может прочитать ссылку, которую вставил пользователь |
CCBot | Common Crawl | Строит открытый архив обхода, на котором обучаются многие модели | Вас нет в наборе данных, который используют по всей отрасли |
Google-Extended | Директива robots.txt, а не краулер. Решает, может ли Google использовать ваши страницы для Gemini | Ваши страницы остаются в поиске Google и в AI Overviews, но Google не может использовать их для обучения Gemini или в качестве источников для его ответов | |
Applebot-Extended | Apple | Директива robots.txt, а не краулер. Решает, может ли Apple обучаться на ваших страницах | Siri, Spotlight и Safari продолжают использовать ваши страницы, Apple перестаёт обучать на них свои модели |
Обучение и поиск решаются отдельно
Блокировка GPTBot при разрешённом OAI-SearchBot держит вас вне обучающих данных и внутри результатов поиска ChatGPT. Anthropic так же разделяет ClaudeBot и Claude-SearchBot, Meta разделяет Meta-ExternalAgent и Meta-WebIndexer, а у Mistral отдельный агент для обучения, для поиска и для запросов пользователей. Множество сайтов случайно блокируют всё, хотя хотели только выйти из обучения.
Агенты с окончанием User краулерами не являются
ChatGPT-User, Claude-User, Perplexity-User и MistralAI-User срабатывают только тогда, когда кто-то уже вставил вашу ссылку и попросил ассистента её прочитать. Их блокировка ничего не защищает от обучения. Она не останавливает никого, кроме человека, который пытался прочитать вашу страницу.
Работает ли вообще их блокировка в robots.txt, зависит от оператора. Anthropic и Mistral соблюдают файл для этих агентов. OpenAI говорит, что правила могут не применяться, потому что запрос пришёл от человека, а не от обхода. Perplexity говорит, что её загрузчик обычно их игнорирует. Блокировка, которая должна держаться, ставится в файрволе.
Последние два пункта не краулеры, а директивы
Google-Extended и Applebot-Extended никогда не отправляют запросов. Они стоят в robots.txt и говорят Google и Apple, что можно делать со страницами, которые их обычные краулеры уже загрузили. Здесь нет краулера, запрос которого можно имитировать, поэтому инструмент оценивает эти директивы только по robots.txt и помечает их как «Без живого запроса».
Google-Extended стоит перечитать дважды. Его блокировка не трогает ваши позиции в Google и не убирает вас из AI Overviews, потому что и то и другое работает на Googlebot. Она запрещает только использование вашего контента в Gemini.
Apple следует правилам для Googlebot
Если ваш robots.txt нигде не называет Applebot, но называет Googlebot, Apple следует правилам для Googlebot. Отчёт сообщает об этом в соответствующей строке, когда так происходит. Об этом стоит знать, потому что Disallow, написанный с мыслью о Google, тихо распространяется и на Siri, Spotlight и Safari, а в вашем файле об этом не сказано ни слова.
User agent только называет имя, но не подтверждает подлинность
Большинство операторов из этого списка говорят, что соблюдают robots.txt, с оговорками выше, а в строке User-Agent кто угодно может заявить что угодно. Если вам нужна уверенность, а не добрая воля, проверяйте по диапазону IP или обратному DNS. Крупные операторы публикуют свои диапазоны.
Почему robots.txt даёт только половину ответа
Чтение robots.txt говорит вам, о чём вы просили. Оно никогда не показывает, что произошло на самом деле.
Защита от ботов на CDN, ограничитель запросов, блокировка по стране или страница проверки могут отклонить запрос ИИ-краулера, пока ваш robots.txt по-прежнему приглашает его войти. Ничего из этого в файле не написано, и чаще всего ничего из этого не доходит и до ваших логов, потому что запрос обрывается до того, как дойдёт до вашего сайта.
Эту картину легко узнать, увидев один раз. Ваш robots.txt разрешает GPTBot, а GPTBot всё равно получает 403. Когда robots.txt и реальность расходятся, верить нужно 403.
Поэтому же страница может отсутствовать в ответах ассистента, хотя все технические проверки сайта проходят без ошибок. Проверьте видимость в ИИ, чтобы узнать, упоминают ли ассистенты ваш бренд на самом деле.
Что означает каждый результат
В таблице результатов две колонки, и они отвечают на разные вопросы, поэтому легенда разделена так же. Если читать метку из колонки «Живой доступ» по шкале robots.txt, весь отчёт легко понять неправильно.
Колонка robots.txt: что разрешает ваш файл
| Результат | Что означает |
|---|---|
| Разрешён | Ваш robots.txt позволяет этому боту обходить проверенную страницу |
| Заблокирован | Правило в robots.txt закрывает эту страницу для этого бота. В строке видно, какое правило это сделало, и исправление находится в файле |
| Частично заблокирован | Проверенная страница открыта для этого бота, но в robots.txt есть правила, нацеленные на него в других частях сайта. В строке видно, какие это правила и из чьей группы они взяты, чтобы вы могли убедиться, что хотели держать их закрытыми |
Колонка «Живой доступ»: что на самом деле сделал ваш сервер
| Результат | Что означает |
|---|---|
| Доступен (со статусом HTTP) | Запрос бота прошёл, и ваш сервер ответил нормально |
| Заблокирован (со статусом HTTP) | Запрос отклонён. robots.txt здесь не причина, так что смотрите правила файрвола, WAF или CDN |
| Проверить | Бот, которого обычно проверяют по IP-адресу, получил отказ. Наша проверка идёт не с собственного диапазона IP этого бота, так что это может быть правильно работающий файрвол, а не проблема |
| Ошибка (со статусом HTTP) | Страница вернула ошибку, а не блокировку. 404 обычно означает неверный URL, а 500 говорит, что что-то на вашем сайте не работает. Ни то ни другое не относится к краулерам |
| Нет ответа | Не вернулось вообще ничего. Тайм-аут или обрыв соединения, что указывает на сеть или на очень агрессивную блокировку |
| Без живого запроса | Директива robots.txt, а не краулер, так что отправлять запрос некому. Вердикт по robots.txt и есть весь ответ |
| Не проверялся | Вы не выбрали этого бота, поэтому живой запрос не отправлялся. Его вердикт по robots.txt остаётся в силе |
Как разблокировать краулер
Правило в robots.txt. Удалите Disallow или добавьте более конкретное Allow для этого user agent. Побеждает самое конкретное подходящее правило, поэтому явное Allow для одного бота сильнее общего Disallow: /, нацеленного на всех.
Правило файрвола или CDN. Ничто в файлах вашего сайта это не исправит. В Cloudflare это находится в управлении ботами. У других провайдеров ищите в разделе WAF или защиты от ботов. Разрешите там user agent, а если хотите защититься от подделок, проверяйте по диапазону IP.
Страница проверки. Исключите user agent из проверки. Краулер не может её пройти.
noindex в метатеге или заголовок X-Robots-Tag. Краулер может попасть на страницу, но ему велено её не сохранять. Стоит убедиться, что так и было задумано, потому что плагин или забытая настройка тестового окружения делают это молча.
Те же шаги работают и в обратную сторону. Если вы хотите заблокировать GPTBot или любой другой ИИ-краулер, Disallow для этого user agent в robots.txt будет вежливым способом, а правило файрвола действительно обеспечит блокировку.
Частые вопросы
Что такое доступность сайта для ИИ-краулеров?
Могут ли ИИ-краулеры попасть на ваши страницы и прочитать их. Это и robots.txt, и всё остальное, что стоит между ботом и вашим контентом, и это первое условие для всего прочего. По-английски это AI crawlability, а LLM crawlability означает то же самое под другим названием.
Соблюдают ли ИИ-краулеры robots.txt?
Для краулеров, которые загружают страницы автоматически, крупные операторы говорят, что да. Агенты, которые открывают страницу по просьбе человека, устроены иначе. OpenAI и Perplexity говорят, что robots.txt может их не остановить. Нет механизма, который принуждал бы соблюдать эти правила. robots.txt остаётся просьбой, а не замком.
Можно ли запретить обучение ИИ, но остаться в результатах ИИ-поиска?
Да, и именно этого на самом деле хочет большинство владельцев сайтов. Заблокируйте GPTBot и ClaudeBot, чтобы не попадать в обучение, и разрешите OAI-SearchBot и Claude-SearchBot, чтобы ассистенты по-прежнему могли вас находить и цитировать.
Вредит ли блокировка ИИ-краулеров моему SEO?
Нет. GPTBot, ClaudeBot и остальные ИИ-краулеры никак не связаны с позициями в Google, и их блокировка не влияет на ваше место в поиске. С блокировкой Googlebot всё иначе.
Почему мой сайт проходит проверку robots.txt, но всё равно блокируется?
Потому что robots.txt закрывает только первый слой. Правило файрвола, WAF или CDN может отклонить запрос до того, как он дойдёт до вашего сервера, и такая блокировка не видна ни в robots.txt, ни в ваших логах.
GPTBot и OAI-SearchBot одно и то же?
Нет. GPTBot собирает страницы для обучения. OAI-SearchBot строит индекс, на котором работает поиск ChatGPT. Одного можно разрешить, а другого заблокировать.
Почему ChatGPT не цитирует мой сайт или бренд?
Доступность нужна в первую очередь, поэтому сначала убедитесь, что OAI-SearchBot не заблокирован. Если с доступом всё в порядке, причина обычно в том, что ChatGPT находит ответ в другом месте и у него нет повода обращаться к вам.
Как сделать, чтобы мой сайт появлялся в ChatGPT?
Убедитесь, что краулеры могут вас прочитать, а затем работайте над тем, чтобы заслуживать цитирования. Ассистенты опираются на источники, которые уже видели процитированными в других местах, поэтому упоминания на сайтах, которым они уже доверяют, значат больше, чем что угодно на ваших собственных страницах.
Доступность только первый вопрос. Называют ли вас ассистенты на самом деле, вопрос уже другой.