Проверка ИИ-краулеров

Узнайте, какие ИИ-краулеры могут попасть на ваш сайт, а какие получают отказ.

Боты для живой проверки

Бесплатно

Что проверяет инструмент

Попадёт ли ИИ-краулер на вашу страницу, решают две отдельные вещи, и отказывают они независимо друг от друга.

Сначала идёт robots.txt, вежливый вахтёр. Это просьба, а не замок, и не каждый агент из этого списка её соблюдает. Затем идёт то, что делает ваш сервер, когда запрос действительно приходит. Это слой файрвола, и именно там живёт большинство случайных блокировок, потому что почти никто не ставит их намеренно. Правило, написанное против скраперов, не отличит скрапер от PerplexityBot.

Этот инструмент проверяет оба слоя. Он читает ваш robots.txt и вычисляет, что разрешено каждому боту, затем загружает страницу с настоящим User-Agent этого бота и сравнивает ответ с тем, что получает обычный браузер. Когда два слоя расходятся, вы узнаёте об этом сейчас, а не через несколько месяцев, когда заметите, что вас никто не цитирует.

Одну вещь нужно сказать прямо. Проверка идёт с наших серверов со строкой User-Agent каждого бота. Настоящие краулеры приходят со своих диапазонов IP, поэтому файрвол, который сверяет IP-адреса, может обращаться с ними иначе. Если вы видите здесь блокировку, она настоящая. Результат «разрешён» стоит читать как сильный сигнал, а не гарантию, и боты, которых обычно проверяют по IP, отмечены в результатах соответствующим образом.

ИИ-краулеры, которые мы проверяем

Не каждый user agent из этого списка делает одно и то же. Одни собирают страницы для обучения. Другие строят индекс, на котором работает поиск ассистента. Третьи появляются только тогда, когда человек просит ассистента открыть ссылку. Блокировка одного и блокировка другого требуют разных решений, и результаты не взаимозаменяемы.

User agentОператорЧто делаетЕсли его заблокировать
GPTBotOpenAIСобирает страницы для обучения моделейВаш контент не попадает в обучение
OAI-SearchBotOpenAIСтроит индекс, на котором работает поиск ChatGPTПоиск ChatGPT перестаёт вас показывать
ChatGPT-UserOpenAIЗагружает страницу, когда кто-то просит ChatGPT её открытьChatGPT не может прочитать ссылку, которую вставил пользователь
ClaudeBotAnthropicСобирает страницы для обучения моделейВаш контент не попадает в обучение
Claude-SearchBotAnthropicИндексирует страницы для результатов поиска ClaudeClaude перестаёт цитировать вас в ответах
Claude-UserAnthropicЗагружает страницу, когда кто-то просит Claude её открытьClaude не может прочитать ссылку, которую вставил пользователь
PerplexityBotPerplexityИндексирует страницы для ответов PerplexityPerplexity перестаёт вас цитировать
Perplexity-UserPerplexityЗагружает страницу в ответ на вопросPerplexity не может открыть страницу, о которой спросил пользователь
GooglebotGoogleПоисковый индекс, который также питает AI OverviewsВы исчезаете из поиска Google
BingbotMicrosoftИндекс Bing, который питает CopilotВы исчезаете из Bing и из Copilot
ApplebotAppleОбеспечивает поиск в Siri, Spotlight и SafariАссистенты Apple перестают вас находить
Meta-ExternalAgentMetaСобирает страницы для моделей Meta и часть контента индексирует напрямуюВаш контент не попадает в обучение Meta
Meta-WebIndexerMetaИндексирует страницы для результатов поиска Meta AIMeta AI перестаёт цитировать вас и ссылаться на вас
DuckAssistBotDuckDuckGoПитает ответы ассистента DuckDuckGo и не используется для обученияDuckAssist перестаёт использовать ваши страницы
MistralAI-TrainingMistralСобирает страницы для обучения моделейВаш контент не попадает в обучение Mistral
MistralAI-IndexMistralИндексирует страницы для поиска, на котором работает ассистент MistralАссистент Mistral перестаёт вас показывать
MistralAI-UserMistralЗагружает страницу, когда кто-то просит ассистента Mistral её открытьАссистент не может прочитать ссылку, которую вставил пользователь
CCBotCommon CrawlСтроит открытый архив обхода, на котором обучаются многие моделиВас нет в наборе данных, который используют по всей отрасли
Google-ExtendedGoogleДиректива robots.txt, а не краулер. Решает, может ли Google использовать ваши страницы для GeminiВаши страницы остаются в поиске Google и в AI Overviews, но Google не может использовать их для обучения Gemini или в качестве источников для его ответов
Applebot-ExtendedAppleДиректива robots.txt, а не краулер. Решает, может ли Apple обучаться на ваших страницахSiri, Spotlight и Safari продолжают использовать ваши страницы, Apple перестаёт обучать на них свои модели

Обучение и поиск решаются отдельно

Блокировка GPTBot при разрешённом OAI-SearchBot держит вас вне обучающих данных и внутри результатов поиска ChatGPT. Anthropic так же разделяет ClaudeBot и Claude-SearchBot, Meta разделяет Meta-ExternalAgent и Meta-WebIndexer, а у Mistral отдельный агент для обучения, для поиска и для запросов пользователей. Множество сайтов случайно блокируют всё, хотя хотели только выйти из обучения.

Агенты с окончанием User краулерами не являются

ChatGPT-User, Claude-User, Perplexity-User и MistralAI-User срабатывают только тогда, когда кто-то уже вставил вашу ссылку и попросил ассистента её прочитать. Их блокировка ничего не защищает от обучения. Она не останавливает никого, кроме человека, который пытался прочитать вашу страницу.

Работает ли вообще их блокировка в robots.txt, зависит от оператора. Anthropic и Mistral соблюдают файл для этих агентов. OpenAI говорит, что правила могут не применяться, потому что запрос пришёл от человека, а не от обхода. Perplexity говорит, что её загрузчик обычно их игнорирует. Блокировка, которая должна держаться, ставится в файрволе.

Последние два пункта не краулеры, а директивы

Google-Extended и Applebot-Extended никогда не отправляют запросов. Они стоят в robots.txt и говорят Google и Apple, что можно делать со страницами, которые их обычные краулеры уже загрузили. Здесь нет краулера, запрос которого можно имитировать, поэтому инструмент оценивает эти директивы только по robots.txt и помечает их как «Без живого запроса».

Google-Extended стоит перечитать дважды. Его блокировка не трогает ваши позиции в Google и не убирает вас из AI Overviews, потому что и то и другое работает на Googlebot. Она запрещает только использование вашего контента в Gemini.

Apple следует правилам для Googlebot

Если ваш robots.txt нигде не называет Applebot, но называет Googlebot, Apple следует правилам для Googlebot. Отчёт сообщает об этом в соответствующей строке, когда так происходит. Об этом стоит знать, потому что Disallow, написанный с мыслью о Google, тихо распространяется и на Siri, Spotlight и Safari, а в вашем файле об этом не сказано ни слова.

User agent только называет имя, но не подтверждает подлинность

Большинство операторов из этого списка говорят, что соблюдают robots.txt, с оговорками выше, а в строке User-Agent кто угодно может заявить что угодно. Если вам нужна уверенность, а не добрая воля, проверяйте по диапазону IP или обратному DNS. Крупные операторы публикуют свои диапазоны.

Почему robots.txt даёт только половину ответа

Чтение robots.txt говорит вам, о чём вы просили. Оно никогда не показывает, что произошло на самом деле.

Защита от ботов на CDN, ограничитель запросов, блокировка по стране или страница проверки могут отклонить запрос ИИ-краулера, пока ваш robots.txt по-прежнему приглашает его войти. Ничего из этого в файле не написано, и чаще всего ничего из этого не доходит и до ваших логов, потому что запрос обрывается до того, как дойдёт до вашего сайта.

Эту картину легко узнать, увидев один раз. Ваш robots.txt разрешает GPTBot, а GPTBot всё равно получает 403. Когда robots.txt и реальность расходятся, верить нужно 403.

Поэтому же страница может отсутствовать в ответах ассистента, хотя все технические проверки сайта проходят без ошибок. Проверьте видимость в ИИ, чтобы узнать, упоминают ли ассистенты ваш бренд на самом деле.

Что означает каждый результат

В таблице результатов две колонки, и они отвечают на разные вопросы, поэтому легенда разделена так же. Если читать метку из колонки «Живой доступ» по шкале robots.txt, весь отчёт легко понять неправильно.

Колонка robots.txt: что разрешает ваш файл

РезультатЧто означает
РазрешёнВаш robots.txt позволяет этому боту обходить проверенную страницу
ЗаблокированПравило в robots.txt закрывает эту страницу для этого бота. В строке видно, какое правило это сделало, и исправление находится в файле
Частично заблокированПроверенная страница открыта для этого бота, но в robots.txt есть правила, нацеленные на него в других частях сайта. В строке видно, какие это правила и из чьей группы они взяты, чтобы вы могли убедиться, что хотели держать их закрытыми

Колонка «Живой доступ»: что на самом деле сделал ваш сервер

РезультатЧто означает
Доступен (со статусом HTTP)Запрос бота прошёл, и ваш сервер ответил нормально
Заблокирован (со статусом HTTP)Запрос отклонён. robots.txt здесь не причина, так что смотрите правила файрвола, WAF или CDN
ПроверитьБот, которого обычно проверяют по IP-адресу, получил отказ. Наша проверка идёт не с собственного диапазона IP этого бота, так что это может быть правильно работающий файрвол, а не проблема
Ошибка (со статусом HTTP)Страница вернула ошибку, а не блокировку. 404 обычно означает неверный URL, а 500 говорит, что что-то на вашем сайте не работает. Ни то ни другое не относится к краулерам
Нет ответаНе вернулось вообще ничего. Тайм-аут или обрыв соединения, что указывает на сеть или на очень агрессивную блокировку
Без живого запросаДиректива robots.txt, а не краулер, так что отправлять запрос некому. Вердикт по robots.txt и есть весь ответ
Не проверялсяВы не выбрали этого бота, поэтому живой запрос не отправлялся. Его вердикт по robots.txt остаётся в силе

Как разблокировать краулер

Правило в robots.txt. Удалите Disallow или добавьте более конкретное Allow для этого user agent. Побеждает самое конкретное подходящее правило, поэтому явное Allow для одного бота сильнее общего Disallow: /, нацеленного на всех.

Правило файрвола или CDN. Ничто в файлах вашего сайта это не исправит. В Cloudflare это находится в управлении ботами. У других провайдеров ищите в разделе WAF или защиты от ботов. Разрешите там user agent, а если хотите защититься от подделок, проверяйте по диапазону IP.

Страница проверки. Исключите user agent из проверки. Краулер не может её пройти.

noindex в метатеге или заголовок X-Robots-Tag. Краулер может попасть на страницу, но ему велено её не сохранять. Стоит убедиться, что так и было задумано, потому что плагин или забытая настройка тестового окружения делают это молча.

Те же шаги работают и в обратную сторону. Если вы хотите заблокировать GPTBot или любой другой ИИ-краулер, Disallow для этого user agent в robots.txt будет вежливым способом, а правило файрвола действительно обеспечит блокировку.

Частые вопросы

Что такое доступность сайта для ИИ-краулеров?

Могут ли ИИ-краулеры попасть на ваши страницы и прочитать их. Это и robots.txt, и всё остальное, что стоит между ботом и вашим контентом, и это первое условие для всего прочего. По-английски это AI crawlability, а LLM crawlability означает то же самое под другим названием.

Соблюдают ли ИИ-краулеры robots.txt?

Для краулеров, которые загружают страницы автоматически, крупные операторы говорят, что да. Агенты, которые открывают страницу по просьбе человека, устроены иначе. OpenAI и Perplexity говорят, что robots.txt может их не остановить. Нет механизма, который принуждал бы соблюдать эти правила. robots.txt остаётся просьбой, а не замком.

Можно ли запретить обучение ИИ, но остаться в результатах ИИ-поиска?

Да, и именно этого на самом деле хочет большинство владельцев сайтов. Заблокируйте GPTBot и ClaudeBot, чтобы не попадать в обучение, и разрешите OAI-SearchBot и Claude-SearchBot, чтобы ассистенты по-прежнему могли вас находить и цитировать.

Вредит ли блокировка ИИ-краулеров моему SEO?

Нет. GPTBot, ClaudeBot и остальные ИИ-краулеры никак не связаны с позициями в Google, и их блокировка не влияет на ваше место в поиске. С блокировкой Googlebot всё иначе.

Почему мой сайт проходит проверку robots.txt, но всё равно блокируется?

Потому что robots.txt закрывает только первый слой. Правило файрвола, WAF или CDN может отклонить запрос до того, как он дойдёт до вашего сервера, и такая блокировка не видна ни в robots.txt, ни в ваших логах.

GPTBot и OAI-SearchBot одно и то же?

Нет. GPTBot собирает страницы для обучения. OAI-SearchBot строит индекс, на котором работает поиск ChatGPT. Одного можно разрешить, а другого заблокировать.

Почему ChatGPT не цитирует мой сайт или бренд?

Доступность нужна в первую очередь, поэтому сначала убедитесь, что OAI-SearchBot не заблокирован. Если с доступом всё в порядке, причина обычно в том, что ChatGPT находит ответ в другом месте и у него нет повода обращаться к вам.

Как сделать, чтобы мой сайт появлялся в ChatGPT?

Убедитесь, что краулеры могут вас прочитать, а затем работайте над тем, чтобы заслуживать цитирования. Ассистенты опираются на источники, которые уже видели процитированными в других местах, поэтому упоминания на сайтах, которым они уже доверяют, значат больше, чем что угодно на ваших собственных страницах.

Доступность только первый вопрос. Называют ли вас ассистенты на самом деле, вопрос уже другой.

Проверьте свою видимость в ИИ