Vérificateur de crawlers IA

Voyez quels crawlers IA peuvent atteindre votre site, et lesquels sont refoulés.

Robots à tester en direct

C’est gratuit

Ce que l’outil vérifie

Deux choses distinctes décident si un crawler IA atteint votre page, et elles échouent indépendamment l’une de l’autre.

La première est le robots.txt, le portier poli. C’est une demande plutôt qu’un verrou, et tous les agents présents ici ne le respectent pas. La seconde est ce que fait votre serveur quand la requête arrive réellement. C’est la couche du pare-feu, et c’est là que vivent la plupart des blocages accidentels, parce que presque personne ne les met en place volontairement. Une règle écrite pour arrêter les scrapers ne fait pas la différence entre un scraper et PerplexityBot.

Ce vérificateur regarde les deux. Il lit votre robots.txt et détermine ce que chaque robot a le droit de faire, puis récupère la page avec le vrai User-Agent de ce robot et compare la réponse à celle que reçoit un navigateur ordinaire. Quand les deux couches ne sont pas d’accord, vous le découvrez maintenant plutôt que des mois plus tard, quand vous remarquez que rien ne vous cite.

Une chose à dire franchement. Le test part de nos serveurs avec la chaîne User-Agent de chaque robot. Les vrais crawlers arrivent depuis leurs propres plages d’adresses IP, donc un pare-feu qui vérifie les adresses IP peut les traiter différemment. Si vous voyez un blocage ici, il est réel. Un résultat autorisé est un signal fort plutôt qu’une garantie, et les robots habituellement vérifiés par IP sont signalés comme tels dans les résultats.

Les crawlers IA que nous vérifions

Tous les user agents présents ici ne font pas le même travail. Certains collectent des pages pour l’entraînement. Certains construisent l’index derrière la recherche d’un assistant. D’autres n’apparaissent que lorsqu’une personne demande à l’assistant d’ouvrir un lien. Bloquer l’un est une décision différente de bloquer l’autre, et les résultats ne sont pas interchangeables.

User agentOpérateurCe qu’il faitSi vous le bloquez
GPTBotOpenAICollecte des pages pour l’entraînement des modèlesVotre contenu reste hors de l’entraînement
OAI-SearchBotOpenAIConstruit l’index derrière la recherche ChatGPTLa recherche ChatGPT cesse de vous afficher
ChatGPT-UserOpenAIRécupère une page quand quelqu’un demande à ChatGPT de l’ouvrirChatGPT ne peut pas lire un lien collé par un utilisateur
ClaudeBotAnthropicCollecte des pages pour l’entraînement des modèlesVotre contenu reste hors de l’entraînement
Claude-SearchBotAnthropicIndexe des pages pour les résultats de recherche de ClaudeClaude cesse de vous citer dans ses réponses
Claude-UserAnthropicRécupère une page quand quelqu’un demande à Claude de l’ouvrirClaude ne peut pas lire un lien collé par un utilisateur
PerplexityBotPerplexityIndexe des pages pour les réponses de PerplexityPerplexity cesse de vous citer
Perplexity-UserPerplexityRécupère une page en réponse à une questionPerplexity ne peut pas ouvrir une page demandée par un utilisateur
GooglebotGoogleL’index de recherche, qui alimente aussi AI OverviewsVous disparaissez de la recherche Google
BingbotMicrosoftL’index Bing, qui alimente CopilotVous disparaissez de Bing et de Copilot
ApplebotAppleAlimente la recherche dans Siri, Spotlight et SafariLes assistants d’Apple ne vous trouvent plus
Meta-ExternalAgentMetaCollecte des pages pour les modèles de Meta, et indexe directement certains contenusVotre contenu reste hors de l’entraînement de Meta
Meta-WebIndexerMetaIndexe des pages pour les résultats de recherche de Meta AIMeta AI cesse de vous citer et de faire un lien vers vous
DuckAssistBotDuckDuckGoAlimente les réponses de l’assistant de DuckDuckGo, et ne sert pas à l’entraînementDuckAssist cesse d’utiliser vos pages
MistralAI-TrainingMistralCollecte des pages pour l’entraînement des modèlesVotre contenu reste hors de l’entraînement de Mistral
MistralAI-IndexMistralIndexe des pages pour la recherche derrière l’assistant de MistralL’assistant de Mistral cesse de vous afficher
MistralAI-UserMistralRécupère une page quand quelqu’un demande à l’assistant de Mistral de l’ouvrirL’assistant ne peut pas lire un lien collé par un utilisateur
CCBotCommon CrawlConstruit l’archive de crawl ouverte sur laquelle s’entraînent de nombreux modèlesVous êtes absent d’un jeu de données utilisé dans tout le secteur
Google-ExtendedGoogleUne directive robots.txt, pas un crawler. Décide si Google peut utiliser vos pages pour GeminiVos pages restent dans la recherche Google et dans AI Overviews, mais Google ne peut pas les utiliser pour entraîner ou alimenter Gemini
Applebot-ExtendedAppleUne directive robots.txt, pas un crawler. Décide si Apple peut s’entraîner sur vos pagesSiri, Spotlight et Safari continuent d’utiliser vos pages, Apple cesse d’entraîner ses modèles dessus

Entraînement et recherche sont deux décisions distinctes

Bloquer GPTBot tout en autorisant OAI-SearchBot vous garde hors des données d’entraînement et vous garde dans les résultats de recherche de ChatGPT. Anthropic sépare ClaudeBot et Claude-SearchBot de la même façon, Meta sépare Meta-ExternalAgent et Meta-WebIndexer, et Mistral utilise un agent distinct pour l’entraînement, la recherche et les requêtes des utilisateurs. Beaucoup de sites finissent par tout bloquer par accident alors qu’ils voulaient seulement se retirer de l’entraînement.

Les agents qui se terminent par User ne sont pas des crawlers

ChatGPT-User, Claude-User, Perplexity-User et MistralAI-User ne s’activent que lorsque quelqu’un a déjà collé votre lien et demandé à l’assistant de le lire. Les bloquer ne protège rien de l’entraînement. Cela n’arrête rien, sauf la personne qui essayait de lire votre page.

Que les bloquer dans le robots.txt fonctionne ou non dépend de l’opérateur. Anthropic et Mistral respectent le fichier pour ces agents. OpenAI dit que les règles peuvent ne pas s’appliquer, parce que la requête vient d’une personne et non d’un crawl. Perplexity dit que son outil de récupération les ignore généralement. Un blocage qui doit tenir a sa place dans le pare-feu.

Les deux derniers sont des directives, pas des crawlers

Google-Extended et Applebot-Extended n’envoient jamais de requête. Ils se trouvent dans le robots.txt et indiquent à Google et à Apple ce qui peut être fait des pages que leurs crawlers ordinaires ont déjà récupérées. Il n’y a aucun crawler à simuler, donc le vérificateur évalue ces directives uniquement à partir du robots.txt et les signale comme sans requête en direct.

Google-Extended mérite une seconde lecture. Le bloquer ne touche pas à votre classement Google et ne vous retire pas d’AI Overviews, parce que les deux fonctionnent avec Googlebot. Ce qu’il empêche, c’est que Gemini utilise votre contenu.

Apple se rabat sur Googlebot

Si votre robots.txt ne nomme jamais Applebot mais nomme Googlebot, Apple suit les règles de Googlebot. Le rapport le signale sur cette ligne quand cela se produit. C’est bon à savoir, parce qu’un Disallow écrit en pensant à Google s’applique en silence à Siri, Spotlight et Safari aussi, et rien dans votre fichier ne le dit tout haut.

Un user agent est une affirmation, pas une identité

La plupart des opérateurs présents ici disent respecter le robots.txt, avec les exceptions notées plus haut, et n’importe qui peut affirmer n’importe quoi dans une chaîne User-Agent. Si vous avez besoin de certitude plutôt que de coopération, vérifiez par plage d’adresses IP ou par DNS inversé. Les grands opérateurs publient leurs plages d’adresses IP ou les informations nécessaires à la vérification par DNS inversé.

Pourquoi le robots.txt n’est que la moitié de la réponse

Lire le robots.txt vous dit ce que vous avez demandé. Il ne vous montre jamais ce qui s’est réellement passé.

Une protection anti-bots sur un CDN, un limiteur de débit, un blocage par pays ou une page de défi peuvent tous refouler un crawler IA pendant que votre robots.txt continue de l’inviter à entrer. Rien de cela n’est écrit dans le fichier, et la plupart du temps rien de cela n’atteint vos journaux non plus, parce que la requête est coupée avant d’arriver à votre site.

Le schéma est facile à reconnaître une fois qu’on l’a vu. Votre robots.txt autorise GPTBot, et GPTBot reçoit quand même un 403. Quand le robots.txt et la réalité ne sont pas d’accord, c’est le 403 qui est réel.

C’est aussi pour cela qu’une page peut manquer dans les réponses d’un assistant alors que toutes les vérifications techniques du site ne détectent aucun problème. Utilisez notre test de visibilité IA pour voir si les assistants citent réellement votre marque.

Ce que signifie chaque résultat

Le tableau des résultats a deux colonnes qui répondent à des questions différentes, la légende est donc découpée de la même façon. Lire une étiquette de Crawlabilité avec l’échelle du robots.txt est le moyen le plus rapide de mal comprendre tout le rapport.

La colonne robots.txt : ce que votre fichier autorise

RésultatCe que cela signifie
AutoriséVotre robots.txt laisse ce robot explorer la page que vous avez testée
BloquéUne règle du robots.txt ferme cette page à ce robot. La ligne indique quelle règle en est la cause, et la solution se trouve dans le fichier
Partiellement bloquéLa page que vous avez testée est ouverte à ce robot, mais le robots.txt contient des règles qui le visent ailleurs sur le site. La ligne indique quelles règles et de quel groupe elles viennent, pour que vous puissiez vérifier que vous vouliez bien les garder fermées

La colonne Crawlabilité : ce que votre serveur a réellement fait

RésultatCe que cela signifie
Explorable (avec le statut HTTP)La requête du robot est passée et votre serveur a répondu normalement
Bloqué (avec le statut HTTP)La requête a été refusée. Le robots.txt n’en est pas la cause, regardez donc les règles de votre pare-feu, de votre WAF ou de votre CDN
À vérifierUn robot normalement vérifié par adresse IP a été refusé. Notre test ne vient pas de la plage d’adresses IP de ce robot, donc il peut s’agir de votre pare-feu qui fonctionne correctement plutôt que d’un problème
Erreur (avec le statut HTTP)La page a renvoyé une erreur plutôt qu’un blocage. Un 404 signifie généralement que l’URL est fausse, un 500 que quelque chose sur votre site ne fonctionne pas. Ni l’un ni l’autre n’est un problème de crawler
Aucune réponseRien n’est revenu du tout. Un délai dépassé ou une connexion coupée, ce qui pointe vers le réseau ou vers un blocage très agressif
Pas de requête en directUne directive robots.txt plutôt qu’un crawler, il n’y a donc rien à qui envoyer une requête. Le verdict du robots.txt est toute la réponse
Non testéVous n’avez pas sélectionné ce robot, aucune requête en direct n’a donc été envoyée. Son verdict robots.txt reste valable

Comment débloquer un crawler

Une règle dans le robots.txt. Retirez le Disallow, ou ajoutez un Allow plus spécifique pour ce user agent. La règle correspondante la plus spécifique l’emporte, donc un Allow explicite pour un robot bat un Disallow: / général visant tout le monde.

Une règle de pare-feu ou de CDN. Rien dans les fichiers de votre site ne réglera celle-là. Sur Cloudflare, elle se trouve dans la gestion des bots. Chez d’autres hébergeurs, cherchez sous WAF ou protection anti-bots. Autorisez le user agent à cet endroit, et vérifiez par plage d’adresses IP si vous voulez vous prémunir contre les imposteurs.

Une page de défi. Exemptez le user agent du défi. Un crawler ne peut pas le résoudre.

Un noindex dans une balise meta ou un en-tête X-Robots-Tag. Le crawler peut atteindre la page et on lui a dit de ne pas la garder. Il vaut la peine de confirmer que c’était voulu, parce qu’un plugin ou un réglage de préproduction oublié fait cela en silence.

Les mêmes étapes fonctionnent à l’envers. Si vous voulez bloquer GPTBot ou tout autre crawler IA, un Disallow pour ce user agent dans le robots.txt est la manière polie, et une règle de pare-feu est celle qui l’impose vraiment.

Questions fréquentes

Qu’est-ce que la crawlabilité IA ?

La possibilité pour les crawlers IA d’atteindre et de lire vos pages. Cela couvre le robots.txt et tout ce qui se trouve entre un robot et votre contenu, et c’est la première condition de tout le reste. La crawlabilité LLM est la même idée sous un autre nom.

Les crawlers IA respectent-ils le robots.txt ?

Pour les crawlers qui récupèrent des pages automatiquement, les grands opérateurs disent que oui. Les agents qui ouvrent une page parce qu’une personne l’a demandé sont un autre cas, et OpenAI comme Perplexity disent que le robots.txt ne les arrête pas forcément. Aucun mécanisme ne force le respect de ces règles. Le robots.txt est une demande, pas un verrou.

Puis-je bloquer l’entraînement des IA tout en restant dans les résultats de recherche IA ?

Oui, et c’est ce que la plupart des propriétaires de sites veulent vraiment. Bloquez GPTBot et ClaudeBot pour rester hors de l’entraînement, et autorisez OAI-SearchBot et Claude-SearchBot pour que les assistants puissent toujours vous trouver et vous citer.

Bloquer les crawlers IA nuit-il à mon SEO ?

Non. GPTBot, ClaudeBot et les autres crawlers IA n’ont rien à voir avec le classement Google, et les bloquer ne change rien à votre position dans les résultats de recherche. Bloquer Googlebot est une tout autre affaire.

Pourquoi mon site passe-t-il les vérifications du robots.txt tout en étant bloqué ?

Parce que le robots.txt n’est que la première couche. Une règle de pare-feu, de WAF ou de CDN peut refuser la requête avant qu’elle n’atteigne votre serveur, et ce blocage est invisible aussi bien dans votre robots.txt que dans vos journaux.

GPTBot est-il la même chose qu’OAI-SearchBot ?

Non. GPTBot collecte des pages pour l’entraînement. OAI-SearchBot construit l’index derrière la recherche ChatGPT. Vous pouvez autoriser l’un et bloquer l’autre.

Pourquoi ChatGPT ne cite-t-il pas mon site ou ma marque ?

Être accessible est la première condition, alors commencez par vérifier qu’OAI-SearchBot n’est pas bloqué. Si l’accès est bon, la raison est généralement que ChatGPT trouve la réponse ailleurs et n’a aucune raison de venir vous chercher.

Comment faire apparaître mon site dans ChatGPT ?

Assurez-vous que les crawlers peuvent vous lire, puis travaillez à mériter la citation. Les assistants s’appuient sur des sources qu’ils ont déjà vues citées ailleurs, donc les mentions sur des sites auxquels ils font déjà confiance comptent plus que tout ce qui se trouve sur vos propres pages.

Être accessible est la première question. Que les assistants vous nomment vraiment en est une autre.

Vérifiez votre visibilité IA